在大型平台上,要制定一套让所有人都认同的审核、垃圾信息、欺诈和色情内容政策是不可能的。大卫·特纳制作了一个简单的游戏来展示即使是在微不足道的情况下,这有多困难,即公园里禁止车辆。如果你还没玩过,我建议你在继续阅读本文之前先玩一下。

这个网站背后的想法是,要让人们就平台应适用的审核规则达成一致非常困难。即使你举一个更简单的例子,比如根据一条规则和解释规则的一些说明,公园里应该允许哪些车辆,然后问几个小问题,人们也无法达成一致。我自己做这个调查时,第一个反应是这些问题并非特意刁钻,而且戴夫如果想增加难度,本可以问很多边缘案例。然而,尽管调查并非特别具有挑战性,但问题并未获得广泛共识。调查中的评论也揭示了规则的另一个问题:达成一致比人们想象的要难得多。如果你在lobsters、HN、reddit等平台阅读关于规则解释或审核的评论,当人们提出解决方案时,绝大多数人会提出一些任何做过审核或关注过审核运作方式的人都知道行不通的建议,这相当于审核界的“我周末就能搞定”1。当然,我们在戴夫的游戏中也能看到这一点。HN上最热门的评论、最受认同的评论,以及其他地方非常普遍的观点是2

我着迷于我的结论与作者意图完全相反。

对我来说,所有问题的答案都一目了然。是的,你可以从学术角度质疑轨道空间站是否算车辆、是否在公园里,但标志的明显意图再清楚不过了。汽车/卡车/摩托车不允许进入,显然执行任务的警车、救护车和消防车不必遵守这个标志。

所以,如果这应该是一个内容审核规则难以遵循的例子,那它恰恰达到了相反的效果。

有人赞同地回复道:

完全正确。答案中有明显的多数意见。

完成调查后,你会得到一张图表,显示每个问题有多少人回答“是”和“否”——这就是“明确多数”的来源。首先,我认为说存在“明确多数”并不正确。但即使假设存在,也没有理由认为多数存在就意味着大多数人同意你的观点,哪怕你在每个投票中都站在多数方。事实上,考虑到每个问题的多数图表看起来如此“波动”,如果每个问题都处于多数方就意味着大多数人同意你,或者存在一套大多数人都认同的立场,那将是极其罕见的。虽然你可以构造一个人为的数据集让这种情况成立,但在自然数据集中,这几乎不可能发生。

如果你查看数据(网站上没有提供,但当我询问时,Dave 很乐意转发给我),截至我提取数据时,不存在一套大多数用户都认同的答案,而且差距相当大。我是在将链接发布到 HN 后不久提取这些数据的,当时绝大多数受访者是 HN 读者,他们比普通人群更同质化。尽管这些因素使得寻找共识更容易,但最受欢迎的答案集也只被 11.7% 的人选择。这就是那位最高赞评论者所说的“显而易见”的立场,但它实际上是一个少数派立场——不仅因为只有 11.7% 的人同意、88.3% 的人反对,而且几乎没有人持有与这个所谓“显而易见”的立场仅有微小分歧的观点。第二和第三常见的立场分别占 8.5% 和 6.5% 的选票,它们彼此相似,仅在“作为纪念物的一部分、无法正常使用的二战坦克是否违反规则”这一点上存在分歧。除此之外,第四、第五、第六和第七受欢迎的立场各占约 1% 的人支持,而所有更不受欢迎的立场支持率均低于 1%,并且从那里开始迅速下降。因此,27% 的人与超过 1% 的其他用户意见一致(中位数用户与 0.16% 的其他用户意见一致)。下图展示了这一情况。观点按从最受欢迎到最不受欢迎排序,最受欢迎的位于左侧。由于观点共识度极低,线性尺度图看起来就像几个高于零的点,后面跟着一堆零,因此使用了对数尺度。

说明上一段的图表

另一种解读这些数据的方式是:36902人对公园里什么算作车辆发表了意见,最终产生了9432种不同的意见,平均每种独特意见约有3.9人支持。也就是说,用户间的平均共识度约为0.01%。虽然平均数往往被过度使用,但在这里,平均数作为衡量共识水平的概括是有效的,因为尽管有极少数意见的共识度远高于平均的0.01%,但为了“维持”这个平均值,必须有大量用户与其他用户的共识度更低来平衡。如果实际共识度很高,却出现低平均共识度,除非有更高的分歧来抵消,反之亦然——这是不可能的。

在HN上,针对同一条评论,Michael Chermside发表了合理但未获高赞的评论:

> 对我来说,所有问题的答案都一清二楚。

这并不特别令人意外。但你可能问错了问题。

如果你想了解规则是否清晰,我认为该问的问题不是“答案对你来说是否一清二楚?”,而是“不同的人是否会得出相同的答案?”。

如果图表在某处出现急剧下降,那可能表明大多数人有相同的判断标准;但我们看到的是一条非常平滑的曲线,仿佛不同的人阅读了这条极其简单明了的规则后,仍然无法就何时适用达成一致。

许多人(可能实际上是大多数人)在预测他人认为显而易见的事情时过于自信,常常错误地假设他人会有相同的想法并认为同样的事情显而易见。在那些导致激烈版务争吵的高争议性问题上,这种情况比简单的“公园内禁止车辆”例子更为明显——但即便是这个简单的例子,也不仅展示了达成共识的难度,更展示了理解达成共识有多难这件事本身的难度。

换一个更具争议性的语境来举例:在任何体育项目中,判断一名球员是否公平竞赛、是否做出肮脏动作而应受谴责时,我们可以观察许多不同运动中的不同球员。不妨随意挑选德雷蒙德·格林。如果你问任何一位非勇士队球迷的资深篮球迷,当今NBA最脏的球员是谁,大家普遍会同意是德雷蒙德·格林(尽管有人会争论狄龙·布鲁克斯,所以若想接近一致意见,你得问前两名最脏的球员)。然而,如果你问勇士队球迷关于德雷蒙德的看法,大多数人能毫无障碍地为他每一个肮脏动作辩解。因此,若你想就一个比“公园内禁止车辆”更直白的问题——比如“踩踏对手胸口并借力腾空是否合理”,外加上百个其他肮脏动作——寻求一致意见,你会发现,对于许多看似显而易见的问题,相当一部分人会与“明显”答案产生极其强烈的分歧。当你从人为设计的抽象例子(如“公园内禁止车辆”)转向人们情感投入的现实问题时,即使无关的第三方都能达成一致的情况,通常也变得不可能——而我们已观察到,即便没有情感投入,这种一致本就不可能。而当你从体育转向人们更在意的问题(如政治),分歧会愈发激烈。

尽管人们或许能“求同存异”地看待一辆作为纪念物的二战报废坦克是否违反“公园内禁止车辆”规定(由此产生两种立场,合计占15%的投票),但在现实中,人们往往难以就外人看来微不足道的意见分歧达成“求同存异”。争议性问题常常像分形一样充满矛盾,导致观点几乎相同的人之间也产生分歧,这使得达成一致比我们的“公园内禁止车辆”例子困难得多。

举一个现实案例:女权主义者乔·弗里曼在1976年撰文描述自己因细微意见分歧而被“封杀”的经历,并指出这在运动中不幸普遍存在(她使用“trashed”而非“canceled”一词,因为“封杀”尚未普及,且在我看来“trashed”更贴切)。在乔·弗里曼撰写《Trashing》近五十年后,人类揪住细微差异、试图摧毁任何不完全赞同者的倾向并未改变;近期类似案例可参考娜塔莉·韦恩的相似经历

对于持有与主流观点相距甚远的意见的人来说,娜塔莉与那些呼吁将她封杀的人之间的意见分歧其实相当微小。然而,这些“微小”的意见分歧不仅导致人们呼吁封杀娜塔莉,还要求对她进行人身攻击、人肉搜索等,并对她的朋友、同事,甚至那些与她并无直接关联、但公开讨论类似话题且未对她进行封杀的人,也提出了同样的对待方式。即便多年后的今天,她仍不断收到封杀呼吁,我预计这种状况将持续到我生命终结之后(在我写下这些文字时,距离娜塔莉讨论的事件已过去数年,我在推特上搜索发现,有人发了一条长篇推文,疯狂抨击娜塔莉在视频中讨论的所谓越界行为多么恶劣,发布日期是10天前,而且很容易找到更多类似言论)。我不打算描述双方立场的差异,因为立场足够接近,要描述清楚大概需要5000到10000字(相比之下,比如左翼与右翼政客的差异则显而易见,一两句话就能说清);如果你想了解全部细节,可以观看那段1小时40分钟视频中专门讨论该话题的1小时内容。

这里的关键点在于,如果你观察任何对敏感议题持有公开意见的人,意见空间就像分形一样充满争议。没有哪个大型平台能满足所有用户的偏好,因为用户对于哪些内容应该被屏蔽、哪些内容应该被允许存在,总会存在分歧。当然,随着平台规模扩大,这个问题会进一步加剧3

如果你正在找工作,Freshpaint正在招聘(美国远程岗位),涉及工程、销售和招聘领域。免责声明:我可能因身为投资者而存在偏见,但他们似乎已找到产品市场契合点,正在快速增长。

感谢Peter Bhat Harkins、Dan Gackle、Laurence Tratt、Gary Bernhardt、David Turner、Kevin Burke、Sophia Wisdom、Justin Blank和Bert Muthalaly提供的评论/更正/讨论。


  1. 我在每个参与过的论坛上都反复看到一种观点:认为我们根本不需要管理,只要停止这种糟糕的审查,所有问题就能迎刃而解。如果你想要一个类似4chan的小型论坛,不设管理或许可行;但即便你想要一个像4chan那样的大型平台,不管理实际上也行不通。回顾一下推特的数字:3亿用户,每天移除100万机器人。如果你停止这种“审查”,平台会迅速被机器人填满,以至于你看到的一切都是垃圾信息、诈骗、钓鱼内容,或是从别处复制的内容,以及利用LLM生成的诈骗/钓鱼内容。不仅大多数账号会是机器人,这些机器人还会组成庞大的互动/投票团伙,淹没所有人类内容。

下一个最天真的建议是停止对表情包、低俗笑话等内容降权,通常还会附带一句“这里难道没人有幽默感吗?”如果你观察那些允许点赞/排名的论坛为何禁止表情包,通常是因为论坛完全被表情包/漫画主导——人们给这些内容的点赞率远高于任何稍有深度的内容,而并非所有人都想要一个充满最低级趣味表情包/漫画的论坛。至于评论中的“幽默感”,如果你看看那些不禁止廉价幽默的论坛,热门评论往往会被这类内容占据。例如,在Reddit上那些不禁止这种廉价幽默的板块,大约3到6个月里,任何关于男性做了点稍微英勇事迹的故事下,热门评论都会是某种变体的“我惊讶他还能走路,他的蛋蛋有900磅重”,而且经常被多个用户重复多次,淹没在当时流行的其他廉价幽默中。当然,有些人确实希望这种幽默主导评论,他们真的想连续几个月每天看到同一条评论150次;但我怀疑,那些当自己的廉价幽默被标记时气呼呼地说“这里没人有幽默感”的人,实际上并不想读一个充满别人廉价幽默的论坛。

[return] 2. 这位评论者表示,他们理解审核总体上是一个难题;只是不同意“公园内禁止车辆”这个例子,但许多人认为公园例子和审核都很简单。[return] 3. 如今,用“联邦化”作为万能药很流行,就像五年前人们用“区块链”作为万能药一样,但联邦化并不能为普通用户解决这个问题。我实际上曾与一位在社交媒体简介中自称是ActivityPub规范创建者之一的人交谈过,他声称联邦化能解决这个问题,并且Threads加入ActivityPub将创造某种联邦化的灵丹妙药。我指出,碎片化已经是Mastodon上许多用户面临的问题,而Threads是否会被屏蔽存在争议,只会加剧碎片化。这位ActivityPub人士回复说:“别担心这个,大多数人不会屏蔽Threads,如果他们屏蔽了,那是他们自己的问题。”

我提到,我许多非技术背景的朋友在尝试Mastodon时遇到的一个问题是,他们选择一个服务器后,发现由于某种服务器屏蔽或封禁,无法关注他们想关注的人。于是他们尝试另一个服务器来关注这个人,却又发现另一个想关注的人被屏蔽了。根本问题在于,不同服务器上的用户希望允许不同的内容,结果导致没有哪个服务器能让你看到所有想看的内容。这位ActivityPub人士对此没有回应,并删除了他的评论。

顺便提一下,一个比审核/垃圾信息/欺诈/淫秽内容等政策更容易处理的问题,联邦宇宙却无法解决:那就是内容的呈现方式。每当我用Mastodon与使用“honk”的人互动时,消息就会变得混乱。例如,Mastodon消息中主题(和内容警告)字段里的"会被转换成",Mastodon用户看到来自honk用户的回复时,每个来自honk用户的回复都会让讨论岔到不同主题上。这是一个可以完全明确指定、且人们对此的情感投入远低于审核/垃圾信息/欺诈/淫秽内容等主题的问题,而联邦宇宙甚至无法在两个平台之间解决这个问题。

[return]