在《搜索引擎优化的诞生与消亡》(The birth & death of search engine optimization)一文中,Xe 提出:
这里有个有趣的实验可以试试。找一个像
yt-dlp这样的开源项目,然后尝试用“youtube downloader”这类非常通用的词来搜索它。你会发现根本找不到,因为所有那些试图在这个词条下排到搜索结果顶部的内容农场都挡在了前面。尽管yt-dlp很可能才是你真正想要的、用来从 YouTube 下载视频的工具。
更广泛地说,我身边大多数搞技术的人似乎都认为,谷歌的搜索结果比十年前差了很多(Mastodon 投票,Twitter 投票,Threads 投票)。然而,也有一群声音不小的人声称搜索结果依然很好。例如,一位在 Bluesky 上互动率很高的意见领袖说:
我觉得那种“连谷歌搜索现在都烂透了”的哀嚎实在有点夸大其词1
我猜想,实际情况可能是:有些人已经太习惯于在糟糕的软件中绕弯子工作,以至于他们自己都没意识到自己在这么做,就像现在下意识地做 在编辑器中不停按 Ctrl+S,或者在文本框里写东西时先 Ctrl+A 再 Ctrl+C 这类现代操作一样。每个现代网络的老手都有一整套技巧,用来从查询中获得还算不错的结果。从我观察过的不少用户与电脑交互的情况来看,这似乎并不正常,即使在各种技术领域(比如机械工程2)相当有能力的人当中也是如此。不过,也有可能那些抱怨搜索结果质量差的人,只是 跳上了“一切都很糟糕”的跟风列车,发表了完全没根据的评论。
既然尝试一些简单、直接的查询相当容易,那我们就来试试几个查询吧。我们将用五种搜索引擎加上 ChatGPT,来测试三类查询,并且我们会关闭广告拦截器,以获得 非专家用户的浏览体验。我以前有过一台电脑因为浏览了带恶意广告的网站而被攻陷,希望这次不会发生这种事(那次我很幸运,因为恶意软件在我电脑上搞了太多动作,想不注意到都难)。
其中一类查询是我一位朋友在设置新电脑时使用的一组有代表性的查询。这位朋友是技术领域之外一位非常有能力的工程师,她想学习“如何使用电脑”,所以我观察了她尝试设置电脑的过程,并指出了她在与网站和软件交互的心智模型中的漏洞3。
第二种查询类型,是我高中时期想知道却找不到答案的问题——我问过的每个人(老师等)都给出了明显错误的回答,而我不知道如何找到正确答案。直到上了大学,能使用大学图书馆后,我才从各种教科书中找到正确答案。但这些问题的难度其实很低,高中生完全有能力理解答案;问题只在于如何找到答案,所以我们要看看这些答案是否容易找到。第三种查询类型,是我在写这篇文章时恰好想获取的本地信息。
在给查询结果评分时,会存在一定主观性。例如,客观上很难判断:是得到中等相关且无诈骗信息的结果更好,还是得到高度相关但混杂着诈骗信息的结果更好——这些诈骗信息可能试图安装恶意软件,或诱骗你提供信用卡信息来支付本不该付费的服务。就本文而言,我认为诈骗信息相当恶劣,因此在上述例子中,我会给中等相关的结果打更高分,而非混杂诈骗信息的高度相关结果。与我的其他文章一样,本文既有简短总结,也有详细的结果描述,你可以自行对服务进行排名。
下表中,每列代表一个查询,每行代表一个搜索引擎或ChatGPT。结果按从差到优分为:糟糕、非常差、差、一般、好、优秀,红色越深表示结果越差,蓝色越深表示结果越好。
查询内容如下:
- 下载YouTube视频
- 广告拦截器
- 下载Firefox
- 为什么更宽的轮胎抓地力更强?
- 为什么CPU晶体管越做越小?
- 温哥华2023年冬季降雪预报
table {border-collapse:collapse;margin:1px 10px;}table,th,td {text-align:center;}
| YouTube | Adblock | Firefox | Tire | CPU | Snow | |
|---|---|---|---|---|---|---|
| Marginalia | 一般 | 好 | 一般 | 差 | 差 | 差 |
| ChatGPT | 非常差 | 优秀 | 好 | 非常差 | 非常差 | 差 |
| Mwmbl | 差 | 差 | 差 | 差 | 差 | 差 |
| Kagi | 差 | 非常差 | 优秀 | 糟糕 | 差 | 糟糕 |
| 糟糕 | 非常差 | 差 | 差 | 差 | 糟糕 | |
| Bing | 糟糕 | 糟糕 | 优秀 | 糟糕 | 一般 | 糟糕 |
Marginalia 的表现相对尚可:有时能给出尚可但不算出色的答案,对于无法回答的问题则直接不提供答案或给出明显不相关的回答。其诈骗率较低,低于任何其他搜索引擎(不过对于这些查询,ChatGPT 的诈骗率为零,而 Marginalia 仍有一些)。
有趣的是,Mwmbl 允许用户直接编辑搜索结果排名。我曾针对一个查询进行过编辑,如果按编辑后的标准评分,该查询本可评为“优秀”,但当你专门针对某个基准进行优化时,很容易在该基准上表现良好,因此 Mwmbl 的评分并未包含我对排名标准的修改。
关于谷歌结果,我发现一个有趣的现象:除了谷歌众所周知的偏好返回近期结果外,它还强烈倾向于返回近期发布的 YouTube 视频。这导致我们获得了一些对任何人都似乎毫无用处的视频——或许除了视频制作者本人,他们似乎试图通过视频获取广告收入。例如,搜索“ad blocker”时,其中一个 YouTube 结果是一段视频:某人絮叨了 93 秒关于应该使用广告拦截器,然后谷歌搜索“ad blocker extension”。接着他们点击第一个结果,错误地声称“这是谷歌官方出品”,即该广告拦截器要么由谷歌制作,要么拥有某种谷歌官方认可标志——仅仅因为它是第一个结果。随后他们又花了 40 秒安装广告拦截器,安装完成后错误地宣称“这基本上是谷歌 Chrome 上最有效的广告拦截器之一”。该视频有 1.4 万次观看。作为对比,Steve Yegge 花了一年时间制作高质量视频,其观看量最高的视频也仅有 8000 次,典型观看量低于 2000 次。这个通过制作低质量视频、谈论自己一无所知的话题来操纵算法的人——属于利用谷歌算法优先推送近期内容(不论质量)的“家庭作坊式”视频制作者群体——其视频观看量竟远超 Steve Yegge 的作品,因为他们找到了只需上传任何内容就能排名的搜索词。我们将在下文详细讨论谷歌的其他怪癖。
ChatGPT 则一如既往:有时令人印象深刻地超越传统竞争对手,有时表现尚可,有时拒绝真正回答问题,有时则对多个查询“幻觉”出无意义的内容(与往常一样,ChatGPT 的随机扰动会显著改变结果4)。批评 ChatGPT 的幻觉现象很常见,虽然我认为这种批评并非不公,但正如我们在 2015 年那篇 LLM 出现前的 AI 文章中所指出的,我认为这类批评总体上被高估了——因为人类和传统计算机系统也会犯完全相同的错误。
在这种情况下,搜索引擎会返回各种类型的幻觉结果。以雪情预报为例,我们看到了刻意捏造的结果:一个旨在通过虚假预报网站上的恶意广告获取广告收入,另一个则试图让用户误以为预报显示的是寒冷多雪的冬季(与实际预报相反),似乎是为了诱使用户注册不必要的除雪服务。其他刻意捏造的结果还包括:一个看似客观评测网站、实则为引导用户安装特定广告拦截器的虚假网站,而该广告拦截器似乎是个骗局,试图让用户付费拦截广告且无法取消订阅;一篇虚假的“有机”博客文章,试图诱使用户安装一个会向某些服务暴露所有购物记录的Chrome扩展程序(在很多情况下,无法判断博客文章是否为虚假或托儿帖,但在此例中,他们将虚假博客文章托管在产品的域名下,虽然设计得看起来像是有完整的博客系列,但实际上只有这一篇虚假博文),等等。
此外,还有许多结果看似并非故意欺诈,只是普通的SEO垃圾内容,旨在获取广告点击。这些网站大多出现在大语言模型(LLM)出现之前,因此读起来不像ChatGPT的幻觉,但本质上并无不同。有时这些网站的目标是让用户点击实际会诈骗用户的广告,有时则似乎是为了生成非诈骗广告的点击量。搜索引擎还返回了许多看似非故意的“人类幻觉”,即在用户内容被突出的地方(如Quora、Reddit和Stack Exchange),人们自信地陈述了错误的答案。
在这些查询中,即使忽略任何看起来像LLM生成的文本,我认为主流搜索引擎(谷歌和必应)在返回各种幻觉或类似幻觉的结果方面,比ChatGPT更差。虽然我并不认为对LLM幻觉的担忧毫无道理,但传统生态系统的问题在于,系统高度激励将软件供应链中最有利可图的内容呈现给用户,而这通常与最佳结果相去甚远。
例如,如果你的应用商店允许“你可能也喜欢”这类推荐,那么对于赌博成瘾管理类应用来说,最有价值的广告位将来自赌博应用。允许赌博广告出现在成瘾管理应用上,对任何如今有意为之的公司而言都过于明目张胆地损害用户利益,但制作赌博应用的公司自然会试图钻系统漏洞,突破过滤机制,而且他们有时确实能成功。至于网络搜索,我刚刚又试了一次,两大主流搜索引擎之一将充满广告的SEO垃圾内容作为成瘾管理的顶级结果返回。页面顶部是一个多部分广告,前两个链接分别是“真钱游戏”和“现金游戏”。总的来说,我得到的是本地化结果(因为我在加拿大,所以有很多.ca域名),如果你自己尝试,可能会得到略有不同的结果。
同样,如果最佳结果是像uBlock Origin这样优秀且免费的广告拦截器,那么对于一家设计低质量广告拦截器、试图用几乎无法取消的订阅来诱骗用户付费的公司来说,顶级广告位的价值要高得多,因此这种诈骗广告拦截器会出价高于免费广告拦截器,占据顶级广告位。这类公司还有更多资源投入到直接SEO以及营销等间接SEO活动上,因此,除非搜索引擎采取更有效的措施来对抗这种逐利动机,否则顶级结果将属于付费广告拦截器,尽管付费广告拦截器通常对用户而言远不如免费的好。如果你与从事排名工作的人交流,会发现许多最大的排名信号来自点击和互动,但这只有在用户足够精明、知道什么是最佳结果时才会引导他们找到最佳结果,而用户通常并不具备这种能力。人工评估员也会对页面质量进行评分,但这同样存在完全相同的问题。
许多谷歌员工告诉我,广告实际上是有益的,因为它们让用户了解到原本可能不知道的选项。但任何尝试不使用广告拦截器浏览网页的人都会看到各种误导性广告,这些广告试图以各种方式欺骗或诱捕用户,比如伪装成窗口,或者在关于对抗赌博成瘾的页面顶部推广“真钱游戏”,而这些广告通过SEO手段成功在赌博成瘾搜索中获得了高排名。原则上,这些问题可以通过投入足够资源来缓解,但我们可以看到,市值万亿美元的公司选择不投入足够资源来对抗SEO、垃圾信息等,以至于这类诈骗广告很少被杜绝。相反,许多顶级结果实际上是引导用户进入骗局的广告。
在PageRank的原始论文中,谢尔盖·布林和拉里·佩奇指出,基于广告的搜索引擎本质上与提供优质结果的激励并不一致:
目前,商业搜索引擎的主流商业模式是广告。广告商业模式的目标并不总是与为用户提供高质量搜索相符。例如,在我们的原型搜索引擎中,关于“手机”的搜索结果之一是一篇题为《手机使用对驾驶员注意力的影响》的研究,该研究详细解释了开车时使用手机通话带来的分心和风险。这个搜索结果之所以排在首位,是因为PageRank算法判定其具有高重要性——该算法近似衡量网页的引用重要性[Page, 98]。显然,一个通过展示手机广告来收费的搜索引擎,很难向付费广告商解释我们系统返回的这个页面。基于此类原因以及其他媒体的历史经验[Bagdikian 83],我们预计,广告资助的搜索引擎将天然偏向广告商,而非消费者的需求。
由于即使是专家也很难评估搜索引擎,搜索引擎的偏见尤其隐蔽。一个很好的例子是OpenText,据报道它向公司出售在特定查询结果中排名靠前的权利[Marchiori 97]。这种偏见比广告更隐蔽,因为人们不清楚谁“理应”出现在那里,谁又愿意花钱上榜。这种商业模式引发了强烈抗议,OpenText最终不再是一个可行的搜索引擎。但市场可能容忍不那么明显的偏见……这种偏见极难察觉,但仍可能对市场产生重大影响。此外,广告收入往往为提供低质量搜索结果提供了动机。例如,我们注意到某主流搜索引擎在用户输入某航空公司名称作为查询时,不会返回该航空公司的首页。巧合的是,该航空公司恰好投放了高价广告,链接到以其名称命名的查询。一个更好的搜索引擎本不需要这则广告,而这可能导致该搜索引擎失去来自航空公司的收入。总的来说,从消费者角度看,可以认为搜索引擎越好,消费者找到所需内容所需的广告就越少。这当然会侵蚀现有搜索引擎的广告支持商业模式……我们认为,广告问题引发了足够多的激励冲突,因此拥有一个透明且处于学术领域的竞争性搜索引擎至关重要。
当然,谷歌如今已被广告主导。尽管它曾明确批评用户将真实结果与付费结果混为一谈的危害性,但谷歌和必应都让广告越来越像真实搜索结果,以至于大多数用户通常不会意识到自己点击的是广告而非真实搜索结果。顺便说一句,正是由于用户倾向于认为所有内容都是“自然”搜索结果,本文中结果的排序将按照它们在页面上出现的顺序排列——因此,如果四条广告出现在第一个自然结果上方,那么这四条广告将排在第1至第4位,而自然结果则排在第5位。我曾听谷歌员工说,AMP并未影响搜索排名,因为它“仅仅”控制了哪些结果会进入搜索结果上方的“轮播”区域——仿佛在结果上方插入一个轮播图再加上一堆广告,将结果推至页面折叠线以下,对用户与结果的交互毫无影响。此外,搜索引擎将顶部位置作为“赎金”向企业索要的情况也屡见不鲜:那些不为自己品牌名称购买广告位的公司,其搜索结果的顶部会被竞争对手占据。这种做法同样被宣称“不影响搜索结果排名”——这个技术层面正确的说法,对普通用户而言基本毫无意义。
当我尝试运行论文中的查询“cellular phone”(不带引号)时,排名第一的结果是谷歌商店的链接,用于购买谷歌自家的Pixel 7,其余排名靠前的结果是亚马逊上销售的各种安卓手机。接着是移动电话的维基百科页面,然后是一系列商业结果,都试图向你推销手机,或是SEO垃圾信息,诱使你点击广告或通过它们的链接购买手机(接下来的7个结果是商业性的,再之后是一个充斥着广告的SEO博客垃圾页面,介绍手机的定义并附带手机广告,接着又是3个商业结果,随后又是一个广告泛滥的手机定义页面)。这些商业链接质量似乎非常低劣,例如,维基百科之后轮播图下方的第一个链接是百思买加拿大的移动电话页面。前两个产品是eufy版AirTag的广告位。下一个结果是罗杰斯公司捆绑的按月分期付款iPhone,再下一个是TELUS捆绑的按月分期付款三星手机,然后是三星的AirTag、Freedom Mobile捆绑的按月分期付款iPhone、不同颜色的Freedom Mobile捆绑按月分期付款iPhone、罗杰斯捆绑的按月分期付款iPhone、iPhone 13屏幕保护膜、另一款三星AirTag产品、无锁版iPhone 12、三星壁式充电器等;这是一个极其低质量的结果,展示的产品人们本不该购买(而且,根据评论数量,也确实没人买——排名靠前产品的评论众数为0,中位数为1或2,尽管百思买加拿大确实有很多人们实际购买的商品,也有很多评论众多的产品)。其他出现的商业结果通常也质量极低。谢尔盖和拉里曾认为的绝佳排名结果——“手机使用对驾驶员注意力的影响”——如今已无影无踪,被淹没在商业结果的洪流中。另一方面,谷歌自己也通过购买广告来欺骗用户,比如付费给安装程序,试图诱使用户安装Chrome而非Firefox。
总之,在查看了我们测试查询的结果后,脑海中浮现出一些问题:
- 为什么Marginalia这个由单人构建的搜索引擎如此出色?
- Marginalia或其他小型搜索引擎能否取代谷歌成为主流用户的选择?
- 一群小型搜索引擎能否提供比谷歌更好的结果?
- Mwmbl的用户策展方法会奏效吗?
- 像1996-Metacrawler那样聚合多个搜索引擎、ChatGPT、Bard等结果的搜索引擎,会显著超越谷歌吗?
第一个问题本身就能单独写一篇文章,而这篇已经有一万七千字了,所以或许我们改天再探讨。我们之前提到过,有些 人 可以 非常高效,但具体细节当然因人而异。
关于第二个问题,我们在2016年就探讨过类似的问题,既包括“我周末就能复制这家十亿美元公司”这种笼统说法,也包括关于开源软件如何随时能轻松超越谷歌的具体评论,例如:
如今,你需要的绝大多数技术确实都能在开源软件中找到,并且处于最前沿。请允许我以我自己的公司 meta64.com 为例。我使用 Lucene 来索引大量新闻文章,并通过搜索由简单抓取 RSS 内容生成的 Lucene 索引来提供检索功能。我认为 Lucene 技术近乎最优,而我使用的这种搜索方法与谷歌所需的方法几乎相同。谷歌唯一真正的技术优势在于他们能投入使用的服务器数量,这对我们这些小公司来说成本过高。但我预测,从软件角度来看,未来十年内,像我的技术这样的方案将会超越谷歌。
以及:
扩展规模始终是个挑战,但只要 Lucene 不断改进,总有一天谷歌的优势会变得无关紧要。我们可以集群 Lucene 节点,在其上分布搜索相关计算,然后使用 Hadoop 之类的东西来实现我们自己的开源排名算法。虽然我们还没到那一步,但技术只会越来越好,我们作为开发者所做的选择也很重要。尽管亚马逊和谷歌现在看起来像不可战胜的巨人,但不要低估长期积累的渐进式改进所能带来的成就。在技术领域,这个时间跨度甚至不需要很长。Windows 成为霸主的时间并不久远,现在 Windows 在哪里?
在那篇2016年的文章中,我们看到那些认为开源解决方案即将随时超越谷歌的人,似乎完全不了解要打造一个能与谷歌匹敌的主流搜索引擎需要解决多少难题,包括对 Twitter、报纸等快速更新的网站进行实时索引,以及极其复杂的自然语言处理基础能力。自2016年以来,这些问题变得更加棘手,因为需要索引的实时内容更多了,用户对自然语言处理的要求也更高了。用户对搜索引擎的期望也增加了,这让问题更加困难。因此,要取代谷歌成为面向十亿用户的主流搜索引擎,似乎仍然相当困难。
另一方面,如果你想为少量用户打造一个实用的搜索引擎,现在似乎比以往任何时候都更容易——因为谷歌对许多查询返回的结果质量已大不如前。在我们的测试查询中,发现大量甚至绝大多数顶部结果充斥着SEO垃圾内容,这一问题比十年前严重得多,甚至在大型语言模型兴起之前就已恶化,且至今仍在持续加剧。我通常使用搜索引擎的方式能避开这类问题,但当我观察“普通”用户的查询习惯,或像本文这样亲自尝试原始查询时,发现大多数结果质量相当糟糕——这在过去是不存在的。
如今,谷歌另一个让我感到失望的地方是查找非热门页面。我经常发现,当我想找一个网页,并且准确记得页面内容时,即使进行精确字符串搜索,谷歌也不会返回该页面。要么页面没有被索引,要么页面实际上相当于未被索引——因为它存在于索引中某个响应缓慢的角落,无法及时返回结果。为了找到这个页面,我不得不记住某个链接到该页面的页面中的文本(通常需要多次点击才能到达实际页面,而不是仅仅一次,所以我实际上记住的是一个链接到另一个页面,再链接到另一个页面,如此反复多次的页面,然后利用 archive.org 遍历那些现已失效的链接),搜索该文本,再手动沿着链接图导航到目标页面。这种情况在2005年搜索时基本不会发生,2015年也很少出现,但现在我搜索东西时,大部分时间都会遇到。即便在2015年,谷歌也并非无所不包。举个例子,谷歌搜索并没有索引每一条推文。但那时,我发现谷歌搜索在搜索推文方面比推特搜索更好用,而且我几乎从未遇到过想找的推文未被谷歌索引的情况。但现在,我想找的大部分推文都无法通过谷歌搜索返回5,即使我搜索“[推文中的精确字符串] site:twitter.com”也是如此。在最初的PageRank论文中,谢尔盖和拉里写道:“由于人类只能输入或说出有限的内容,而随着计算机不断进步,文本索引的扩展性将比现在更好。”(并且,虽然机器可以生成近乎无限的内容,但仅索引人类生成的内容似乎就非常有用)。在大型语言模型出现之前,谷歌无疑拥有索引每一条推文以及每个公共网站上人类所有言论的资源,但他们似乎选择将资源投入到其他地方。相对于其规模,公共网络似乎比以往任何时候都更少被索引,或者至少比网络搜索早期阶段以来的任何时候都更少被索引。
在谷歌还能为简单查询返回不错的结果、并索引几乎所有我想找的公开页面时,独立搜索引擎几乎不可能给出比谷歌更好的结果。2016年的Marginalia对我来说不过是个新奇玩意——因为谷歌在Marginalia能给出好结果的几乎所有领域都能提供足够好的结果,而当我搜索任何冷门页面时,谷歌总能给出正确答案,这对小型引擎来说极其困难。但现在谷歌实际上不再索引许多我想搜索的页面,独立搜索引擎相对较小的索引量对我来说不再是障碍,其中一些引擎返回的SEO垃圾信息比谷歌更少,这让它们更适合我的使用场景——因为我通常不关心实时结果,不需要花哨的自然语言处理(而且发现很多NLP反而让搜索结果变差),不需要购物信息混入搜索结果,也很少需要理解图片内容的图片搜索等。
关于“多个小型搜索引擎能否为大量用户提供比谷歌更好的结果”这个问题,我认为这根本不算问题,因为多年来答案一直是响亮的“是”。但很多人并不相信这一点。例如,一位谷歌技术主管回复本文开头的Bluesky意见领袖时写道:
有人试图论证,如果搜索领域竞争更激烈,由大量小型供应商而非三大巨头主导,那么它反而能更有效地抵御基于机器学习的SEO滥用。
但…听着,如果连谷歌都跟不上节奏,那位市场份额仅5%的小先生又能做什么呢?
这大概是在回应Hillel Wayne的“算法单一文化”等观点,而我们的Bluesky意见领袖回复道:
95%的情况下,当有人声称某家小型独立公司能在某件难事上比市场领导者做得更好时,这不过是自我安慰。规模经济的效果相当显著!
过去,我们曾列举过市场领导者提供劣质产品、而各种小型玩家反而提供更好产品的案例。在未来的文章中,我们将探讨科技领域规模经济与规模不经济如何相互作用。但就本文而言,只需说明一点:尽管常见的“经济学101”鸡尾酒会式观点认为规模经济应是搜索质量的主导因素,但当我们审视实际结果时,情况显然并非如此。
关于Mwmbl用户策划的搜索结果是否可行,我猜测不可行,或者至少需要更多的审核。只需浏览Mwmbl就能看到,排名的最新编辑是由用户“betest”完成的,他为“RSS”添加了某种垃圾博客作为顶部条目。虽然可以撤销这一更改,但没有简便的方法来举报该更改或该用户为垃圾内容。
至于像Metacrawler这样聚合多个搜索引擎结果的工具,今天是否能产生更优的结果,这个问题其实无关紧要,因为要么无法合法地作为商业服务运营,要么需要支付高昂的许可费用。但从技术角度来看,现代元搜索引擎在今天可能相当不错。Metacrawler之所以迅速过时,是因为谷歌返回的结果明显优于聚合其他搜索引擎的结果,但如今情况似乎已不再如此。
回到Xe等人与我们的思想领袖之间的争论——Xe认为简单的搜索查询已被垃圾信息淹没,而我们的思想领袖认为“关于连谷歌搜索现在也变得糟糕的哀叹有些夸大其词”——看来Xe是正确的。尽管谷歌没有公开提供查看历史查询结果的功能,但许多人还记得,过去简单的查询通常能返回良好结果。谷歌在90年代迅速崛起的原因之一,即使是AltaVista的专家用户(他们已非常擅长在查询中添加各种限定词以获得好结果),也是因为使用谷歌时无需这样做。但如今我们又回到了原点,需要添加限定词、将搜索限制在特定网站等,才能从谷歌获得过去简单查询就能得到的好结果。如果说有什么不同,那就是我们甚至已经超越了原点,因为如今为了获得好结果所需的操作比AltaVista时代复杂得多。
感谢Laurence Tratt、Heath Borders、Justin Blank、Brian Swetland、Viktor Lofgren(顺便说一句,在写这篇文章之前我并不认识他——我是在运行查询后联系他讨论Marginalia搜索结果的)、Misha Yagudin、@hpincket@fosstodon.org、Jeremey Kun和Yossi Kreinin提供的评论/更正/讨论。
附录:其他搜索引擎
- DuckDuckGo:过去,我在使用广告拦截器比较DDG和必应时,结果非常相似。我在这里也试了DDG,去掉必应广告后,结果不如以前那么相似,但依然足够接近,以至于不值得单独列出DDG的结果。我默认使用DDG作为搜索引擎,并且认为,像谷歌一样,如果你知道如何查询,它表现不错;但对于本文中这类简单的查询,它的表现并不理想。
- wiby.me:和Marginalia一样,这是另一个专为寻找相对冷门结果而设计的搜索引擎。我在wiby上试了上述四个查询,结果很有趣,因为它们与我其他搜索引擎得到的结果截然不同,但wiby对我尝试的查询并未返回相关结果。
- searchmysite.net:对某些查询返回了部分相关结果,但不如Marginalia相关。相比谷歌、必应和Kagi,诈骗和广告页面少得多。
- indieweb-search.jamesg.blog:似乎出现了故障。每次查询都显示“由于服务器错误,无法处理您的请求”。
- Teclis:搜索框仍在,但任何查询都返回“Teclis.com因机器人滥用而关闭。Teclis结果仍可通过Kagi的搜索结果获得,明确通过‘非商业网络’镜头以及API。”首页上有一条注释:“由于大量机器人流量(99.9%的流量是机器人),Teclis结果在网站上被禁用。”
附录:返回良好结果的查询
我认为大多数程序员可能都能对每个查询获得良好结果,除了轮胎宽度与抓地力的查询。以下是我如何找到轮胎查询的合理答案:
我尝试了YouTube搜索,因为现在很多最好的汽车相关内容都在YouTube上。一个标题声称能回答问题的YouTube视频(实际上视频并未回答问题)有一条评论推荐了卡罗尔·史密斯的书《Tune To Win》。评论声称第一章解释了为什么更宽的轮胎有更多抓地力,但我没能在书中找到任何解释。第一章确实提到赛车通常使用比乘用车更宽的轮胎,并且乘用车正趋向于使用更宽的轮胎,还提到了一些关于滑移角的评论,给出了为什么更宽的接触面能带来更好转弯性能的直观原因,但我找不到解释制动差异的评论。此外,书中指出,更宽接触面的主要原因是它(间接地)允许更少的热量积累,从而可以设计在更窄温度范围内工作的轮胎,进而使用更软的橡胶。这可能是真的,但并不能解释人们可能好奇的许多观察到的行为。
《调校致胜》推荐了库默的《轮胎与橡胶摩擦统一理论》,以及海斯与布鲁克(实际应为布朗,但史密斯误写为布鲁克)合著的《轮胎牵引力物理学》。这两本书其实也未能真正解释现象原理,但通过搜索同类书籍,我找到了米利肯父子的《赛车车辆动力学》,这本书虽未给出明确解释,但已接近答案。进一步搜索与《赛车车辆动力学》相似的著作时,发现了圭贾尼的《车辆动力学科学》,该书确实阐述了如何思考与建模多个相关因素。圭贾尼著作的最后一章提到了“刷子模型”(针对轮胎),而搜索“刷子模型 轮胎宽度”时,又引出了帕塞卡的《轮胎与车辆动力学》——这本书终于开始解释为何更宽的轮胎抓地力更强,以及要解释轮胎可观测行为,需要建立怎样的轮胎与车辆动力学模型。
正如我们之前提到的,不同的人有各自的技巧来获得理想结果。如果你有更好的方法,我很乐意听取建议。但请注意:几乎每次我发文指出某个方法无效时,最常见的建议就是重复那个被明确标注无效的常见做法。例如,关于文件系统正确性的帖子收到最多的评论是“用重命名技巧就能解决所有问题”,尽管文中明确说明该方法无效、解释其无效原因,并引用了相关论文。几年后,我就此主题做了更详细的演讲,提到人们仍在不断建议这个无效方法,而演讲收到最多的评论依然是“根本不用这么麻烦,用重命名技巧就行”(至于ext4的auto_da_alloc功能,这并不意味着该方法有效——除非你确认文件系统兼容,能自动将错误代码替换为正确代码,但与其如此,不如直接编写正确代码)。如果你对“更宽轮胎为何抓地力更强”有新的解释,或能提供相关搜索线索,请务必确认该解释不属于本文列出的常见错误解释,且能完整解释该现象所需的所有可观测行为。
至于如何针对其他查询获得理想结果——鉴于本文已长达17000字,这部分内容将留待未来专门讨论:专家与非专家用户如何与计算机交互。
附录:查询结果摘要
每个问题的答案按从优到劣排序,评判标准是我对结果质量的主观感受。这些查询大多在2023年11月执行,少数在12月中旬。我平时很少自己写自然语言查询,但普通用户经常使用自然语言,因此我特意将“轮胎”和“雪”这两个查询设为自然语言形式。延续简单、基础查询的主题,本文使用了ChatGPT的免费版本(即ChatGPT 3.5)进行查询。理想情况下,我们应对每个查询同时使用关键词和自然语言方式执行完整矩阵,并运行更多查询,但本文已长达17000字(按标准书籍页数换算约70页),若再增加几个查询,很快会变成一本书的篇幅。工作中或针对特定数据分析时,我偶尔会做如此全面甚至更全面的项目,但在此处我们无法覆盖任何接近全面的查询集合,只能尝试几个有代表性的查询,凭经验判断这些结果是否与常见现象一致。因此,我认为没必要花费四倍工作量去覆盖更多边际内容。
对于搜索引擎,所有查询均在清除Cookie的隐身窗口中执行(Kagi除外,因其不允许未登录搜索)。Kagi的查询使用全新账户,未设置任何个性化或过滤条件,但同一账户连续执行查询时,后续结果可能受前期点击影响。这些查询在加拿大温哥华进行,部分搜索引擎似乎因此应用了本地化排名。
- 下载 YouTube 视频
- 理想情况下,排名第一的结果应该是
yt-dlp,或者一个基于yt-dlp的轻量图形界面封装。链接到youtube-dl或其他更新频率较低的项目也可以接受。 - 优秀结果(
yt-dlp排名第一,可能包含youtube-dl,且无诈骗链接):无 - 良好结果(
youtube-dl排名第一,可能包含yt-dlp,且无诈骗链接):无 - 一般结果(
youtube-dl排名第一,可能包含yt-dlp,且诈骗链接少于其他搜索引擎):- Marginalia:顶部链接指向
youtube-dl。大多数链接不相关。诈骗链接远少于大型搜索引擎。
- Marginalia:顶部链接指向
- 糟糕结果(包含一些有用链接,但也包含大量诈骗链接):
- Mwmbl:包含一些恶意网站和诈骗链接,但少于大型搜索引擎。在前10名中有一个指向
youtube-dl的间接链接,以及一个指向youtube-dl图形界面的链接。 - Kagi:大部分链接指向诈骗网站,但在几页之后,有一个指向 web.archive.org 上 2010 年版
youtube-dl的链接。
- Mwmbl:包含一些恶意网站和诈骗链接,但少于大型搜索引擎。在前10名中有一个指向
- 非常糟糕的结果(未能返回任何有用结果):
- ChatGPT:基本上拒绝回答这个问题,不过如果你不直接问你想回答的问题,而是通过提示工程,或许能找到答案。
- 极差结果(未能返回任何有用结果,且充满诈骗链接):
- Google:大部分链接指向试图诈骗你或为免费软件的劣质版本收费的网站。一些链接指向充满广告的列表文章,其中没有好的建议。完全没有指向好结果的链接。还链接到各种相当于博客垃圾的 YouTube 视频。
- Bing:大部分链接指向试图诈骗你或为免费软件的劣质版本收费的网站。一些链接指向充满广告的列表文章,其中没有好的建议。可以说完全没有指向好结果的链接(尽管有人可能会认为第10个结果虽然看起来像恶意软件,但还算可以接受)。
- 理想情况下,排名第一的结果应该是
- 广告拦截器
- 理想情况下,顶部链接应指向 uBlock Origin。如果不行,只要有指向 uBlock Origin 的链接就算不错。
- 优秀结果(uBlock Origin 是第一个结果,无诈骗链接):
- ChatGPT:第一个建议是 uBlock Origin。
- 良好结果(uBlock Origin 排名靠前,但不是第一个;排在 uBlock Origin 之上的结果要么明显不是广告拦截器,要么基本上无需付费即可使用,即使不如 uBlock Origin 好;没有直接试图诈骗你的链接):无
- 一般结果(uBlock Origin 出现在结果中,诈骗链接少于其他搜索引擎,且数量不多):
- Marginalia:第3和第4个结果指向 uBlock Origin,第8个结果也是 uBlock Origin。没有直接试图诈骗你的内容,“只有”一个指向某种 SEO 广告农场诈骗的链接(这比主流搜索引擎好得多)。
- 糟糕结果(没有指向 uBlock Origin 的链接,大部分链接指向对好功能收费的广告拦截器,或默认故意放行广告的广告拦截器):
- Mwmbl:大量不相关链接和一些指向 Ghostery 的链接。有一个诈骗链接,因此诈骗链接少于商业搜索引擎。
- 非常糟糕的结果(全部或几乎全部链接指向对好功能收费的广告拦截器,或默认故意放行广告的广告拦截器):
- Google:大量链接指向“参与可接受广告计划”的广告拦截器,该计划中发布商同意确保其广告符合某些标准(文本中未提及,但如果你深入了解,其他地方会有解释,因此这些公司的主要收入来源是广告商向“广告拦截器”公司付费,以使其广告不被拦截,这使得“广告拦截器”不仅不是广告拦截器,而且与用户的利益非常不一致。一些链接指向看似诈骗的东西。完全没有指向 uBlock Origin 的链接。还链接到各种相当于博客垃圾的 YouTube 视频。
- Kagi:与 Google 类似,但诈骗链接更多,不过少于 Bing。
- 极差结果(全部或几乎全部链接指向对好功能收费的广告拦截器,或默认故意放行广告的广告拦截器,并且有大量诈骗链接):
- Bing:与 Google 类似,但诈骗链接更多,且没有 YouTube 视频垃圾。
- 下载 Firefox
- 理想情况下,我们应该获得下载 Firefox 的链接,且没有虚假或诈骗链接。
- 优秀结果(指向下载 Firefox 的链接;无诈骗链接):
- Bing:指向下载 Firefox 的链接。
- Mwmbl:指向下载 Firefox 的链接。
- Kagi:指向下载 Firefox 的链接。
- 良好结果:
- ChatGPT:这有点难以归类,因为严格来说这些指令不正确,但人类应该能够轻松解读指令并下载 Firefox。
- 一般结果(某种间接指向下载 Firefox 的链接;无诈骗链接):
- Marginalia:间接指向下载 Firefox 的说明,以获取 Firefox 下载。
- 糟糕结果(指向下载 Firefox 的链接,但包含诈骗链接):
- Google:顶部链接都是合法的,但第7个结果是一个试图让你安装恶意软件的诈骗链接,第10个结果是一个广告,看起来像是某种想要你信用卡信息的诈骗。
- 为什么更宽的轮胎抓地力更好?
- 理想情况下,应链接到一个清晰解释原因的解释,并且没有不完整的、无法解释许多常见观察到的行为的解释。
- 优秀/良好/一般结果:无
- 糟糕结果(没有结果或极少数明显错误的结果):
- Mwmbl:一个明显错误的结果,没有其他结果。
- Marginalia:两个明显错误的结果,没有其他结果。
- 非常糟糕的结果(极少数看似合理但错误的结果):
- ChatGPT:标准的 ChatGPT“幻觉”,对很多人来说可能看似合理(听起来像很多关于这个主题的错误网络评论,但写得更好)。
- 极差结果(大量看似合理但错误的结果,通常出现在广告农场上):
- Google / Bing / Kagi:错误的、充满广告的结果,并伴有通常数量的诈骗广告。
- 为什么他们不断把 CPU 晶体管做得更小?
- 理想情况下,应链接到一个清晰解释原因的解释。我见过最好的解释在 VLSI 教科书中,但我也在讲义和幻灯片中见过非常好的解释。
- 优秀结果(链接到一个非常好的解释,无诈骗链接):无
- 良好结果(链接到一个尚可的解释,无诈骗链接):无
- 一般结果(链接到你可以进一步搜索的内容,如果你擅长搜索,可以获得一个好的解释,并且不会将糟糕或误导性的解释排在尚可的解释之上):
- Bing:顶部的一组链接包含一个部分答案,通过更多搜索可以轻松转化为指向正确答案的链接。还包含大量不相关的答案和充满广告的 SEO 垃圾。
- 糟糕结果(没有结果,或少量明显不相关的结果,或大量看似合理但错误的结果,其中夹杂一个尚可的结果):
- Marginalia:没有答案。
- Mwmbl:一个明显不相关的答案。
- Google:第5个链接包含正确的关键词,可能通过进一步搜索找到正确答案。大多数链接包含误导性或错误的部分答案。大量指向 Quora 的链接,没有回答问题。还有大量其他 SEO 垃圾答案。
- Kagi:第10个链接有一条相当直接的路径来获得正确答案,如果你在第10个链接上向下滚动足够远的话。其他链接不好。
- 非常糟糕的结果:
- ChatGPT:并没有真正回答问题。要求 ChatGPT 进一步解释其答案会导致它“幻觉”出错误的原因。
- 温哥华 2023 年冬季降雪预报
- 我不确定理想的答案是什么,但一个相当好的答案是链接到加拿大环境部的降雪预报,预测降雪量显著低于正常水平(气温高于正常水平)。
- 优秀结果(作为第一个结果,链接到加拿大环境部 2023 年冬季多个月降雪预报,或同等好的内容):无
- 良好结果:无
- 一般结果(链接到某种看似合理的冬季降雪预报,而不是为了驱动广告点击而编造的垃圾):无
- 糟糕结果(没有结果或明显不相关的结果):
- Marginalia:没有结果。
- ChatGPT:结果不正确,但当我无意中在问题前加上“User\n”时,它返回了一个指向正确网站的链接(但方式使得导航到像样结果相当困难),所以也许稍微不同的提示会伪随机地在这里产生一个一般结果?
- Mwmbl:一堆明显不相关的结果。
- 非常糟糕的结果:无
- 极差结果(链接到故意伪造的预报结果):
- Bing:大部分是不相关的结果。顶部看似相关的结果是第5个链接,但它似乎是一个诈骗网站,编造虚假天气预报,并通过在高度 SEO 的网站上投放广告来赚钱。
- Kagi:前4个结果来自 Bing 的第5个链接中的诈骗预报网站。
- Google:大部分是不相关的结果,第1个结果来自一家当地除雪公司的虚假答案,该公司预测会有大量降雪和寒冷天气,试图让你不必要地购买当年的除雪服务。其他结果是充满广告的 SEO 垃圾。
附录:详细查询结果
下载YouTube视频
对于第一个查询,我们将搜索“下载YouTube视频”(Xe建议的搜索词“youtube下载器”会返回非常相似的结果)。理想的结果是yt-dlp或一个轻量、免费的yt-dlp封装工具。yt-dlp是youtube-dlc的一个分支,而youtube-dlc又是youtube-dl的一个现已停用的分支,后者如今似乎很少更新了。如果这些较旧的下载器仍然可用,那么提供它们的链接似乎也可以接受。
-
某个 YouTube 下载网站。页面大量保证网站和工具是安全的,因为已经过“Norton SafeWeb”检查。只要与网站互动,就会提示你安装浏览器扩展并启用通知。尝试下载任何视频时,会弹出全屏覆盖层,要求安装名为 CyberShield 的扩展。似乎无法在不点击某些内容尝试安装的情况下关闭该覆盖层。在点击链接但选择不安装 CyberShield 后,视频无法下载。谷歌搜索“cybershield chrome extension”会返回一个知识卡片,内容为“Cyber Shield 是一个声称是弹窗拦截器的浏览器扩展,但实际上会在浏览器中显示广告。安装后,此扩展会打开新标签页,显示推销软件、推送虚假软件更新和技术支持诈骗的广告”,因此 CyberShield 似乎是恶意软件。
-
某个 YouTube 下载网站。与网站互动会弹出提示,要求下载其浏览器扩展。输入视频 URL 后,会弹出一个指向某个诈骗网站的窗口,但同时也会触发视频下载,因此只要小心不参与网站试图诱骗你互动的诈骗活动,似乎还是可以下载 YouTube 视频的。
-
PC Magazine 的列表文章,介绍从 YouTube 下载视频的方法。首要推荐是付费下载 YouTube 视频、VLC(他们指出尝试时未成功)、一些每年 15 美元的软件、一些每年 26 美元的软件、“FlixGrab”,然后警告下载网站通常带有诈骗性质,他们不推荐任何下载网站。该文章每条建议都附有多个广告。
-
某个 YouTube 下载网站,带有可疑的弹出覆盖层,在你与页面互动之前就试图诱骗你点击广告。
-
某个 YouTube 下载网站,弹出窗口试图诱骗你点击诈骗广告。
-
某个 YouTube 下载网站,弹出窗口试图诱骗你点击诈骗广告,例如“Samantha 24, 温哥华 | 我想要性,写 WhatsApp | 关闭 / 继续”。点击任何内容(任何按钮或网站上的其他位置)都会试图让你安装名为“Adblock Ultimate”的东西。
-
ZDNet 的列表文章。第一个建议是 clipware,该软件安装程序显然捆绑了大量恶意软件/广告软件/垃圾软件:https://www.reddit.com/r/software/comments/w9o1by/warning_about_clipgrab/。该列表文章充满广告,并有一个自动播放的视频。
-
[YouTube 视频] 超过 2 分钟的广告,随后是一个关于如何购买 YouTube Premium 的视频(视频有 200 万次观看)。
-
[YouTube 视频] 视频开头要求用户观看完整视频(某种变现机制?)。该视频试图引导你使用某种需要付费的软件来下载视频。
-
[YouTube 视频] PC Magazine 的视频,声称你可能“不必”下载视频,因为可以使用分享按钮,然后建议阅读他们关于如何下载视频的文章(即结果 #3 中的那篇)。
-
某个 YouTube 下载网站,带有诈骗广告。只要与网站互动,就会试图让你安装“Adblock Ultimate”。
-
某个 YouTube 下载网站,弹出窗口试图诱骗你点击诈骗广告。
-
某个 YouTube 下载网站,带有诈骗广告。
在10个“正常”结果中,有9个以某种方式试图诱骗你安装恶意软件,或与其他类型的广告诈骗有关。其中一个页面虽未如此,但也没有推荐免费、优质的YouTube视频下载方案,反而提供了多个付费选项。此外,我们还看到了三个YouTube视频,它们看起来都像是视频版的SEO垃圾内容。有趣的是,谷歌本身并没有投放太多广告尽管上次我关闭广告拦截器进行谷歌测试查询时情况并非如此。
Bing
- 某个 YouTube 下载网站。这是谷歌(2),上面有诈骗网站的广告。
- [进一步探索……“根据热门内容为您推荐”] 某个 YouTube 下载网站,不是我们在谷歌上看到的那个。网站有多个闪烁的广告,并自称“圣诞特惠 50% 折扣”(此搜索于 11 月中旬进行)。尝试下载任何视频会弹出一个虚假的进度条,并附有“太慢了?试试[我们的程序]”链接。过一会儿,会出现一个下载视频的链接,但这是个陷阱,点击后它会尝试安装“oWebster Search 扩展”。搜索“oWebster Search 扩展”表明这是一种恶意软件,会劫持浏览器显示广告。排名前三的结果中有两个是关于如何安装该扩展,其余热门结果则是关于如何移除这种恶意软件。许多移除链接本身也是骗局,会安装其他恶意软件。在未安装此恶意软件的情况下,再次点击下载链接会弹出一个窗口,试图让你安装该网站的软件。如果关闭弹窗并再次点击下载链接,只会再次弹出该链接,因此这个网站似乎是一个纯粹的骗局,根本不允许你下载视频。
- [进一步探索] 与网站互动会弹出虚假广告,上面有据称想与你聊天的美女照片。点击视频下载按钮会试图让你安装一个山寨广告拦截器,该拦截器会显示额外的弹窗广告。不过,该网站似乎确实能让你下载视频。
- [进一步探索] 与(3)相同。
- [进一步探索] 与谷歌(1)相同(那个试图诈骗你的 NortonSafeWeb YouTube 下载网站)。
- [进一步探索] 一个将视频转换为 MP4 的网站。我没有检查该网站是否有效或只是一个骗局,因为该网站甚至没有声称可以下载 YouTube 视频。
- 又是谷歌(1)。那个试图诈骗你的 NortonSafeWeb YouTube 下载网站。
- [进一步探索] 一个指向 youtube.com(主页)的链接。
- [进一步探索] 某个 YouTube 下载网站,弹窗试图诱骗你点击广告。关闭弹窗后会出现另外 12 个广告。有一个伪装成 YouTube 下载按钮的诈骗广告。滚动过去后,有一个文本框和一个用于尝试下载 YouTube 视频的按钮。输入有效网址会显示错误,提示该网址没有视频。
- 巨大的卡片,上面实际上有一个下载按钮。下载按钮是假的,只是将你带到该网站。该网站大声宣称其软件不是广告软件、间谍软件等。不少网络评论者指出,他们的杀毒软件将此软件标记为恶意软件。许多评论还表明,该软件运行效果不佳,但有时能工作。该软件的网站上嵌入了一个 YouTube 视频,显示“此视频因违反 YouTube 服务条款已被移除”。奇怪的是,Mac 和 Linux 的下载链接并非针对此软件,实际上什么也下载不了,而是
youtube-dl的安装说明;如果 Windows 版本确实是恶意软件,这或许说得通。Windows 下载按钮会带你到一个页面,让你下载一个 Windows 可执行文件。还有一个链接指向某个广告泛滥的页面,试图诱骗你点击看起来像普通按钮的广告。 - PC 杂志列表文章。
- 某个 YouTube 下载程序的广告,声称“今日下载量 345,764,132 次”;在 Reddit 上搜索该产品名称似乎表明它是恶意软件。
- 某种付费下载软件的广告。
第一页到此结束。
和谷歌一样,搜索结果质量不佳,充斥着大量骗局以及一些可能并非恶意软件、但本质上只是开源项目的轻量外壳,它们向你收费,而不是让你免费使用该软件。
Marginalia
- 一个12年前的答案推荐了youtube-dl,但链接指向的网址已被下架,并替换为“根据汉堡地区法院的裁决,本网站访问已被屏蔽。”
- 一篇SEO优化的文章,就像你在普通搜索引擎上看到的那样。
- Leawo YouTube Downloader(我不知道这是什么,但快速搜索一下,至少不像谷歌和必应结果那样,一眼就能看出是某种恶意软件。)
- 一篇SEO优化的列表文章,就像你在普通搜索引擎上看到的那样。
- 某个随机软件的Bug报告。
- 某个随机博主推荐“4K Video Downloader”。快速搜索似乎表明这不是骗局或恶意软件,但它确实将某些功能锁定在付费墙后面,因此不如
yt-dlp或某些围绕yt-dlp的免费外壳程序。 - 一篇关于如何安装和使用
yt-dlp的博客文章。该博客文章指出,它以前是关于youtube-dl的,但已更新为yt-dlp。 - 更多向你收费的软件,而这些功能本可以免费获得,尽管在Reddit上搜索该软件会找到它的破解版。
- 一篇推荐内容极其过时的列表文章,比如RealPlayer。整个博客似乎充满了质量低劣的列表文章。
- 一个为名为“keyboard maestro”的软件下载YouTube视频的脚本。如果你已经使用该软件,这似乎很有用;但如果你尚未使用,这似乎是一个糟糕的解决方案。
结果质量远超其他。第一个链接虽然失效,但你可以轻松地从第一个链接找到youtube-dl。我当然不会尝试Leawo YouTube Downloader,但至少它不像谷歌或必应那样,搜索项目名称时,大部分结果都是关于该项目是某种恶意软件或骗局,这比我们从谷歌或必应得到的结果要好。而且我们确实得到了一个推荐yt-dlp的结果,并附有说明,这只是一个想帮助那些试图下载YouTube视频的人的博客文章。
Kagi
- 1. 那个 NortonSafeWeb 的 YouTube 下载网站。只要与网站互动,就会提示你安装浏览器扩展并启用通知。尝试下载任何视频时,会弹出一个全屏弹窗,要求安装名为 CyberShield 的扩展。似乎无法在不点击任何内容尝试安装的情况下关闭该弹窗。
- 2. 另一个指向 NortonSafeWeb YouTube 下载网站的链接。不知为何,这个链接被标记为“2003年12月20日”,显然表明该网站来自2003年12月20日,尽管这完全错误。
- 3. 某个 YouTube 下载网站。选择任何视频下载时,会将你跳转到一个带有诈骗广告的网站。
- 4. 某个 YouTube 下载网站。只要与网站互动,就会弹出多个指向诈骗内容的广告,并且页面要求启用通知。随后广告上方会出现一个弹窗,显示“广告已移除”,并附带一个详情链接。这是一个指向另一个广告的诈骗链接。
- 5. 上述网站的另一个链接。
- 6-7. 在一个名为“有趣发现”的子标题下,有两个指向 GitHub 仓库的链接。一个用于将 YouTube 视频转录为文本,另一个用于使用 Google Takeout 从 Google 相册或你自己的 YouTube 频道备份照片。
- 8. 某个 YouTube 下载网站。
- 9-13. 在一个名为“往昔回顾”的子标题下,有4个无关链接和一个指向 youtube-dl GitHub 页面的链接,但链接的是 archive.org 上2010年的版本。
- 14. 针对 YouTube 帮助的 SEO 垃圾博客。有一个链接声称是“用于下载 YouTube 视频的 Greasemonkey 脚本”,但该链接仅指向一个带有诈骗广告的页面。
- 15. 某个软件,每月收费5美元用于从 YouTube 下载视频。
- 某个 YouTube 视频下载网站,但其他搜索引擎都没收录。页面上有个巨大的广告面板,显示着“503 NA - Service Deprecating”。下载链接除了弹出一些其他广告面板然后消失,只留下那个显示“503”的广告外,什么用都没有。
- 一款售价 20 美元的 YouTube 视频下载软件。
- 一篇 2016 年的博客文章,介绍如何安装和使用
youtube-dl。侧边栏有两个低质量广告,看起来不像骗局,正文中间也插入了两个广告,与我们从大型搜索引擎看到的类似结果相比,这个广告量极低。 - 某个 YouTube 视频下载网站。页面上有个巨大的横幅,声称它是“唯一 100% 无广告且不含弹窗的 YouTube 下载器”,这很可能不是真的,但该网站似乎确实没有广告和弹窗。下载链接似乎真的能用。
- 一个 YouTube 视频,介绍如何在 Linux 上安装和使用
youtube-dlg(youtube-dl的 GUI 封装版)(此查询是在 Mac 上运行的)。 - 一个链接,指向一篇 2007 年的博客文章,内容是关于如何下载 YouTube 视频,但会自动跳转到一篇 2020 年充满广告的 SEO 垃圾文章,里面全是糟糕的建议。文章里有两个自动播放的视频。Archive.org 显示,2007 年的那篇博客文章在当时提供了一些合理的选择,所以这个结果并非一直这么差。
- 某大型网站上的博客文章,实际上是一篇赞助文章,试图引导你使用某个特定的视频下载器。在 Reddit 上搜索相关评论发现,用户认为这款应用浪费钱且毫无用处。该网站还充斥着其他产品的欺诈性和误导性广告。例如,我尝试点击一个声称能帮你“产品”省钱的广告。它加载了一个虚假的“正在检查您的电脑”动画,假装检查我的电脑是否与该扩展兼容,然后又出现另一个虚假的检查动画,之后我收到一条消息,说我的电脑兼容,我有资格省钱。我只需要安装这个扩展。关闭那个窗口会打开一个新标签页,上面写着“等等!您真的不想要结账时自动省钱吗?”选项有“是的,获取优惠券”和“不,不省钱了”。点击“不,不省钱了”实际上是一个广告,会把你带回到一个试图让你安装 Chrome 扩展的链接。
- 那个“Norton Safe Web”的 YouTube 下载器网站,但链接是错的,指向的是声称可以下载 Instagram 视频的网站版本,而不是声称可以下载 YouTube 视频的那个。
- 指向 Google 帮助页面的链接,解释如何下载你自己上传的 YouTube 视频。
- SEO 垃圾文章。一打开就有个弹窗让你订阅他们的新闻通讯。关掉它又出现另一个弹窗,选项是“订阅”和“稍后”。点击“稍后”确实会关掉第二个弹窗。关掉弹窗后,文章里是介绍如何在 Windows 上安装某些软件的说明。搜索该软件的评论,结果都是像“这是一个 PUP/PUA,可能会在你的电脑上下载不需要的应用程序,甚至是恶意应用程序”这样的评论。
基本和谷歌或必应一样。
ChatGPT
由于ChatGPT更倾向于对话式的查询,我们尝试使用提示词“如何下载YouTube视频?”
第一次尝试,在太平洋时间周一上午10:38,返回了“我们的系统目前有点忙,请稍作休息,稍后再试。”第二次尝试返回了一个答案,说没有付费YouTube Premium就不应该下载视频,但如果你确实想下载,可以使用第三方应用和网站。接着追问“最好的第三方应用和网站有哪些?”又返回了一个警告,说你不应该使用第三方应用和网站,随后是对GPT来说颇具讽刺意味的警告:
我不推荐或提供关于下载YouTube视频的特定第三方应用或网站的信息。在处理在线内容时,务必谨慎行事,并遵守法律和道德准则。
广告拦截器
对于下一个查询,我们将尝试“广告拦截器”。我们希望得到ublock origin。如果不行,那就找一个默认能拦截广告的广告拦截器。再不行,就找一个不是骗局、也不会注入额外广告或自身广告的。虽然最佳选择随时可能变化,但我看到的一些没有偏袒的比较往往显示ublock origin性能最好或名列前茅,而且ublock origin是免费的,并能拦截广告。
- “AdBlock — best ad blocker”。在折叠线下方注明“AdBlock 参与可接受广告计划,因此不会屏蔽非侵入式广告”,所以这并非屏蔽所有广告。
- Adblock Plus | 全球排名第一的免费广告拦截器。页面注明“默认允许可接受广告以支持网站”,因此默认情况下也不会屏蔽所有广告。
- AdBlock。页面注明“自 2015 年起,我们参与可接受广告计划,发布商同意确保其广告符合特定标准。被认定为非侵入式的广告默认向 AdBlock 用户显示”,所以这不会屏蔽所有广告。
- “Adblock Plus - 免费广告拦截器”,与(2)相同,不会屏蔽所有广告。
- “AdGuard — 全球最先进的广告拦截器!“页面试图向你推销某种付费软件”AdGuard for Mac“。搜索 AdGuard 会找到一篇来自此人的帖子,他正在寻找能屏蔽 AdGuard 注入广告的广告拦截器。似乎可以免费下载,但如果不订阅,他们会给你更多广告?
- Safari 商店中的“AdBlock Pro”;包含应用内购买。似乎需要付费才能解锁屏蔽视频等功能。
- [YouTube] “YouTube 如何应对广告拦截反弹”。30 秒视频,视频前有 15 秒广告。视频无实际内容。
- [YouTube] “我对 YouTube 广告拦截器风波的看法”。
- [YouTube] “如何在 Google Chrome 中免费在线屏蔽广告 [2023]”;视频第一条评论是“你的视频没有说明如何屏蔽 YouTube 广告”。视频中,一个人唠叨了一会儿,然后谷歌搜索
ad blocker extension,点击第一个链接(与我们的第一个链接相同),说:“如果我可以直接进入我的第一个网站,它基本上来自谷歌官方…… [安装后,弹出支付屏幕要求支付 30 美元或月费/年费]” - App Store 中的“AdBlock for Mobile”。在 iOS 商店评分为 3.2 星。许多评论表明它实际上不起作用。
- MalwareBytes 广告拦截器。快速搜索表明它不会屏蔽所有广告(不清楚是故意还是由于漏洞)。
- “在 Chrome 中屏蔽广告 | AdGuard 广告拦截器”,与(5)相同。
- [广告] NordVPN
- [广告] “#1 最佳免费广告拦截器 (2024) - 100% 免费广告拦截器。” 立即显得可疑,因为它使用了虚假年份(此查询于 2023 年 11 月中旬运行)。这是名为 TOTAL Ad Block 的东西。搜索 TOTAL Ad Block 的结果表明,它是一个可疑的应用,不允许你取消订阅,基本上试图窃取你的钱。
- [广告] 100% 免费且易于下载 - 自动广告拦截器。实际上是 Avast 浏览器,而非广告拦截器。快速搜索显示,此浏览器在安全性方面不如直接运行 Chromium,并且它从用户那里收集异常大量的信息。
没有ublock origin的链接。有一些诈骗链接,虽然比找YouTube下载器时少得多。大量链接指向那些默认只屏蔽部分广告的广告拦截器。
Bing
- 1. [广告] “自动广告拦截器 | 100%免费且易于下载”。[链接实际指向avast安全浏览器,所以是一个完整的浏览器而非广告拦截器;快速搜索显示,这似乎是Chromium的一个封装,[其安全性历史上不如直接运行Chromium](https://palant.info/2020/01/13/pwning-avast-secure-browser-for-fun-and-profit/),并且\[从用户处收集异常大量的信息\](https://palant.info/2019/10/28/avast-online-security-and-avast-secure-browser-are-spying-on-you/)\].
- 2. [广告] “#1 最佳免费广告拦截器 (2023) | 100% 免费广告拦截器”。当鼠标悬停在URL栏上时,会弹出一个提示窗口,要求你安装它而不是导航离开。名为TOTAL ad block的东西。显然试图让你注册订阅,[然后让你很难取消订阅](https://www.reddit.com/r/Adblock/comments/1412m7l/total\_adblock\_peoples\_experiencesopinions/)(显然,不打电话就无法取消,而且当你打电话要求取消时,除非你威胁要发起退款或从银行阻止付款,否则他们仍然不会取消)。
- 3. [广告] “最佳广告拦截器 (2023) | 100% 免费广告拦截器”。似乎是一个评论各种广告拦截器的虚假评论网站;ublock origin被列为第5名,3.5星。TOTAL ad block被列为第1名,5星,是唯一一个5星的广告拦截器,有一个横幅显示它是“#1 免费广告拦截器“,获奖无数等。 如果你随后点击ublock origin的链接,它会带你到一个“显示”ublock origin在Trustpilot上为0星的页面。有多个大按钮写着“点击开始拦截广告”,试图让你安装TOTAL ad block。在右下角,看起来像一个广告位,有一个图片写着“访问网站”指向ublock origin。这个链接不会带你到真正的ublock origin,而是带你到一个[虚假ublock origin](https://www.reddit.com/r/ublock/comments/32mos6/ublock\_vs\_ublock\_origin/)的网站。
- 4. [广告] “AVG 免费杀毒软件 2023 | 100% 免费,安全下载”。这个至少没有假装是任何类型的广告拦截器。
- 5. [探索来自adblockplus.org的内容] 一个指向adblock plus博客的链接。
- 6. [探索来自adblockplus.org的内容] 一个指向adblock plus功能列表的链接。
- 7. “Adblock Plus | 世界排名第一的免费广告拦截器”。
- 8-13. 指向Adblock Plus网站各个页面的子链接。
我们现在距离结果已经往下翻了三屏,所以上述谷歌结果的等效内容就是一堆广告,然后链接到一个网站。广告标注的提示比我见过的任何其他网站都要隐蔽。考虑到我们知道用户何时会将广告与自然搜索结果混淆,很可能大多数用户没有意识到顶部结果是广告,反而认为那些链接到诈骗广告拦截器或试图引导你安装诈骗广告拦截器的虚假评论网站是自然搜索结果。
Marginalia
- “是否允许使用广告拦截软件?”来自 judaism.stackexchange.com
- Ghostery的垃圾博客。Ghostery的定价页面注明你必须付费才能获得“无私人赞助链接”,因此某些功能似乎被付费墙限制。维基百科称“自2018年7月起,8.2版本的Ghostery会向用户展示自己的广告”,但这似乎是可选的?
- https://shouldiblockads.com/。解释了为什么你可能想要屏蔽广告。首选推荐是 uBlock Origin
- “最适合你的广告拦截器是什么?- Firefox 附加组件博客”。首选推荐是 uBlock Origin。同时还提供了关于其他广告拦截器的准确信息。
- 一篇个人博客文章,讲述某人安装广告拦截器的原因。
- Opera(浏览器)。
- 一篇博客文章,反对反广告拦截的论战。
- uBlock Origin。
- Fairphone论坛讨论是否应该安装广告拦截器。
- SEO网站垃圾博客(即该网站是一个SEO优化网站,这些垃圾博客旨在生成反向链接并将流量引导到该网站)。
这可能是我们目前看到的最佳结果,因为第三和第四个结果推荐了 uBlock Origin,而第一个结果明显不是广告拦截器。遗憾的是第二个结果是Ghostery的垃圾博客,但这仍然比我们从谷歌和必应看到的结果要好。
Mwmbl
- 来自某风投意见领袖关于广告拦截的“深度分析”文章的Bitly链接。
- 指向cryptojackingtest的链接,该链接会跳转到Opera浏览器。
- 指向ghostery的链接。
- 另一个指向ghostery的链接。
- 指向名为1blocker的链接,这似乎是一款付费广告拦截器。搜索其评价时,会出现类似“我试用1blocker免费版后忘记取消,结果被自动续费了20美元年费”的评论(但评论也表明这款拦截器确实有效)。
- Ad Guard的垃圾博客广告。页面上有横幅广告,提供该广告拦截器六折优惠。
- 一个广告泛滥的网站,它出现在搜索结果中是因为页面包含“检测到广告拦截器”这段文字(我加载页面时并未看到这段文字,但在Mwmbl的页面预览中确实存在)。首页实际上只有广告和一个“阅读更多”按钮。点击“阅读更多”会跳转到另一个同样充满广告的页面,而漫画作为“内容”也出现在那里。
- 另一个出现在搜索结果中的网站,原因同样是包含“检测到广告拦截器”这段文字。
- Malwarebytes广告拦截器,但似乎无法正常工作。
- Hacker News上关于YouTube打击广告拦截器文章的评论。滚动到第41条评论时,有人推荐了uBlock Origin。
Mwmbl允许用户推荐搜索结果,于是我尝试注册以添加uBlock Origin。Gmail将注册邮件归入了垃圾邮件文件夹。在我将uBlock Origin添加到搜索结果后,当我退出登录、使用无痕窗口搜索“ad blocker”时,它现在成了排名第一的结果,而其他所有结果都顺延了一位。如上所述,Mwmbl的评分是在我编辑搜索结果之前,而非之后。
-
- “Adblock Plus | 全球排名第一的免费广告拦截器”。
- 2-11. 指向 Adblock Plus 网站其他页面的子链接。
-
- “AdBlock — 最佳广告拦截器”。
-
- “Adblock Plus - 免费广告拦截器”。
-
- “YouTube 的广告拦截器打击行动”,一篇博客文章,引用并链接了人们讨论该主题的对话。
- 15-18. 在“有趣发现”板块下,有三篇关于 YouTube 打击广告拦截器的文章。其中一篇有一个全页弹出窗口,试图让你安装 TOTAL Adblock,带有“关闭”和“打开”按钮。“关闭”按钮无效,点击任何链接或“打开”按钮都会跳转到宣传 TOTAL Adblock 的页面。似乎无法关闭广告并阅读实际文章,除非使用开发者工具删除广告元素。第四篇文章标题为“FBI 现在建议在搜索网页时使用广告拦截器”,首屏内容 100% 是标题加上一个巨大的广告。向下滚动,还有更多广告。
-
- “AdBlock”。
-
- 来自 Adblock 网站的另一个链接,“Chrome 广告拦截器 - 立即下载并安装 AdBlock for Chrome!”。
- 21-25. 在“往昔回顾”板块下,有 optimal.com 广告拦截器、一篇关于如何规避广告拦截器的 Medium 文章、一篇来自 Mozilla 员工的博客文章“为什么广告拦截器有效”(回应 Ars Technica 的“为什么广告拦截对你喜爱的网站是毁灭性的”)、“为什么你需要一个全网广告拦截器(第一部分)”以及“一款流行的广告拦截器也在帮助广告行业”,副标题为“数百万人使用 Ghostery 工具阻止在线跟踪技术——有些人可能没有意识到它也在向广告行业提供数据。”
质量与 Google 和 Bing 相当。在指向诈骗的链接数量方面,大概介于两者之间。
ChatGPT
这里,我们尝试了提示词。如何安装最好的广告拦截器?
第一个建议是 uBlock Origin。第二个建议是 Adblock Plus。这似乎是明显优于其他结果的结果。
下载 Firefox
- 1-6. 下载 Firefox 的链接。
-
- 关于 Firefox 下载的垃圾博客,带有试图诱骗你安装恶意软件的广告。
- 8-9. 下载 Firefox 的链接。
- 10 [广告] 某种可疑网站,声称提供 Firefox 下载,但下载链接会跳转到其他网站,试图让你注册账户并索要个人信息和信用卡号。如果你尝试实际下载 Firefox,还会弹出窗口执行上述操作。至少有一个网站是某种赌博网站,因此该网站可能通过将用户引向赌博网站来获利?
大部分链接都不错,但前10个链接中有2个是诈骗链接。而且我没有看到2017年那种情况——当时谷歌付费让自己在搜索Firefox时排名高于Firefox本身。对于几乎所有搜索引擎都会返回大量诈骗链接的搜索查询,我可能会把前10个链接中有2个是诈骗链接评为“一般”甚至更好;但在这里,大多数搜索引擎都没有返回虚假或诈骗链接,我将其评为“差”。你可能会辩称评为“一般”或“好”也行,因为绝大多数用户会点击前几个链接,根本不会看到第7个链接;但我认为,如果谷歌足够确信这一点,以至于认为第7和第10个链接是诈骗链接也无所谓,那他们就应该只提供前几个链接。
Bing
- 1-12. 下载Firefox的链接或紧密相关的链接。
-
- [广告] Avast浏览器。
这就是整个第一页。看起来相当不错。没有看起来像诈骗的内容。
Marginalia
-
- “从网站下载Firefox还是使用包管理器更好?”(UNIX Stackexchange上的问题)
- 2-9. 与Firefox相关的各种链接,但不是Firefox下载链接。
-
- “Internet Download Accelerator在线帮助”
绝对比Bing差,因为没有链接指向Firefox下载。根据你对用户不被诈骗的重视程度,以及是否提供完全正确的链接,这可能比谷歌好或差。在这篇文章中,诈骗的权重相对较高,因此Marginalia在这里排名高于谷歌。
Mwmbl
- 1-7. 下载Firefox的链接。
-
- 一个与Firefox无关的Tumblr链接。该Tumblr的标题是“爱自己,下载Firefox”(这是整个博客的标题,而不是某篇博文)。
-
- 下载Firefox Nightly的链接。
-
- 一个极其可疑的链接,声称可以下载Firefox。尝试下载可疑的Firefox会弹出一个广告,试图诱骗你下载Opera。我没有运行Opera或Firefox的二进制文件来验证它们是否合法。
kagi.com
- 1-3. 下载Firefox的链接。
- 4-5. 在“有趣发现”标题下,有一个404链接指向一条推文,标题为“如果你尝试在Windows上下载并安装Firefox会发生什么”[该推文曾指出在Windows上下载Firefox会弹出操作系统级别的提示,推荐使用Edge“以保护你的电脑”](https://web.archive.org/web/20220403104257/https://twitter.com/plexus/status/1510568329303445507),以及一篇广告极多的文章(不过,值得肯定的是,这些广告似乎不是诈骗广告)。
-
- 下载Firefox的链接。
- 7-10. 3个下载非常旧版本Firefox的链接,以及一篇关于Firefox与eBay某种合作的博客文章。
-
- Mozilla主页。
-
- 下载Firefox的链接。
介于Bing和Marginalia之间。没有诈骗链接,但有很多不相关的结果。与某些大型搜索引擎不同,这些链接几乎全是下载错误版本的Firefox,例如,我使用的是Mac,但几乎所有链接都是Windows版下载。
ChatGPT
对于“如何下载Firefox?”这个提示,返回的下载Firefox的说明在技术上不正确。说明确实从访问正确网站开始,我认为用户通过查看网站并忽略说明,很可能能够下载Firefox。这似乎与Marginalia有些相似,即可以通过点击一些链接来下载,但结果并不完全正确。然而,我认为用户几乎肯定能找到正确的步骤,而使用Marginalia时则只是有可能,因此对于这个查询,ChatGPT的评分高于Marginalia。
为什么更宽的轮胎抓地力更好?
任何正确的解释至少必须符合以下条件:
- 假设基准是适合轮毂尺寸的中等宽度轮胎。
- 将两者都加宽到超过原厂轮胎(但仍能安装在车上且无需重大改装),通常能改善干地制动和圈速。
- 在湿滑条件下,更宽的轮胎设置通常有更短的制动距离(尽管这很大程度上取决于具体设置)和更好的圈速,但也会在更低速度下发生水滑。
- 仅增加轮毂宽度并使用相同轮胎,通常能在合理范围内改善圈速。
- 仅增加轮胎宽度而保持轮毂宽度不变,通常会导致圈速变差。
- 为什么胎压变化会产生这样的影响(我不会在这些要点中定义术语;如果这些文字对你来说没有意义,那也没关系)。
- 在小滑移角下,增加胎压会导致侧向力增加。
- 一般来说,降低胎压会增加有效摩擦系数(在合理范围内)。
这是一个有很多常见错误或不完整答案的问题,包括:
谷歌的回应
- 1. 一张“知识卡片”写着“更大的轮胎提供更宽的接触面积,从而优化其性能和牵引力”,但这什么也没解释。点击链接后,发现是SEO垃圾内容,包含许多[错误陈述,例如“宽轮胎在雪地牵引力方面更好吗?还是窄轮胎在冬季更可靠?简单答案是窄轮胎!”](https://mastodon.social/@danluu/111441790762754806) “断面宽度较小的轮胎在冬季条件下提供更多抓地力。它们对行驶路面施加更高的表面压力,从而提升雪地和冰面牵引力。”
- 2. [问题下拉菜单] “宽轮胎能提供更多抓地力吗?” 正确回答:“在干燥路面上,宽轮胎比窄轮胎提供更多抓地力,但宽轮胎的滑水风险更高。” 点击链接后,没有解释原因,更不用说回答我们提出的问题了。
- 3. [问题下拉菜单] “更大的轮胎能提供更好的牵引力吗?” 回答:“轮毂尺寸有什么影响?更大的轮毂提供更好的牵引力,并且由于轮胎橡胶更多,这也意味着更好的路面抓地力。” 解释原因时毫无逻辑。点击链接后,内容似乎是在讨论轮毂直径,不仅错误,而且实际上答非所问。
- 4. [问题下拉菜单] “为什么宽轮胎在物理上抓地力更强?” 然后给出了一些常见的错误解释。
- 5. “更宽的轮毂能改善操控性吗?” 回答:“更宽的轮毂和轮胎也会降低你的转向摩擦系数。” 点击链接后,没有解释原因,也没有回答我们提出的问题。
- 6. “宽轮胎的缺点是什么?” 回答:“操控和转向更困难。” 点击链接后,包含多个错误陈述,且没有解释原因。
- 7. “宽轮胎会增加摩擦力吗?” 回答:“力可以表述为压力乘以面积。对于宽轮胎,面积大但单位面积受力小,反之亦然。因此,无论轮胎宽窄,摩擦力相同。” 由于502错误无法加载页面,且页面不在archive.org中,但这似乎没问题,因为页面内容似乎是错误的。
- 8. “20英寸轮毂相比18英寸轮毂有什么优势?” 回答了另一个问题。点击链接后,是低质量的SEO垃圾内容。
- 9. “为什么赛车使用宽轮胎?” 回答:“宽轮胎对路面上的湿滑点或砂砾提供更多抵抗力。赛道上存在砾石、灰尘、橡胶颗粒和油渍,这些会限制牵引力。通过覆盖更宽的宽度,轮胎能更好地处理这类小问题。宽轮胎具有更好的磨损特性。” 可能技术上正确,但根本上不是答案,充其量极具误导性。
- 10-49. 其他错误的问题下拉菜单。通常既错误又答非所问,但有时对正确问题给出错误答案,有时对错误问题给出正确答案。我现在才意识到,点击问题下拉菜单会弹出更多问题下拉菜单。
- 50. “为什么宽轮胎抓地力更强?:r/cars” 提问者问了我同样的问题,最后总结道:“这感觉像是个很蠢的问题,因为宽轮胎=更多抓地力似乎很直观,但我不知道答案。” 最高赞回答完全是胡扯:“较小的表面积有更大的压力,但法向力与较大表面积相同。如果你将相同载荷分布到更大面积上,每平方英寸轮胎承受的力更小,因此更不容易被发动机的力克服。” 第二高赞回答是经典的Reddit风格:“没错,把你的科学废话扔出窗外吧。” 第三高赞回答对为什么宽轮胎侧向抓地力更好给出了一个看似合理的解释,但仍然具有误导性。像许多回答一样,它强调宽轮胎如何提供更好的侧向抓地力,并长篇大论解释原因,但宽轮胎也能缩短刹车距离,而给出的解释无法说明为什么宽轮胎刹车距离更短,因此肯定遗漏了问题的关键部分。总之,其余回答甚至没有真正尝试解释原因。
- 51-54. 其他Reddit回答与此合并,同样没有回答问题,尽管其中一个链接到https://www.brachengineering.com/content/publications/Wheel-Slip-Model-2006-Brach-Engineering.pdf,内容不错,但并未回答问题。
- 55. 某人的YouTube视频的SEO垃圾内容;视频没有回答问题。
- 56. 广告极多的网站,带有弹出窗口试图诱骗你点击广告等;包含我在其他页面上见过的文本,这些文本被复制过来用于SEO广告农场(且文本中的答案不正确)。
Bing
-
- 知识卡片错误地声称“与地面的接触面积更大”。
- 2-4. 轮播展示中,没有一个链接正确回答了问题。(3) 来自必应,与谷歌搜索结果中的 (50) 相同。(2) 没有错误,但也没有回答问题。(3) 是某个YouTube视频的SEO垃圾博客(与google.com的55相同链接)。该视频没有回答问题。(3) 和 (4) 实际上是同一个链接,也没有回答问题。
-
- “这就是为什么更宽的轮胎抓地力更强”。某个YouTube视频的SEO垃圾博客。该YouTube视频没有回答问题。
- 6-10. [进一步探索] 结果。(6) 明显错误,(7) 与 (3) 和 (4) 是同一个链接,(8) 是 (2),某个YouTube视频的SEO垃圾博客,且视频没有回答问题,(9) 是某个YouTube视频的SEO垃圾博客,且视频没有回答问题,(10) 是包含大量错误信息的通用SEO垃圾博客。
-
- 与 (2) 和 (8) 是同一个链接,仍然是某个YouTube视频的SEO垃圾博客,且视频没有回答问题。
- 12-13 [进一步探索] 结果。(12) 是某种SEO广告农场,试图让你制造“虚假”广告点击(存在全屏弹出窗口,如果点击它们,会导致你通过某种广告点击进入某个普通网站,从而为设置广告农场的人带来收入)。(13) 是制作了该话题下SEO垃圾博客常见目标的两个视频之一的作者网站。它没有回答问题,但至少我们在这里找到了实际来源。
进一步浏览后,许多其他链接与上述链接相同。似乎没有链接能正确回答问题。
Marginalia
原始查询返回零结果。移除问号后返回一个单一结果,与必应的 (3) 和 (4) 相同。
Mwmbl
- 《纽约时报》文章,标题为“为什么女性支付更高的利息”。这是唯一返回的结果。
移除问号后返回一篇关于自行车轮胎的文章,标题为“冬季使用胖胎:你需要知道什么”。
Kagi
- 一张知识卡片错误地写着“更宽的轮胎与地面接触面积更大,因此能提供更强的抓地力”。
- (来自谷歌的50条结果)
- Reddit问题,下面有许多错误答案
- Reddit问题,下面有许多错误答案。最高赞回答是“原因和你用手按在桌子上滑动比用手指滑动更费力一样。更多的橡胶接触路面 = 更大的摩擦力”。
- (3)和(4)来自必应
- YouTube视频,标题为“更宽的轮胎能提供更多抓地力吗?”。点击视频后,在播放前有1分30秒的广告。视频本身不错,但它只回答了标题中的问题,而没有解释为什么会出现这种情况。第一个广告看起来像是广告收入诈骗。第一个链接实际上会跳转到第二个链接,任何点击都会通过某个广告的推广链接导向一个产品。
- “这就是为什么更宽的轮胎等于更多抓地力”。针对(6)的SEO博客垃圾文
- 针对另一个YouTube视频的SEO博客垃圾文
- 针对(6)的SEO博客垃圾文
- Quora回答,其中最高赞回答没有回答问题,而且我无法阅读所有回答,因为我没有登录或不是高级会员之类的原因。
- 谷歌(56条结果),从其他网站抄袭的文字,以及一个带有弹出窗口试图诱骗你点击广告的网站
- 前ChatGPT时代的胡言乱语文本,以及一个充满广告的页面。不同寻常的是,我点击的几个广告看起来是正常广告,而不是诈骗。
- 针对广告农场的博客垃圾文,带有弹出窗口试图诱骗你安装恶意软件。
- 听起来像ChatGPT生成的胡言乱语的页面。有一个“最后更新”的时间戳,是服务器端生成的,与你导航到该页面的确切时间一致。页面试图用全屏弹出窗口诱骗你点击广告。据我所知,广告似乎不是诈骗。
- 页面错误地写着“总之,更宽的轮胎并不能提供更好的抓地力,它与更窄的轮胎提供的抓地力相同”。有一些广告试图诱骗你安装恶意软件。
ChatGPT
提供了一份“幻觉”原因列表。这份列表的语法比大多数网络搜索结果要好,但仍然是错误的。ChatGPT无法回答这个问题并不奇怪,因为它在处理那些既更容易推理、且训练数据中包含大量正确答案的问题时也经常出错,例如,Joss Fong 指出,当她的侄女向 ChatGPT 询问重力时,回答是胡言乱语:“……这就是为什么羽毛慢慢飘落而石头快速下落——地球对它们都有引力,但石头受到的引力更大,因为它更重。”
总体而言,没有哪个搜索引擎能给出正确答案。Marginalia 似乎是其中最好的,它只提供了几个指向错误答案的链接,并且没有指向诈骗的链接。
为什么他们不断把 CPU 晶体管做得更小?
我上高中时就有这个疑问,我的 AP 物理老师解释说,这是因为把晶体管做得更小可以让 CPU 更小,从而让整个电脑更小。即使当时我才 14 岁,我也能看出这是个荒谬的回答,跟如今 ChatGPT 的幻觉没什么两样——那时候,电脑通常比现在大得多,机箱里全是大量空余空间,而 CPU 相对于机箱空间来说几乎不占地方,而且,随着电脑越来越小,CPU 实际上反而在变大,而不是变小。我问了其他人,也没得到真正的答案。当时公共网络还处于早期阶段,我也找不到答案,只能找到类似“更小的晶体管更快”或“更小 = 电容更小”的说法。但为什么它们更快?又是什么让它们电容更小?具体来说,几何结构如何导致这种缩放,从而使晶体管变快?一般来说,把东西缩小并不明显会变快,例如,如果你简单线性地缩小一根导线,它似乎根本不会变快,因为横截面积是二次方减少的,导致每单位距离的电阻二次方增加。但长度也线性减少了,所以总电阻线性增加。然后电容也线性减少,所以一切相互抵消。总之,对于晶体管来说,事实证明同样的简单缩放逻辑表明它们会变快(当时,晶体管足够大,导线延迟相对足够小,以至于缩小晶体管能带来极大的性能提升)。如果你有正确的解释,几分钟内就能向一个学过物理的高中生解释清楚,但直到我读了 VLSI 教科书,才找到这个问题的答案。
现在网络上的内容足够多了,肯定有很多好的解释。为了验证,我用非天真的搜索词找到了一些好的结果。不过,让我们看看用上面那种天真的搜索方式会怎样。
- 1. 一张知识卡片写着“更小的晶体管可以在不发生过热的情况下进行更多计算,因此能效更高”,这并非完全错误,但也不是我心目中能解释“为什么”的答案。文章本身很有趣,但讨论的是另一个话题,并未解释原因。
- 2. [问题下拉菜单],“为什么晶体管越做越小?”打开网站时立即弹出广告。网站并未真正回答问题,只是说“自20世纪50年代首个集成电路诞生以来,硅晶体管一直遵循摩尔定律缩小,以便在微芯片上集成更多器件,提升计算能力。”
- 3. [问题下拉菜单],“为什么晶体管需要做小?”答案是“两个导体之间的电容取决于其物理尺寸:尺寸越小,电容越小。而更小的电容意味着更高的速度和更低的功耗,因此更小的晶体管可以在更高时钟频率下运行,同时散发热量更少。”这没有错,但网站并未解释晶体管缩小后速度提升的缩放原理。该页面主要关注分立元件,并指出“一般来说,电阻、电容和电感等无源元件在缩小时性能并不会显著提升:在很多方面反而会变差。因此,小型化这些元件主要是为了缩小体积,节省PCB空间。”所以它实际上回答的是另一个问题。
- 4. [问题下拉菜单],“为什么微芯片越做越小?”SEO垃圾文章,除了“越小越快”之类的话,并未回答问题。
- 5. [问题下拉菜单],“为什么微处理器越做越小?”链接指向Stack Exchange。最高票答案是芯片越小良率越高、成本越低,我认为这是非答案,因为做小也极其昂贵,那么成本降低的原因是什么?而且,即使成本不降,公司出于性能原因仍会追求更小的晶体管,所以这个答案忽略了主要原因,甚至可以说是主要原因。第二个答案实际上有点解释,“原因是随着晶体管栅极变小,阈值电压和栅电容(所需驱动电流)会降低”,但既缺少解释的完整性,也没有给出直观、物理层面的原因说明为什么会这样。其他答案则是“CPU不断变小的核心原因很简单:在计算领域,越小越强大”之类的非答案。通过搜索这些关键词,有可能找到真正的解释。
- 6. “为什么CPU和GPU制造商试图让……更小?”最高票答案是“更小的晶体管更快、更省电。小就是好。”这种非答案。由于是Quora且我不是订阅用户,其他答案被一个建议我“开始免费试用,以‘访问此答案并作为Quora+订阅者支持作者’”的屏幕遮挡。
- 7-10. 指向其他Quora答案的子链接。由于我不是订阅用户,屏幕空间大部分被广告占据。我能读到的内容中没有一个回答了问题。
必应
-
- 多部分知识卡片。前几部分内容有些含糊其辞,但最后一部分包含部分答案。点击答案的最后一部分,会跳转到一个 Stack Exchange 问题,其中包含对该部分答案更详细的说明。部分答案中的信息足以进行搜索,进而找到更完整的解释。
- 2-4. [其他人也问] 一些答案,虽然有些关联,但并未直接回答问题。
-
- 针对另一个问题的 Stack Exchange 答案。
- 7-10 [进一步探索] 完全无关问题的答案,但第 10 条除外,它是针对一个相关问题的、广告泛滥的垃圾博客文章,其中包含大量半相关文本,文本间穿插着许多广告。
Kagi
-
- “为什么开发用于 CPU 和 GPU 的更小晶体管需要多年时间?”,来自 r/askscience。有一些还不错的评论,但它们回答的是另一个问题。
- 2-5. 其他 Reddit 链接,没有回答问题。其中一些是人们在问这个问题,但答案都是错误的。一些链接回答了不同的问题,并且对这些问题的回答相当不错。
-
- Stack Exchange 问题,答案不正确且具有误导性。
-
- Stack Exchange 问题,但这是一个不同的问题。
-
- Quora 问题。我在未成为会员的情况下能读到的答案并没有真正回答问题。
-
- Quora 问题。我在未成为会员的情况下能读到的答案并没有真正回答问题。
-
- 2006 年的 Metafilter 问题。最初的答案从根本上就是错误的,但后面某个答案链接到了 MOSFET 的维基百科页面。不幸的是,链接指向的是现已移除的锚点 #MOSFET_scaling。虽然仍有一个缩放部分,但解释得很差。还有一个指向 Dennard Scaling 页面的链接,该页面在技术上正确,但解释非常糟糕。不过,有人可以使用这些术语搜索更多信息,从而获得正确的信息。
Marginalia
无结果
Mwmbl
- 一个指向 Vox 文章的链接,标题是“为什么艺术家们不断制作节日专辑?”。这是唯一的结果。
ChatGPT
给出了一些非答案,比如“提升性能”。要求 ChatGPT 对此进行扩展,输入“请解释性能提升”,结果得到的仍然是些非答案,以及相当具有误导性的答案,例如:
更短的互连:更小的晶体管导致它们之间的距离更短。更短的互连会降低电阻和电容,从而减少信号在晶体管之间传输所需的时间。更快的信号传播提升了集成电路的整体速度和效率……信号在晶体管之间传输所需时间的减少,加上更低的功耗,使得更高的时钟频率成为可能。
对于不了解电气工程的人来说,这看起来似乎合理,但这与ChatGPT对重力的解释并无太大区别:“……这就是为什么羽毛缓缓飘落而石头快速下落——地球对两者都有引力,但石头更重,所以受到的引力更大。”
温哥华2023年冬季降雪预报
良好结果:加拿大环境部的降雪预报,预测降雪量将显著低于正常水平(且气温高于正常水平)
谷歌
- 来自一家本地除雪公司的知识卡片,错误地指出:“2023/2024年冬季的预测表明,我们预计将迎来又一个降雪充沛的冬季,气温将略高于和略低于冰点。请提前做好准备。”打开页面后,我们看到下一句话是:“让Alblaster(该公司名称)随时准备处理您的除雪和撒盐工作。我们对冬季天气采取主动措施,这样您、您的员工和客户就无需担心即将到来的暴风雪。”该链接的目的是通过编写虚假预测,促使您购买除雪服务,无论其必要性如何。
- [问题下拉菜单] “温哥华2023年冬季预测是什么?”错误地表示将“降雪较多”。
- [问题下拉菜单] “2023年加拿大冬季预测是什么?”链接到安大略省的冬季预报,因此不仅省份错误,海岸也错误,而且实际上并未回答下拉菜单中的问题。
- [问题下拉菜单] “2023-2024年不列颠哥伦比亚省冬季预测是什么?”预测不列颠哥伦比亚省将迎来潮湿温和的冬季,这并不错误,但并未真正回答问题。
- [问题下拉菜单] “2023-2024年冬季预测是什么?”包含美国天气的预测。
- 博客垃圾文章,包含大量无意义的文字和遍布的广告。文字内容自相矛盾,且未回答问题。有巨大的弹出广告覆盖页面顶部一半。
- 来自同一来源的另一篇博客垃圾文章。广告众多;未回答问题。
- 广告充斥的文章,回答了一些相关问题,但未回答此问题。
- 广告极多的文章,由于广告数量过多几乎无法阅读。大量谈论厄尔尼诺现象。最终提到由于厄尔尼诺现象,不列颠哥伦比亚省降雪量应低于正常水平,但不列颠哥伦比亚省面积近1亿平方公里,且全省预报并不相同,因此您或许可以希望此处关于不列颠哥伦比亚省的评论适用于温哥华,但此链接仅能让您猜测答案。
- 广告极多的文章,但确实有一张地图,标注为“冬季降水”,似乎与雪而非雨有关。该地图与加拿大环境部的地图差异很大,但确实显示温哥华上空的“冬季降水”减少,因此您可能从这张地图中得出正确的结论。
必应
- 1-4. [新闻轮播] 广告泛滥的文章,根本不回答问题。多篇文章的广告面积超过页面一半。
- 5. 某种看似有答案的页面,但数据似乎是完全捏造的?有一张图表显示“冬季风暴”的逐日概率。从我搜索时的情况来看,未来两周每天出现“暴风雪”的平均概率约为50%。而那些看起来不虚假的预报显示,每日概率仅为1%或更低。这个页面似乎是某种为了SEO而伪造的预报,靠广告赚钱?
- 6-8. [来自同一网站的更多链接] 各种广告页面。其中一个是“联系我们”页面,但主要的“联系我们”面板实际上是一个陷阱,诱使你点击广告,进入某种看起来像骗局的月度支付服务。
- 9-14 [探索6个相关页面……根据热门内容推荐] 只有一个链接是相关的。该链接包含一个“农民年鉴”的预报,与加拿大环境部的预报相差甚远。这个农民年鉴页面主要似乎是广告,诱使你购买农民年鉴的产品,尽管它也有常规广告。
Kagi
- 1. 与Bing(5)相同的SEO伪造预报
- 2-4. 来自诈骗天气网站的更多结果
- 5-7. [新闻] 不相关的结果
- 8. 来自与Google(6)相同网站的垃圾文章
- 9-13. 来自同一网站的更多SEO垃圾信息
- 14. 与Google(1)相同的伪造预报
- 15. 页面被错误地标记为“2009年12月25日”(实际上是一个近期页面),且不包含相关结果
Marginalia
无结果。
Mwmbl
- 1. 2022年关于停电的广告泛滥新闻文章。包含自动播放的视频广告和许多其他广告。
- 2. 2021年关于费城降雪预报不准确的文章。文章有一个加载缓慢的全页弹窗,几秒后出现,且充满广告。
- 3. 2016年关于俄亥俄河最后一次结冰的文章。
- 4. 来自俄勒冈州某个地方新闻网站,2023年2月关于当时降雪预报的文章。网站有自动播放的视频广告,且充满其他广告。点击其中一个随机广告(“亚马逊讨厌你这样做,但他们无法阻止你(这太聪明了)”),结果广告试图诱使你安装一个Chrome扩展。该广告试图伪装成一个有机博客文章,看起来像是某个网站只是想帮你省钱,但如果你试图离开这个“博客文章”,会出现一个全页弹窗,试图诱骗你安装这个Chrome扩展。访问基础URL后发现,整个网站实际上是一个试图诱骗用户安装这个Chrome扩展的网站。这是最后一个结果。
“2023年冬季温哥华的降雪预报是什么?”
不回答问题,建议使用网站、应用程序或天气服务。
询问“能否推荐一个提供预报的天气网站、应用程序或天气服务?”后,ChatGPT 返回了一些随机天气网站,但这些网站并没有季节性降雪预报。
我重试了几次。有一次,我不小心把整个 ChatGPT 问题粘贴了进去,导致我的问题前面多了“User\n”。那次,ChatGPT 建议了“加拿大气象中心、加拿大环境部或其他可靠的天气网站”。当询问正确的网站时,最相关的回复是“加拿大环境部天气”,至少该网站似乎有合理的季节性降雪预报。其他链接仍然指向不相关的网站。
附录:Google 知识卡片结果
总的来说,我发现 Google 知识卡片的结果质量很差,既针对具体问题(这些问题很容易找到答案),也针对一些愚蠢的问题,比如“跑步是什么时候发明的”,多年来,这个问题的答案臭名昭著地显示为“1748年。跑步是由托马斯·跑步发明的,当时他试图同时走两次”(这个答案来自 Quora 的一个回答)。
我曾有一个文档,记录了我看到的每一个知识卡片,以统计其中正确的比例。我不确定是否会把它写成文章,所以这里列出一些“随机”查询及其知识卡片结果(如果有人好奇的话,我追踪时看到的大多数知识卡片结果都是错误的)。
- “oc2 gemini 长度”(寻找一种名为 gemini 的 oc2 独木舟的长度)
- 20 英寸(这是一篇文章中提到的一个婴儿的长度,该文章也提到了船的长度,为 24 英尺 7 英寸)
- “忙碌海狸数”
- (604) 375-2754
- “Feedly 收入”
- “520 万美元/年”,通过一个链接指向一个似乎完全捏造私营公司收入和利润估算的网站
- “哪些航空公司从 JFK 机场直飞 BLI 机场?”
- “阿拉斯加航空 - (AS),每月有 30 个直飞航班往返纽约和贝灵厄姆;达美航空 - (DL),每月有 30 个直飞航班往返 JFK 和 BLI”。这听起来合理,但当我查证时,发现这是错误的。它链接的页面有一堆文字,比如“从 JFK 到 BLI 有多少早班航班?阿拉斯加航空 - (AS) 平均列出 1 个在中午 12:00 之前起飞的航班,其中从 JFK 的首班起飞时间为上午 09:30,中午前最后一班起飞时间为上午 09:30”,似乎旨在为这类问题生成知识卡片。答案是否捏造并不重要,因为该网站的目标似乎是通过知识卡片获取流量或曝光度
- “加拿大航空 温哥华 纽瓦克”
- 在我进行此搜索时,显示了一张知识卡片,表明 AC 7082 航班将于次日上午 11:50 起飞,但该航班已停飞数月,而且次日上午绝对不会有 AC 7082 航班起飞
- “TYR 飓风 5 级 氯丁橡胶厚度”
- 1.5 毫米(这是错误的)
- “英特尔工程师人数”
- (604) 742-3501(我是在找英特尔雇用的工程师人数,而不是电话号码,即使我在找英特尔工程师的电话号码,我也不认为这是正确的)
- “boston up118s 尺寸”
- “5826298 x 5826899 x 582697 英寸”(这是一架钢琴,不,它没有 92 英里长)
- “国际跳棋竞技玩家数量”
- 2
- “弗雷泽河水流速度”
- “每小时 97 至 129 公里(60 至 80 英里)”(这是错误的)
- “futura c-4 冲浪艇重量”
- “39 磅”(这实际上是另一款冲浪艇的重量;这篇文章恰好也提到了 futura c-4)
附录:常见问题
如前所述,我收到的最常见回复通常都是帖子中明确涵盖的内容,因此我在此不再重复。然而,每当我写一篇审视任何事物的帖子时,我也会收到大量类似这样的评论,而且这确实是我在这篇帖子下收到的第一条评论。
这不是一项经过同行评审的研究,这是垃圾
正如我在另一篇帖子中指出的那样,
学术论文并没有什么神奇之处。我的名字出现在几篇论文上,其中一篇还在本领域顶级会议上获得了最佳论文奖。但我博客上普通文章的平均严谨程度,比我论文的平均水平要高,甚至比我读过的那些论文的平均水平也高。
写论文时,我得应付那些想塞进虚假或误导性内容、让论文更好看的合著者,而我抵制这种做法的能力相当有限。但在博客上,我不需要面对这些,可以尽我所能写出准确的结果,哪怕这让成果看起来不那么有趣,或者更不可能获奖。
这一点在这里同样适用。事实上,我在这个领域(信息检索,简称IR,俗称搜索)也有一篇最佳论文奖。我并不觉得IR论文特别严谨。我确实极力推动让我那篇在顶级会议上获得最佳论文奖的文章更严谨,虽然我赢了一些争论,但也输了一些,那篇论文存在不少问题,如果放在博客文章里,我是不会允许它们通过的。我怀疑,发表这种评论的人大多不读论文,即使读了,也理解不了。
另一种常见的回应是:
你的表格是错的。我在Kagi上试了这些查询,得到了很好的结果 [但语气强烈得多]
我不明白为什么人们对Kagi有如此强烈的感受,但到目前为止,所有这些回应都来自Kagi用户。没有人能在轮胎、晶体管或雪的查询(再次注意,这不是查询每日天气预报,查询中的“2023年冬季”已明确暗示)上得到好结果,而且如果你没有广告拦截器,其他查询的结果也不太好。我想,下一个告诉我这话的人也许真能得到好结果,但考虑到目前零正确率的情况,这似乎相当不可能。
例如,有用户声称结果都很好,但他们只固定了GitHub的结果,并只运行那些在GitHub上能获得好结果的查询。这实际上比使用Google或Bing并编写良好查询更糟糕,因为当GitHub不是合适的搜索场所时,你的结果中会混入噪声。当然,如果你编写非天真的查询,你也可以声称Bing很出色,所以奇怪的是,这么多Kagi用户愤怒地写信给我,而Google或Bing用户却没有。Kagi似乎触及了特斯拉和苹果曾成功触及的同一脉络——用户因有人批评他们喜爱的东西而愤怒,然后为他们钟爱的产品写出毫无逻辑的辩护,这对Kagi来说是个好兆头。我收到的这类评论不止来自一个Kagi用户,而是很多。
- 这个人确实接着说了“但是,很多科技行业/贸易相关的内容确实被LLM生成的垃圾信息淹没了”。然而,我们在这篇文章中看到的结果通常并非LLM生成的文本,很多页面甚至早于LLM出现,而且低质量结果似乎并不局限于科技相关领域,甚至在这些领域也不算特别严重。或者,再举一个例子:我们Bluesky上的那位意见领袖是波特兰当地一个乐队的成员。如果我搜索“[乐队名]成员”,得到的是一个知识卡片,上面写着“[另一个乐队名]是一支英国独立摇滚乐队,成立于萨默塞特的格拉斯顿伯里。乐队由[姓名和乐器]组成。”[返回]
- 例如,对于YouTube下载器,我的首选是搜索HN,这通常会返回合理的结果。虽然这招管用,但如果不行,我的下一步是搜索Reddit(当然,不是用Reddit自带的搜索),结果好坏参半;查看每个结果的相关信息后发现,第二个返回的结果(
yt-dlp)是好的,而其他大部分结果都很差。其他人也有不同的获取好结果的方法,比如Laurence Tratt的习惯是搜索“youtube downloader cli”,Heath Borders则搜索“YouTube Downloader GitHub”;这两种搜索方式效果也都不错。如果你是一个掌握了各种技巧、几乎总能通过正确调整搜索词获得好结果的人,你很容易意识不到大多数用户其实并不知道怎么做。从观察非专业用户按照专家用户的建议使用电脑的情况来看,很明显,许多资深用户严重低估了自己掌握的知识量。例如,我听过很多程序员说他们擅长使用电脑是因为“我只是随机点击东西看看会发生什么”。也许是这样,但当他们把这种建议告诉新手用户时,通常效果不佳,新手用户会点到错误的随机东西上。事实上,专家用户并不是真的在随机点击;他们是在利用自己对哪些点击可能有意义的心理模型,去尝试那些可能合理的点击。搜索也是如此,人们会给出一些听起来半合理的建议,比如“只需在查询中添加site:reddit.com”。但添加“site:reddit.com”会让很多查询变得更糟而不是更好——你必须有一个心理模型,知道哪些查询适用这个方法,哪些查询不适用。
当人们长期使用某种算法时,往往这个算法效果很差,而且让技术人员感到非常惊讶。例如,Misha Yagudin 提到:“我最近在开普敦和几位俄罗斯移民聊了聊(两对夫妇经营旅行社,另一对夫妇做卢布<>泰达币<>美元的兑换)。他们很惊讶我居然不用社交媒体,而我发现现在人们用 Instagram(!!)而不是谷歌来搜索产品和服务。方法是:搜索你想要的东西,比如’铁人三项装备’,随便点几下,接下来几天你会收到一堆推荐,再多点几下,推荐会更精准。这让我觉得太不可思议了。”
[返回] 3. 她比普通电脑用户表现好一些,但她的心理模型仍有大量漏洞,容易导致电脑感染恶意软件。对于普通电脑用户来说,互联网上充斥着程序员分享的故事,比如“我不得不对家人大喊’别点那个,那是广告’的次数简直让人抓狂。直到我父亲电脑中了严重的病毒、不得不彻底重装系统,他才肯装广告拦截插件。”。互联网上充斥着排名比正常搜索结果还高的诈骗广告,这些广告会安装恶意软件,相当一部分用户的设备就是因为点击广告或恶意SEO搜索结果而被攻陷的。如果你想阻止他们的设备被控制,就得时刻盯着大多数用户。[返回] 4. 有一次不小心在查询前加了“User\n”,结果返回了好的结果而非坏结果,这让人想起如果你让ChatGPT“写一篇关于”Colin Percival的文章,它会认为他死了;但如果你让它“写一篇关于”Colin Percival的文章(首字母大写),它却认为他还活着。搜索排名通常已经采用多层排序机制,所以也许可以通过运行随机扰动的查询,再用第二层排序器来获得好结果,或者ChatGPT本身也可以内置类似功能。[返回] 5. 在谷歌停止返回我想要的每条推文一段时间后,推特搜索一度足够好用,我能用它找到推文。然而,在被收购后,推特搜索经常以各种方式失效。大约有3-5个月,搜索完全找不到我的任何推文。而在这段时间前后,即使我搜索推文的精确子串,搜索也经常无法返回那条推文,所以我常常不得不采用各种奇怪的搜索方式,寻找那些我预期会链接到目标推文的内容,然后手动点击链接才能找到那条推文。[返回]