我经常被问到的一个问题是:为什么要费心去测量X,而不是直接去构建点什么?更直白地说,在最近一次与某位通讯作者的对话中,他对我未来想做的一些测量项目(与键盘vs鼠标键盘延迟终端延迟端到端延迟测量等项目类似)的评价是——带着得意的表情和略带轻蔑的语气——“所以你只是想上Hacker News头条?”

前一种说法暗示测量不如构建有价值,后一种则暗示测量根本毫无价值(也许除了博取名声之外)。但我不认为测量是低人一等的,更不觉得它毫无价值。如果说有什么不同的话,正因为测量和写作一样通常不被重视,所以找到高回报的测量项目比找到高回报的构建项目要容易得多。

我们先来看几个影响力巨大的测量项目例子。我首选的例子是Kyle Kingsbury的Jepsen工作。在Jepsen出现之前,少数几家大公司(就是那些如今市值超过1万亿美元、被人们称为“超大规模”的公司)拥有经过充分测试的分布式系统。但它们大多没有以真正能推动知识传播到整个行业的方式谈论测试方法。在这些公司之外,大多数分布式系统按照我的标准测试得并不特别充分。

当时,网上关于分布式正确性的讨论中,一种常见模式是:

:数据库X损坏了我的数据。 :我用着没问题啊,从来没损坏过我的数据。 :你怎么知道?你检查过数据损坏吗? :你什么意思?如果有数据损坏我肯定知道(另一种回答:当然,我们有时会有数据损坏,但很可能是硬件问题,所以不是我们的错)。

Kyle的早期工作在他测试的几乎所有系统中都发现了严重缺陷,尽管当时的Jepsen远没有现在这么复杂:

  • Redis Cluster / Redis Sentinel:“我们证明Redis在网络分区期间丢失了56%的写入”
  • MongoDB:“在这篇文章中,我们将看到MongoDB丢失了数量惊人的数据”
  • Riak:“我们将看到Riak中的最后写入者获胜策略如何导致无界的数据丢失”
  • NuoDB:“如果您正在考虑使用NuoDB,请注意该项目的营销和文档可能夸大了其当前能力”
  • Zookeeper:早期Jepsen测试中唯一一个没有发现灾难性错误的分布式系统
  • RabbitMQ集群:“RabbitMQ丢失了约35%的已确认写入……这不是一个理论问题。据我所知,至少有两个RabbitMQ部署在生产环境中遇到了这个问题。”
  • etcd和Consul:“etcd的寄存器不是线性一致的……Consul中的‘一致性’读取会返回任何自认为是领导者的节点的本地状态,从而允许读取到过期数据。”
  • ElasticSearch:“健康检查端点会撒谎。在脑裂场景下,它很乐意报告集群状态为绿色……1961次已确认写入中有645次丢失。”

这些问题中的许多已经存在了相当长的一段时间

真正令人惊讶的是,这个问题居然被忽视了这么久。最初的问题报告于2012年7月,距今已近两年。网站上没有任何讨论,文档中也没有提及,而参加过Elasticsearch培训的用户告诉我,这些内容在课程中完全没有被提到。

Kyle接着引用了多位在生产环境中遇到问题的用户,然后冷静地指出:

有些人实际上主张将Elasticsearch用作主数据存储;我认为在目前阶段,这多少有些不太明智。

虽然我们无法通过A/B测试来比较存在Kyle与不存在Kyle的平行宇宙,也无法断言在没有Kyle的世界里,分布式系统需要多久才能认真对待正确性问题,但根据我多年来观察开发者如何处理正确性漏洞的经验,我敢打赌,在像Kyle这样的人出现之前,分布式系统会普遍存在严重的正确性问题。我常见到的典型反应是,当灾难性漏洞被报告时,项目维护者会假定漏洞报告是错误的(如果你查看Kyle工作最初几年的回应,可以看到许多这样的例子)。当报告者无法提供漏洞复现方法时——这在分布式系统中相当常见——漏洞就会被当作不存在而一笔勾销。

当报告者确实能提供复现方法时,下一道防线就是争辩说这种行为是可以接受的(同样,从对Kyle工作的回应中也能看到许多例子)。一旦漏洞被确认为真实存在,接下来的辩护就是声称这个漏洞不需要修复,因为它极其罕见(例如,“站在象牙塔里高谈阔论理论固然诱人,但现实世界的成本/收益如何?你是要造一辆NASA航天飞机运输车去买菜吗?”)。然后,在承认漏洞应该被修复之后,最后一道防线就是辩称该项目非常重视正确性,并且已经尽力而为;开发和测试方法论无需改变,因为漏洞的出现只是偶然,而且在不改变方法论的情况下,类似的漏洞未来也不会再发生。

Kyle的工作突破了这些防线。如果没有类似的工作,我认为我们仍然会看到这些作为应对分布式系统漏洞的主要手段(而不是那些能够真正产生相当可靠系统的测试方法论)。

这只是一个具体的例子,但我发现,在那些没有人发布产品测量/基准数据的领域,产品通常都不够优化,而且往往一旦被测量,就能以相对直接的方式修复。以下是一些例子:

  • 键盘:在我发布这篇关于键盘延迟的文章后,至少有一家主打高速游戏设备的大厂商开始真正优化输入设备延迟。当时测量键盘延迟的人极少,我只能找到另一个做过测量的人(我想找其他测量结果,是因为我测出的数值高得离谱,而网上能找到的唯一测量结果与我的数据在同一范围)。如今,几乎所有主要游戏键盘和鼠标厂商都推出了低延迟设备,而在此之前,游戏设备公司只关注那些对性能几乎没有影响的噱头优化(比如更高频率的USB轮询)。
  • 电脑:在我发布其他关于电脑延迟的文章后,一家此前并未认真开展UI延迟优化工作的大型软件公司的工程师告诉我,一些工程师已经开始测量和优化UI延迟;此外,alacritty的作者提交了这个工单,探讨如何降低alacritty的延迟。
  • 汽车前大灯:Jennifer Stockburger指出,当《消费者报告》开始测试前大灯时,汽车制造商的工程师感谢CR为他们提供了改进前大灯效果所需的依据;此前,他们会在与设计师的争论中落败,因为设计师想要更美观但效果较差的前大灯,而通过设计更好的前大灯来提高汽车安全性很难说服人,因为没有商业案例,但让汽车在《消费者报告》评测中获得更高分数,有时能让他们赢得争论。如果没有第三方测量,注重商业的汽车高管没有理由听取工程师的意见,因为几乎没有新车购买者会认真测试前大灯照亮道路的效果,更少有人会测试前大灯对迎面来车司机的眩光程度,因此设计师可以不受约束地创造他们认为最好看的产品,而不考虑实际效果
  • 汽车防抱死制动系统:在《消费者报告》和《Car and Driver》发现特斯拉Model 3的制动距离极长(从60英里/小时到停止需152英尺,从70英里/小时到停止需196英尺)后,特斯拉更新了用于调节刹车的算法,从而将制动距离缩短到足以让特斯拉从同级最差变为优于平均水平。
  • 汽车碰撞安全性:除了沃尔沃,汽车制造商通常设计汽车以在公布的碰撞测试中获得最高分数;它们会在新测试公布后根据需要增加安全配置以取得好成绩,但不会提前这样做

以上任何项目任何人都可以完成(虽然《消费者报告》会购买他们测试的汽车,但一些新兴的汽车评测者会在Turo上租车)!

这篇文章已经解释了为什么测量是有价值的,但老实说,我进行测量的动力其实是好奇心。我只是想知道某个问题的答案。早在写博客之前,我就一直在做这件事,即使现在有了博客,我往往也不会把结果写下来。但即便你对与世界互动时实际发生的事情毫无好奇,只是“单纯”想找些有用的事做,由于几乎所有事物都缺乏测量,你也很容易找到高回报的测量项目——至少从对世界的影响来看是这样。如果你想赚钱,做点东西可能更容易变现。

附录:“所以你只是想上Hacker News头条?”

当我看到那些我喜欢的、登上HN头条的帖子,比如Chris Fenton的项目Oona Räisänen的项目,我觉得很明显,他们并非受HN或其他名声驱动,因为在他们的博客成为HN或其他社交媒体热门之前,他们早就一直在做这些有趣的项目了。我不认识他们,但如果要猜测他们做这些项目的原因,最主要的就是他们觉得做这类项目很有趣。

我当然不能说没有人做个人项目的主要目标是上HN头条,但作为一种动机,它与我读到的HN上个人项目内容最明显的解释(即某人觉得有趣、出于好奇等)如此不一致,以至于我觉得有人会认为这是一种合理的归因动机,实在令人费解。

附录:我写测量帖子的动机

从某种意义上说,我为什么决定写这些帖子其实并不重要,但如果我在读别人关于这个话题的帖子,我仍然会好奇是什么促使他们动笔,所以这里就说说我写测量帖子的缘由(就本文列表而言,这些帖子也包括我整理数据而不进行直接测量的内容)。

  • danluu.com/car-safety:当时我在考虑买车,想知道既然大多数车在美国的测试中都能拿到最高分,不同制造商之间在安全性上是否会有显著差异。
    • 这篇文章里没有包含这部分内容,因为我觉得它太琐碎了(即使不进行计算,数量级也是显而易见的),但我还是计算了死于车祸的概率,以及从一辆旧二手车换成一辆较新的二手车后预期寿命的变化。
  • danluu.com/cli-complexity:这个想法源于我看到 Gary Berhardt 展示如何统计 ls 命令中单字母命令行选项的数量,这让我好奇这是否是近期才有的变化。
  • danluu.com/overwatch-gender:我刚刚看到 Reddit 上两个巨大的讨论帖,争论在线游戏中女性是否受到性别偏见。我觉得自己花在获取相关数据上的时间,可能比那些帖子中人们写评论的时间还要少。
  • danluu.com/input-lag:我想知道我使用的现代电脑是否真的比我用过的旧设备延迟更高,以及我的这种感觉是否可信。
  • danluu.com/keyboard-latency:我想知道键盘带来的延迟有多少(显示延迟已经由 https://blurbusters.com 进行了充分测试)。
  • danluu.com/bad-decisions:我看到理性社区中有人为糟糕的棒球教练决策辩护,称这些决策无关紧要,因为每年最多只会让你输掉四场比赛。我想知道糟糕的教练决策到底有多大影响。
  • danluu.com/android-updates:我很好奇,由于大多数安卓手机无法更新,市面上有多少不安全的安卓设备。
  • danluu.com/filesystem-errors:我很好奇,相比 2005 年一篇论文中发现的那些数据损坏错误,文件系统在这方面有了多大改进。
  • danluu.com/term-latency:我觉得终端的基准测试都在测试一些与用户体验基本无关的东西(吞吐量),我想知道如果有人测试一些可能更重要的指标,结果会是什么样;同时,我也想知道我觉得 iTerm2 很慢的感觉是真实的还是我的想象。
  • danluu.com/keyboard-v-mouse:关于键盘与鼠标生产力的最常被引用的资料明显是虚假的,而且表述时还带着极高的自信;我想看看非虚假的测试是否会得出相同或不同的结果。
  • danluu.com/web-bloat:我进行了一次横跨美国的公路旅行,期间网络基本无法使用,我想量化一下在没有非常快的网络时,网络有多难用。
  • danluu.com/bimodal-compensation:我很好奇,我们是否正在看到编程领域的中层职位出现空心化,就像法律行业那样。
  • danluu.com/yegge-predictions:我的印象是 Steve Yegge 对科技未来的预测异常准确,我想验证一下我的印象是否正确。
  • danluu.com/postmortem-lessons:我想看看关于事后分析原因的数据,以便了解我能否改变自己的工作方式,变得更有效率。
  • danluu.com/boring-languages:我很好奇,我使用的软件中有多少是用无聊、古老的语言编写的。
  • danluu.com/blog-ads:我很好奇,如果我想通过博客变现,能赚多少钱。
  • danluu.com/everything-is-broken:我想验证一下,我遇到那么多 bug 的印象是否正确。很多人告诉我,人们经常遇到软件 bug 的想法是由选择性记忆造成的错觉,我想知道对我来说是否如此。
  • danluu.com/integer-overflow:我曾与一位语言设计师讨论,他坚信整数溢出检查的成本太高,理由明显站不住脚(因为如果基准测试全是整数运算,成本确实高)。我想看看我快速心算出的开销估计是否在正确的数量级上。
  • danluu.com/octopress-speedup:在听了 Dan Espeset 的演讲后,我想知道是否可以对当时使用的 Octopress 网站进行一些简单的优化。
  • danluu.com/broken-builds:我与某人进行了一系列讨论,他声称自己的项目构建可用性非常高,尽管它经常出问题;我想知道与其他类似项目相比,他的说法是否正确。
  • danluu.com/empirical-pl:我想知道,那些声称有确凿经验证据证明“花哨”类型系统优越性的人,其说法背后有哪些研究支持。
  • danluu.com/2choices-eviction:我很好奇,如果将“两个随机选择”应用于缓存驱逐,会发生什么。
  • danluu.com/gender-gap:我想验证一篇文章中的说法,该文章声称科技行业薪资不存在性别差距。
  • danluu.com/3c-conflict:我想创建一个简单的例子,说明对齐对内存延迟的影响。

顺便一提,整理这份清单让我意识到,我脑海中关于自己何时开始认真审视数据的叙事可能并不准确。我曾以为这是当前工作带来的转变,但显然并非如此——因为在我从事当前工作之前,就有相当一部分帖子是关于分析数据和/或测量事物的(我甚至没有列出那些仅阅读论文并查看其数据的驱动型帖子)。看到上述清单后,我意识到自己不仅早在获得这份工作之前就做过类似项目,甚至早在开设这个博客之前就已开始。

附录:为何某些评测不可信

有一件事既提升又削弱了优质测量的价值:大多数已发表的测量结果质量并不高。这虽然增加了理解并执行优质测量的个人价值,却削弱了对他人的影响力——因为人们通常不理解测量无效的原因,也缺乏判断哪些测量值得信赖的有效方法。

已发表的测量/评测常存在多种问题。评测的主要问题在于,某些行业中,评测者高度依赖制造商提供样品。

汽车评测是最极端的例子之一。《消费者报告》是唯一独立采购测试车辆的主流评测机构,这常导致其与其他评测者意见相左——因为他们会购买多数消费者选择的配置等级,而这往往与制造商提供给评测者的配置大相径庭;同时《消费者报告》通常避免评测经过特殊挑选或调校的车辆。曾有几次,《消费者报告》的评测者(同样自行购车)表示,他们怀疑销售人员认出其身份后,以“需要留车过夜”为由推迟交付已购车辆——遇到这种情况时,评测者会直接放弃交易。

汽车存在显著的个体差异,而评测者收到的车辆往往经过筛选:不仅避免外观瑕疵(漆面问题、接缝不均等),还会检查更严重的故障。此外,车辆可能经过软件和固件调校(例如,宝马的评测车搭载了“特调”发动机程序——若车主私自进行类似改装,将导致保修失效)。

此外,由于《消费者报告》并非从制造商处获取评测样机,他们无需有所保留,可以撰写高度负面的评价——这在汽车杂志中极为罕见,在汽车视频博主中也并不常见。通常你需要从字里行间解读出真实评价,因为明确提及车辆缺点的评测可能意味着失去合作机会(例如博主“savagegeese”就曾提到,在给出诚实评价后,难以从某些公司获得测试车辆)。

相机镜头领域同样有记录显示,评测者会收到异常优质的样机。不同镜头个体之间存在巨大差异,因此厂商会挑选优质产品供评测者借用。在许多案例中(例如任何FE卡口的ZA蔡司镜头或RX-1上的蔡司镜头),根据人们需要尝试并退回多少支镜头才能获得合格品来看,似乎半数以上的镜头存在明显制造缺陷,预期中可能每十支镜头里仅有一支无明显瑕疵(这也可能是少数劣质品被反复退货所致,但极少有摄影师会真正检查自己的镜头是否存在制造公差问题)。由于获取大量镜头的成本过高,个体差异程度一直未被量化,直到lensrentals开始测量——他们发现不同制造商的个体差异水平可能天差地别,这有望给那些一边大量销售劣质镜头、一边为评测者挑选优质样机的厂商施加压力。

硬盘领域同样有记录显示,评测者收到的样机并不具代表性。Extreme Tech多次报道,Adata、Crucial和西部数据提供的固态硬盘评测样机与消费者实际购买的产品不符。这个案例中令我感兴趣的一点是,Extreme Tech指出:

同意评测制造商产品是多方信任的延伸。提供样机的制造商相信评测会优质、全面且客观;评测者相信制造商提供的样机能准确反映最终产品的性能、功耗及整体设计;而读者阅读评测时,则相信评测者确实测试了硬件,且所有公布的基准测试均公正执行。

这听起来像是把评测者的工作描述成:只需接过厂商递来的“信任”,然后跑跑像样的基准测试,从而免去评测者获取代表性设备并确保其具有代表性的责任。这让我想起SRE(网站可靠性工程)的座右铭:“希望不是策略”。信任厂商也不是策略。我们知道厂商会为了在基准测试中表现更好而撒谎和作弊。把责任推给厂商撒谎或作弊或许能转移指责,但这并不能让评测对消费者更准确或更有用。

虽然我们只讨论了少数几个有公开证据表明评测因企业操纵而不可信的特定领域,但这并非这些行业独有的问题。作为消费者,我们应该预期:任何不是由可信的独立机构执行、且未自行购买评测样品的评测,都已被操纵,不能代表普通消费者的体验。

评测的另一个问题是,大多数在搜索中排名靠前的在线评测实际上只是SEO(搜索引擎优化)联盟农场。

一个更普遍的问题是,评测也受到与未评测商品完全相同的问题影响:人们通常无法分辨哪些评测真正优秀,哪些不是,因此评测网站的选择依据并非评测质量。一个典型例子是Wirecutter,它在科技圈如此受欢迎,以至于“旧金山那么多科技公寓里都有完全相同的Wirecutter推荐商品”已经成了一个老掉牙的笑话。对于没在旧金山生活过的人,可以通过阅读这篇关于“不可能”不买Wirecutter任何推荐商品的帖子的评论来一窥这种心态。评论里满是向发帖者保证的人,他们声称鉴于发帖者时间价值很高,不这么做是不负责任的。

我觉得有趣的是,如果你认真对待基准测试(在任何领域),只需阅读普通Wirecutter评测的方法论,甚至不用实际试用被评测的商品,就能看出方法论很糟糕,他们通常会选择平庸甚至有时是同类最差的商品。深入探讨这一点值得单独写一篇文章,但我在这里举一个评测不佳的例子:在https://benkuhn.net/vc中,Ben Kuhn研究了如何打造良好的视频通话体验,包括尝试各种麦克风和网络摄像头。自然,Ben试了Wirecutter推荐的麦克风和网络摄像头。网络摄像头表现相当差,不比2014年旧款iMac或2020年Macbook的摄像头好(而且在我看来,实际上差得多;后面会详述)。而麦克风大致相当于他笔记本电脑内置麦克风的水平。

我对Wirecutter推荐的网络摄像头有大量经验,因为很多人都在用,而它以一种独特的方式糟糕得令人震惊。Ben指出,如果你看静态图像,在他所处的室内环境下白平衡表现极差;如果你和其他用过这款摄像头的人交流,会发现这是个普遍问题。但我认为更糟糕的是,如果你观察视频,在许多条件下(考虑到我经常看到这种情况,我认为是大多数情况下),这款网络摄像头会频繁重新对焦,导致整个画面不断从失焦到重新对焦(另一个问题是它经常对焦到错误的对象上,但这不太常见,而且并非所有和我聊过使用Wirecutter推荐摄像头的人都遇到过)。实际上,我昨天刚和一位朋友通话,他用的设备和我平时见到的不同——是那款平庸但尚可接受的MacBook内置摄像头。他的视频每隔10到30秒就会反复失焦再对焦,于是我问他是否在用Wirecutter推荐的摄像头,他当然在用,因为科技圈里还有谁会买一款有同样问题的其他摄像头呢?

这种评测质量在Wirecutter的测评中相当典型,而他们似乎是科技圈里最受尊重、使用最广泛的评测网站。

附录:资本主义

我上高中时,有一群准边缘青年,他们会读《钟形曲线》之类的书,并向任何愿意听的人争论书中的观点。

他们最喜欢的话题之一是:自由市场会自然促使生产优质产品的公司崛起,而生产劣质产品的公司则会消失,最终导致产品普遍安全、物有所值等等。我至今仍常见到科技从业者宣扬这种观点,包括那些用Wirecutter推荐物品填满自己公寓的人。我发现这种讽刺的对比很有意思:一边有人主张市场会让产品普遍变好,一边他们自己却在购买价格虚高的垃圾。公平地说,这不全是价格虚高的垃圾。有些是价格虚高的平庸货,有些确实不错;只是和你随便在亚马逊上不看第三方评测乱买的东西相比,并没有太大区别。

关于相关讨论,请参阅这篇关于人们一边歧视一边声称市场会消除歧视的文章

附录:测量(或缺乏测量)影响的其他例子

  • 电子稳定控制系统
  • 工作中一些无聊的事:一年前,我写了这篇 两篇关于工作中可观测性基础设施的文章。当时,这项工作已经带来了八位数的成本节省,而现在这个数字已进入九位数范围。这或许值得以后单独写一篇文章,但大部分工作其实很简单——只要有人能真正观察到发生了什么。
    • 相关:在目睹了几个问题影响生产服务后,我写了一个小解析器(5000行代码),用于解析主机级日志中每一行内容,检查我们指标中未捕捉到的问题。这发现了未使用自动化方案捕捉和修复主机级问题的集群中的重大问题;在某些集群中,超过90%的主机正在主动损坏数据或存在严重的性能问题。这促使成立了一个新团队来处理此类问题。
  • 轮胎
    • 除米其林外,几乎所有制造商生产的轮胎在磨损后,湿地、雪地和冰面性能都会严重下降。
      • 杰森·芬斯克表示,其中一个技术原因是(还有其他原因):刀槽花纹通常不会切割到全深度,因为这样做会显著增加制造成本——切割刀槽的设备需要更强固,且磨损更快。
      • 一个非技术原因是:许多公开的轮胎测试都是在全新轮胎上进行的,因此轮胎制造商只需制造部分深度的刀槽花纹,就能获得几乎相同的营销基准值。
    • 随着Tire Rack的影响力提升,一些轮胎制造商将刀槽花纹设计得更多方向性,以改善转弯时的操控性,而不是让刀槽花纹主要或完全垂直于行驶方向(后者主要只对加速和制动有帮助)。《消费者报告》的雪地和冰面评分分别基于雪地直线加速和冰面直线制动,而Tire Rack的冬季测试评分则更强调全面的雪地操控性。
    • 测量影响有限的一个例子:米其林冬季轮胎项目类别经理法雷尔·斯科特表示,在设计米其林X-ICE Xi3的继任产品时,主要设计标准之一是改变轮胎的外观,因为米其林发现,尽管X-ICE Xi3与普利司通Blizzak WS80并列为最佳全能冬季轮胎(某些方面略优,某些方面略逊),潜在客户却常常选择其他轮胎,因为它们看起来更符合大众对冬季轮胎的认知,具有“激进”的胎面花纹块(这是著名的诺基亚Hakkapeliitta轮胎系列做得更好的地方)。他们还更改了名称,新轮胎不再使用数字递增,而是命名为米其林X-ICE SNOW,以强调该轮胎既适合雪地也适合冰面。
    • 虽然有些消费者会阅读评测,但很多人(可能大多数)并不会!
  • 用于直播视频的HDMI转USB转换器
    • 如果你阅读Camlink 4k的文档,会发现该设备在Windows上应使用批量传输,在Mac上使用等时传输(如果使用他们的软件,会自动进行此调整)。
      • 法比安·吉森告诉我,这可能出于同样的原因:当他的一些同事在Windows上测试某款USB3设备时,5个测试芯片组中只有1个正确支持等时传输(其余会出现蓝屏或死机等问题)。
    • 我尝试过各种廉价HDMI转USB转换器作为Camlink 4k的替代品,但尚未找到一款能在各种计算机上普遍正常工作的廉价产品。它们通常至少能在我手头的一台计算机上配合至少一个我想用的软件工作,但在某些情况下根本无法工作或提供严重失真的视频。或许有人应该发布HDMI转USB转换器质量的基准测试!
  • HDMI转VGA转换器
    • 许多这类转换器会变得非常热,然后在15分钟到2小时内过热停止工作。有些甚至摸起来都不热。祝你好运,能分辨出哪些能用!
  • 水过滤
    • Brita声称其“长效”滤芯可去除铅。然而,两位亚马逊评论者表示,他们测量了受污染水在过滤前后的铅含量,发现铅水平并未降低。
    • 过去,“长效”滤芯的过滤速度非常慢,这是购买用户常见的抱怨。现在,一些(或许全部)“长效”滤芯过滤水速度快得多,但过滤效果达不到Brita声称的水平。
  • 体育裁判
    • 棒球裁判以判罚失误率高而闻名,而我们拥有几十年来几乎完美判罚的技术,但许多人认为,让人类做出错误判罚是“比赛的一部分”,如果判罚由计算机介入,比赛就不那么真实了。
    • 一些体育项目已部分屈服于压力,尽可能做出正确裁决,例如在橄榄球中,NFL教练从1999年开始被允许每场比赛基于视频录像挑战两次判罚(2004年起,如果前两次挑战成功,可挑战三次),这借鉴了小众联盟USFL于1985年创建的系统。
  • 储物容器
    • Rubbermaid储物容器(Rougneck和Toughneck系列)曾以其质量和耐用性闻名。当然,短期内削减材料用量和容器强度更有利可图,因此另一家公司收购了该品牌并继续使用,生产出外观相似的容器,却以堆叠时容易变形而闻名——而这正是可嵌套/可堆叠容器的全部意义所在。我还没见过有人认真测试储物容器承受负载的能力,所以一般来说,你无法预知这种情况是否会发生在你身上。
  • 扬声器减振解决方案

感谢Fabian Giesen、Ben Kuhn、Yuri Vishnevsky、@chordowl、Seth Newman、Justin Blank、Per Vognsen、John Hergenroeder、Pam Wolf、Ivan Echevarria和Jamie Brandon的评论、修正与讨论。