卡帕西中文站 / 文章导读 / 与卷积网络同台竞技

与卷积网络同台竞技:那个著名的 5.1%,是他一张张标出来的

原文发表:2014-09 · 导读更新:2026-08
这是导读,不是翻译。目标是让你 5 分钟拿到文章的思想地图;值得的话,带着地图去读 英文原文 →

一句话

2014 年 GoogLeNet 在 ImageNet 上做到 6.7% 的错误率,所有人都在问:这算超过人类了吗?可是没人知道人类的错误率是多少。于是卡帕西亲自下场:自建标注界面,花一周高强度标了 1500 张测试图,量出人类错误率约 5.1%——这个此后十年被无数论文和新闻引用的「人类基准」,出处就是这篇博客。

文章讲了什么

实验设计很实诚:网页界面一边显示待标图片,一边列出全部 1000 个类别、每类 13 张示例图,按层级排好;他先用 500 张验证图「训练」自己,再正式标 1500 张测试图,平均每张约一分钟——简单的几秒搞定,碰上细分犬种能磨几分钟。结果:人类 5.1% 对 GoogLeNet 6.8%(p 值 0.022),人类险胜。

全文最有价值的是双方错误的解剖对比。机器独有的弱点:小而细的物体(占其错误 21%,人类为 0)、滤镜造成的色彩失真(13% 对 1%)、绘画雕塑等抽象表现形式、极端特写和依赖读字的图。人类独有的弱点:细粒度识别——区分上百种狗、鸟、猴占人类错误的 37%(机器只有 7%),另有 24% 是压根不知道有那个类别。双方共同的坑是一图多物和 0.3% 的标注错误。他由此提炼出一个被广泛引用的洞见:

"Human accuracy is not a point. It lives on a tradeoff curve." ——Andrej Karpathy,2014 · 原文 →

人类准确率不是一个点,而是一条随投入变化的曲线——一个随手标注的人和一个苦练一周的人,是两条完全不同的基线。他还自嘲:这次实验最大的个人收获,是变得特别会认狗。

写作背景

这是他 2011 年 手工分类 CIFAR-10 的续集:三年前是「量一量这个数据集对人有多难」,这次是深度学习爆发后,同一个问题变成了「机器到底追到哪了」。当时他在斯坦福读博并深度参与 ILSVRC 评测工作,这种「别人引用数字、他去生产数字」的较真,让这篇博客成了实证精神的经典示范。第二年(2015),ResNet 等模型的错误率降到 5.1% 以下,「机器在 ImageNet 上超过人类」的新闻标题,用的正是他这个数字。

十年后再看

文中预言「人类很快只能靠大量专业投入才能勉强胜过模型」在图像分类上一年内就应验了,如今在写作、编程、数学等一个个领域重演——每次「AI 超越人类」的讨论,都还在重复他当年的提醒:先问清楚,你说的「人类水平」是曲线上哪个点?错误解剖那一节同样长寿:机器与人类的错误分布完全不同这一发现,正是今天锯齿状智能的第一次系统测量——所谓「超人类」的模型,输给人类的方式往往匪夷所思。评测方法论上它也是先驱:今天 LLM 评测里的人类基线、错误分类分析,做法几乎就是这篇的放大版。

对你意味着什么

  1. 做模型评测的人:照抄他的流程——自己先当一遍标注员,再给错误分门别类。不亲手过数据,你对「x% 准确率」的理解只是个数字。
  2. 读 AI 新闻的人:见到「超越人类」四个字,先问基线是谁、投入多少。这篇文章就是最好的疫苗。
  3. 做产品的人:机器和人的错误分布互补(机器怕小物体和抽象画,人怕细粒度类别),这正是「人机协作分工」的设计依据——让各自守住对方的盲区。

延伸阅读