一张奥巴马的照片,量出 AI 与理解之间的距离
一句话
一张搞笑照片:奥巴马趁人不备,把脚偷偷踩在别人正在用的体重秤上。你看一眼就笑了——而卡帕西用整篇文章拆解这「一眼」背后藏着多少智能,然后宣判:以 2012 年的技术,计算机视觉距离这种理解真的、真的还很远。这是他博客里情绪最重、也最常被回访的一篇。
文章讲了什么
文章主体是一份「看懂这张照片需要什么」的清单,每一条在当时都是无解题:认出场景是走廊、认出三面镜子里是同一场景的不同视角;奥巴马的脸只占极少像素,你靠西装和上下文认出他;体重秤只是几撮白色像素,你靠人的站姿「脑补」出它的存在;然后是物理——秤测的是压力,多一只脚读数会虚高;最难的是他人心智:秤上的人不知道身后发生了什么,他即将困惑;周围的人能看到全局所以觉得好笑;而这一切之所以好笑,还叠加了「总统居然干这种事」的身份反差。你在几百毫秒内完成了全部推理,毫不费力。
由此他给出论断:像素只是冰山一角,理解一个场景需要调用海量的世界知识——物理、功能、社会、心理。而当时的研究还在单标签分类(ImageNet)和画框(Pascal VOC)这类碎片任务上打转,他不留情面地写道:
"the state of CV and AI is pathetic when we consider the task ahead" ——Andrej Karpathy,2012 · 原文 →
他不相信「多加数据、微调算法」能跨过这道沟,猜测可能需要具身交互和多年尺度的连贯经验,结尾半开玩笑说:要么就干脆去做个手机社交 App 创业算了。
写作背景
写于 2012 年 10 月,一个精确到令人起鸡皮疙瘩的时间点:两个月后 AlexNet 发布,深度学习革命开闸。也就是说,这篇「我们还很远」写在黎明前最黑的时刻。它同时是他 2011 年手工分类 CIFAR-10 的思想升级:前一篇量「识别有多难」,这一篇论证「识别远不等于理解」。文中对基准测试碎片化的批评,也预示了他后来对评测方法论的长期关注。
十年后再看
这是检验 AI 进展最好的试纸之一——因为他 2012 年白纸黑字列了一份「不可能清单」。今天把这张照片喂给前沿多模态模型,清单上的大部分项目已经能答上来:认出奥巴马、解释秤的物理、说清为什么好笑,包括他人心智那部分。更讽刺的是实现路径:恰恰是他当年不看好的「更多数据 + 规模」冲过来的,具身交互并没有成为前提。但先别急着宣布通关——模型的理解是否鲁棒仍然存疑,换一张没在网上传烂的新照片、追问几层反事实,锯齿状就露出来了;他 2025 年谈 Animals vs Ghosts 时对「靠模仿数据长出的理解」的保留态度,可视作这篇文章的当代续篇。「真正的理解需要什么」这个问题,只是换了主语,仍未关闭。
对你意味着什么
- 给自己留一份「不可能清单」:学他把「AI 做不到 X」写成具体可检验的条目,几年后逐条回访。这是校准自己技术判断力的最好练习。
- 做多模态应用的人:这篇是现成的测试灵感库——镜面反射、被遮挡物体的脑补、多人视角的心智推理,至今仍是 VLM 评测的高价值难例方向。
- 方向判断的教训:连最敏锐的人也会在黎明前夜看空,且低估「规模」这条笨路径。对今天各种「LLM 永远做不到 X」的断言,持同样的保留。
延伸阅读
- 英文原文
- 导读:《手工分类 CIFAR-10》 —— 前一年的实证前传
- 导读:《与卷积网络同台竞技》 —— 两年后深度学习兑现的部分
- 导读:《动物与幽灵》 —— 「理解从哪来」的 2025 年续问