卡帕西中文站 / 文章导读 / 手工分类 CIFAR-10

手工分类 CIFAR-10:把自己当成基线模型

原文发表:2011-04 · 导读更新:2026-08
这是导读,不是翻译。目标是让你 5 分钟拿到文章的思想地图;值得的话,带着地图去读 英文原文 →

一句话

深度学习尚未登场的 2011 年,还是学生的卡帕西写了个 MATLAB 小界面,按 0–9 的键亲手给 400 张 32×32 的 CIFAR-10 小图分类,量出人类准确率约 94%——而当年最强的算法(k-means 加 SVM 那一套)只有 80%。这是他博客里最早的文章之一,也是他「自己当一次基线」这个标志性习惯的起点。

文章讲了什么

方法土得掉渣,问题却问得很正:大家都在刷 CIFAR-10 的分数,但这个数据集本身对「人」有多难?没人量过,那就自己量。除了 94% 这个数字,文章的价值在几条第一手观察:其一,类内差异大得惊人——同是「狗」,姿态、大小、品种千差万别,32×32 的分辨率还抹掉了大量细节;其二,他内省了自己的识别过程,发现有两条完全不同的通路:有时凭高信息量的独特部件(比如猫耳朵)一眼认出,有时图上根本看不清物体,全靠背景和整体氛围「猜」出来——语境本身就是特征;其三,他判断训练集的多样性不足以支撑很好的泛化,并坦率承认看不懂当时最强算法为什么能做到 80%(随机聚类基线都有 70%)。

文末他给出预测:这个数据集上算法的现实天花板大概在 80–90%。这个预测后来被证明是错的——深度学习登场后一路冲过 95%,超过了他量出的人类水平。有趣的是,连错误本身都有史料价值:2011 年最敏锐的从业者,也没能预见两年后的范式革命。

写作背景

2011 年的计算机视觉还是特征工程的天下:SIFT、HOG、词袋模型,AlexNet 要到 2012 年底才横空出世。当时的模型好坏全靠排行榜数字说话,很少有人追问数字的「参照系」。一个研究生用最笨的办法给出参照系,这种不优雅但诚实的实证做派,日后成了卡帕西的招牌——从这篇到 2014 年在 ImageNet 上单挑 GoogLeNet,再到后来《神经网络训练配方》里「先跟数据融为一体」的第一条军规,一脉相承。

十年后再看

这篇小文章的两个副产品都比正文长寿。第一是方法:「先量人类基线,再谈算法高低」如今是评测学的标配,LLM 时代的 MMLU、HumanEval 等基准都要报人类分数,而这个习惯在社区里的早期示范就包括这篇。第二是那两条识别通路的内省——「部件识别」与「语境猜测」,后来分别对应了视觉模型的判别特征学习与场景上下文建模,也预告了他 2012 年对「识别之外还需要理解」的著名追问。至于 CIFAR-10 本身,早已从竞技场退役成教学玩具——今天你在笔记本上几分钟就能训出远超 94% 的模型,正好可以顺手体验一次「亲手打败 2011 年的人类」。

对你意味着什么

  1. 做任何 AI 项目前,先自己当一遍模型:拿 50 条数据亲手标一标、答一答。你会立刻知道任务的真实难度、标注的歧义在哪、多少分算「好」——这半小时的投入回报率极高。
  2. 对预测保持谦卑:连卡帕西都把天花板估错了。技术曲线拐点前夜的「不可能」,参考价值有限——评估 LLM 能力边界时同样适用。
  3. 入门者的低垂果实:CIFAR-10 依旧是最好的练手数据集之一,先手工分几百张建立直觉,再训模型对比,是理解「模型学到了什么」的捷径。

延伸阅读