卡帕西中文站 / 文章导读 / 复现 LeCun 1989

复现 LeCun 1989:33 年,配方没变,变的是规模

原文发表:2022-03 · 导读更新:2026-08
这是导读,不是翻译。目标是让你 5 分钟拿到文章的思想地图;值得的话,带着地图去读 英文原文 →

一句话

卡帕西把 LeCun 等人 1989 年那篇里程碑论文——最早用反向传播训练卷积网络识别手写数字——在 PyTorch 里逐行复现了一遍,得出一个既谦卑又震撼的结论:33 年来深度学习的配方几乎原封未动,数据集、网络、损失函数、梯度下降,全都认得出来;真正天翻地覆的,是数据和算力的规模。

文章讲了什么

1989 年的原始配置小得可爱:7291 张 16×16 的手写数字图,四层网络约 9760 个参数,在 SUN 工作站上训练了三天,测试错误率 5.00%(错 102 张)。卡帕西先做忠实复现,然后玩了一个「时间旅行」思想实验:假如带着 2022 年的知识穿越回 1989,不许加数据、不许增加推理延迟,能把结果改善多少?他逐项换上现代技术——MSE 回归换成交叉熵分类、SGD 换成 AdamW、加一像素随机平移的数据增强、加 dropout、tanh 换 ReLU——错误率降到 1.59%,错误减少约 60%。另一条线是纯粹加数据:把训练集扩到 5 万张,错误率降到 2.74%;两者叠加做到 1.25%。

算力这条线更夸张:当年三天的训练,在 M1 MacBook Air 上 90 秒跑完,约 3000 倍加速,认真优化还能再快百倍。于是结论清晰起来:算法改进带来的收益是「60% 量级」,而数据与算力的规模化带来的是「百万倍量级」。他随即把望远镜掉转向前:

"In 2055… a 10,000,000X-sized neural net megabrain" ——Andrej Karpathy,2022 · 原文 →

2055 年的人回看 2022 年的 GPT,大概就像我们看 1989 年的 LeNet:完全认得出来,只是小得可怜——数据和参数都要再差上七个数量级;而且到那时,为具体任务从头训练网络这件事本身可能已经消失,人们只需要对一个巨脑「好好说话」。

写作背景

写作时间是 2022 年 3 月,GPT-4 尚未发布,但 Scaling Law 已成为圈内共识。卡帕西选择用考古而不是预言来讨论规模问题:与其争论「大模型还能大多久」,不如实证地量一量过去 33 年里各因素的贡献比例。这也是他一贯的方法论——《神经网络训练配方》讲怎么训练,这篇则用一个 1989 年的老网络当实验台,把「配方稳定、规模主导」这件事做成了可复跑的代码(开源在 GitHub)。

十年后再看

2026 年回看,这篇文章的推演几乎全部兑现,而且比他写时更快:任务专属的小模型训练确实急剧退场,绝大多数应用变成了对基础模型的提示与微调——「对巨脑好好说话」已经不是 2055 年的科幻,而是 2023 年之后的日常,正如他后来说的 English is the hottest new programming language(解读)。文中「配方不变」的判断也依然成立:Transformer 换掉了卷积的位置,但数据集、损失、梯度下降的骨架从 1989 到今天一脉相承。这篇与 MicroGPT 是绝配——一篇证明配方在时间上不变,一篇证明配方在规模上可以缩到 200 行。

对你意味着什么

  1. 建立「规模直觉」的最佳读物:算法迭代给你的是百分之几十,数据和算力给你的是数量级。做技术选型时,先问规模,再抠技巧。
  2. 适合动手复跑:整个实验一台笔记本就能跑完,是练习「读论文—复现—消融」完整流程的绝佳小项目,比跑别人的大模型脚本长本事得多。
  3. 独立开发者的启示:既然从头训练在退场,你的杠杆在于用好基础模型、把数据和评测做扎实——这正是文中趋势推演的直接推论。

延伸阅读