2014 年的一次访谈:ConvNetJS 与深度学习的黎明
这是导读,不是翻译。博客原文只是一则链接公告,正文是他接受 Data Science Weekly 的访谈;值得的话,带着地图去读 英文原文 →
一句话
2014 年春,博士生卡帕西接受 Data Science Weekly 访谈,聊了三件事:他怎么走进机器学习、为什么在浏览器里写出 ConvNetJS、以及深度学习当时的真实边界在哪。今天读,它是一份罕见的「起飞前时刻」快照——AlexNet 之后、AlphaGo 之前,一个年轻研究者对领域的判断几乎条条应验。
文章讲了什么
- 成长路径:在斯洛伐克长大,15 岁移居多伦多,本科读计算机加物理,一度迷恋量子计算又嫌它太抽象。转折发生在图书馆的一次顿悟:一个人穷尽一生也学不完所有知识——但可以造一个能学习的 AI,这是「终极的元问题」。此后经 UBC 的物理仿真动画硕士,进入斯坦福读视觉方向博士。他的第一个数据集是 2007 年前后用受限玻尔兹曼机跑 MNIST,当时还觉得那是个「可爱但无用」的玩具。
- ConvNetJS 的由来:他观察到很多人想玩深度学习,却被安装、编译、可视化的门槛挡在门外,于是在圣诞假期、多伦多一家 Tim Hortons 咖啡店里,把卷积神经网络的训练完整搬进了浏览器——Chrome V8 的性能之好让他自己都意外。目标只有一个:让模型「可接近、透明、随手可玩」。
- 对领域的判断:神经网络当时真正可靠的能力是「大数据 + 全监督」;关键的经验发现是非凸优化在实践中根本没那么可怕。未解的问题他点了三个——无监督学习、超越「猜了再试」的原则性优化、以及结构化预测/强化学习/循环架构。他总结自己的研究口味是一句话:
"I like my data large, my algorithms simple and my labels weak." ——Andrej Karpathy,2014 · 原文 →
- 预测:机器学习将无处不在;数据能力从超能力变成必备技能;浏览器里的 ML 会流行,几年内会出现一个被广泛使用的 JavaScript 机器学习库。
写作背景
2014 年 4 月,深度学习刚在 ImageNet 上证明自己两年,社区还很小,「data science」才是当时的热词。访谈里他反复强调的降低门槛、动手重造轮子(「重新发明轮子时学得最多」),后来成为他整个教学生涯的主线。
十年后再看
预测部分几乎全中:TensorFlow.js 兑现了「JS 机器学习库」的预言,浏览器里如今连 LLM 都能跑;「数据能力人人必备」早已成为现实。他点名的三个未解问题也各有归宿——无监督学习以「预测下一个词」的形式大获全胜,强化学习与循环/序列架构合流成了今天的 LLM 与 RLHF。而那句研究口味宣言,放在预训练时代读简直像预告片:数据够大、算法够简单(Transformer + 下一词预测)、标签够弱(自监督)。ConvNetJS 的精神续作则是他后来的 nanochat 和 Zero to Hero 课程——工具在换,「把门槛打下来」这件事他做了十几年。
对你意味着什么
- 入行 AI 的学习者:他的路径提示比结论更值钱——从「造一个玩具让自己看见」开始,而不是从啃论文开始。今天的等价物就是跟着 Zero to Hero 从零手写一个 GPT。
- 判断趋势的人:注意他预测的方法:不押具体产品,押「门槛下降的方向」。凡是把强大工具塞进人人已有的平台(当年是浏览器,今天是对话框)的路线,历史上很少输。
- 做开源的开发者:ConvNetJS 是「假期小项目改变职业轨迹」的样板——它带来的访谈、声誉和人脉,远超一个玩具库的表面价值。
延伸阅读
- 英文原文(含访谈链接) · ConvNetJS
- 导读:《用 t-SNE 看推特名人》 —— 「浏览器跑 ML」信念的另一次落地
- 导读:《博士生存指南》 —— 两年后他对研究生涯的系统总结
- 解读:如何成为专家 —— 「重造轮子」学习观的十年后版本