卡帕西中文站 / 文章导读 / 特征学习历险记

特征学习历险记:一段研究死胡同的诚实记录

原文发表:2014-07 · 导读更新:2026-08
这是导读,不是翻译。目标是让你 5 分钟拿到文章的思想地图;值得的话,带着地图去读 英文原文 →

一句话

博士前三年,卡帕西押注的方向是无监督特征学习——让算法不靠标签、从海量图像视频里自己学出好的表征。这篇文章是他对这三年的复盘:试了什么、为什么全都不顺、以及 AlexNet 的横空出世如何把整个赌注作废。研究者写成功回顾常见,把死胡同一条条摊开来写的,罕见。

文章讲了什么

文章按时间线走过他的每一站:2011 年夏天在 Google Research 实习(早期 Google Brain),随后在斯坦福先后跟 Andrew Ng 做图像特征、跟 Vladlen Koltun 做 3D 图形、与李飞飞做视觉研究,2013 年夏天重回 Google。一路上试过的方向包括视频的时空特征、基于 k-means 与相似性不变量的无监督图像学习、点云与 Kinect 数据的 3D 场景理解——几乎全部碰壁:

写作背景

2014 年年中,深度学习的监督范式已经全面开花,无监督学习从「圣杯」跌成了「情怀」。刚刚熬过方向转换的卡帕西选择把弯路写下来,这种坦率在学术圈是稀缺品——论文只发表赢的那一小部分,输掉的三年通常无人提起。两年后他把这些教训升华成了《博士生存指南》;读那篇像读兵法,读这篇像读战地日记。

十年后再看

最大的反转在于:无监督学习最终赢了,只是换了个名字和赛场。「预测下一个词」本质上正是无监督(自监督)学习,LLM 的整个预训练范式实现了他当年追而不得的梦想——差别在于数据换成了文本,规模大了几个数量级,并且他反思中的几个要素(数据的顺序结构、随后叠加的 RLHF 反馈)恰好都补上了。他 2015 年的《RNN 的不合理有效性》正是从这片废墟走向那个未来的第一步。而他对具身、交互式学习的执念也没有消失——多年后的「动物 vs 幽灵」之辩,几乎就是本文最后一节的续写。研究方向会输,但好的问题意识不会。

对你意味着什么

  1. 研究生与准备做研究的人:这是稀有的「失败样本」——看清一个聪明、勤奋、资源充足的人如何在错误的前提上认真耕耘三年。选题时值得自问:我的方向是否依赖某个尚未验证的哲学假设?
  2. 转型期的从业者:注意他止损的方式——不是否定问题,而是换掉手段(无监督换监督),成果立刻出现。方向调整不等于推倒重来。
  3. 所有人:把自己的死胡同写下来公开,是他后来影响力的重要来源之一。你的失败复盘对别人可能比你的成功清单更值钱。

延伸阅读