CS25 客座讲座:Transformer 从何而来,为何通吃
这是观看指南,不是字幕或搬运。视频请在原频道观看:YouTube 直达 →
一句话
2023 年初,卡帕西回到斯坦福,在专讲 Transformer 的研讨课 CS25 上做开篇客座讲座:注意力机制从哪来、Transformer 为什么能吃掉整个 AI、以及怎样把它理解成「图上的消息传递」。这是他讲 Transformer 最系统的一次,也是斯坦福当年最受欢迎的公开课视频之一。
谈了什么
- 架构简史:从各领域各用各的网络(视觉用 CNN、语言用 RNN),到 2017 年后一切收敛于 Transformer——他亲历了这场大一统。
- 注意力的来龙去脉:注意力并非始于《Attention Is All You Need》,而是源于 2014 年 Bahdanau 等人的机器翻译工作;他还在课上展示了自己与 Bahdanau 的邮件往来,讲了「attention」这个名字差点不存在的轶事。
- 把注意力看成消息传递:每个 token 是图上的节点,发出 query、key、value 相互「通信」——这个视角把公式变成了直觉,是全片最值得反复看的一段。
- Transformer 为什么赢:表达力强(能编码各种计算)、可优化(梯度友好、残差连接)、并行高效(榨干 GPU)——三个性质同时满足,才成就了「通用可微分计算机」。
- nanoGPT 走读:用他自己的极简实现把上述抽象落到几百行代码,与 Zero to Hero 课程一脉相承。
背景
录制于 2023 年 1 月,正是 ChatGPT 引爆世界、而多数人还说不清它引擎为何物的时刻。CS25 是斯坦福专门研究 Transformer 的研讨课,请他讲开篇导论等于让「布道者本人」定调。讲座内容与他 2022 年 10 月那条著名的「三性质」推文一脉相承——推文是结论,这一小时是完整论证。视频当年 5 月上线后播放量迅速破五十万。
金句与争论
- 「通用可微分计算机」:把 Transformer 从「一种 NLP 架构」抬升为「一类计算机」,是他最有影响力的 reframe;反对者认为这夸大了架构本身、贬低了数据与规模的作用。完整论断见三性质推文解读。
- 「架构自 2017 年以来惊人地稳定」:他指出 GPT 与原版 Transformer 差异很小,暗示进步主要来自数据、规模与工程——这与「下一个架构革命将至」的期待形成长期争论,至今未决。
- Bahdanau 邮件轶事:学界少见的第一手历史材料——重大发明的命名与归功往往比论文叙事更偶然。
对你意味着什么
- 正在学 LLM 原理的人:先看「消息传递」一段再去读《Attention Is All You Need》,论文的公式会突然变得可读。这是市面上性价比最高的一小时。
- 动手派:把讲座当 nanoGPT 的「设计文档」,配合 Zero to Hero 汉化课亲手实现一遍,比刷十篇综述有用。
- 做技术判断的人:「三性质」是一个可复用的架构评估框架——评估任何新架构(Mamba、RWKV……)时,先问它在哪个性质上打败了 Transformer。
延伸
- YouTube 原视频 · CS25 课程主页
- 解读:Transformer 三性质推文 —— 本讲座的推文浓缩版
- 解读:一切向 Transformer 收敛 —— 大一统叙事的另一面
- 导读:《RNN 的不合理有效性》 —— 被 Transformer 取代的前任主角