Transformer 为什么赢:表达力、可优化、高效率
一句话
卡帕西给「Transformer 为什么统治了 AI」这个问题一个被引用至今的答案:因为它同时满足三个很难兼得的性质——表达力强(expressive)、可被梯度下降优化(optimizable)、在现代硬件上高效并行(efficient)。三者合一,使它成为一台:
"general-purpose differentiable computer" —— @karpathy,2022-10-19 · 查看原推 →
他说了什么
把三个性质展开讲:表达力指前向传播足够通用——注意力机制让任意 token 之间直接通信,网络可以在前向过程中表达非常一般的计算(后来「Transformer 在做 in-context learning 时像在运行程序」的研究印证了这点)。可优化性是最容易被忽视的一条:残差连接、LayerNorm、注意力的软性寻址,让这个很深的网络能被反向传播和随机梯度下降稳定地训练——多少「理论上更强」的架构死在了「训不动」上。高效率指它的计算图高度并行,天生适配 GPU/TPU——序列不再像 RNN 那样逐步处理,而是一次性铺开。他还补充过一个观察:自 2017 年问世以来,这个架构出奇地稳定,主体几乎没变——各种改进大多是外围修补。
背景:nanoGPT 时期的沉淀
2022 年 10 月,卡帕西刚离开 Tesla 三个月,正处在「自由研究者」状态:他在写极简教学代码库 nanoGPT,筹备 Zero to Hero 系列课,几个月后(2023 年 1 月)发布了那节著名的「从零手写 GPT」视频。这条推正是他为教学反复咀嚼「Transformer 到底是什么」之后的提炼——不是从论文综述里总结出来的,而是从亲手实现里长出来的。当时距《Attention Is All You Need》发表五年,行业已确认 Transformer 的统治地位(他前一年刚发过「AI 大一统」的感叹),但「为什么是它」一直缺一个简洁有力的解释。这条推补上了。
它引发了什么
- 成为标准答案:此后课程、教科书、面试、技术演讲里讲「Transformer 为何成功」,大多沿用这个三性质框架;「通用可微分计算机」成了描述 Transformer 的经典比喻。
- 改变了架构研究的评价标准:这个框架暗示,挑战者不能只在某一项上占优——Mamba 等新架构在效率上做文章,但要同时在三项上全面胜出极难,这解释了为什么到 2026 年 Transformer(及混合变体)仍是前沿模型的骨干。
- 支撑了 scaling 路线的合法性:既然架构已经足够通用且稳定,资源就该投向数据和规模而非架构翻新——这与其后几年「大力出奇迹」的行业主线互为注脚。
对你意味着什么
- 用三性质当「新架构过滤器」:下次看到「XX 架构取代 Transformer」的标题,先问三个问题——表达力够吗?训得稳吗?硬件上跑得快吗?三问一过,绝大多数新闻可以安心略过,省下的注意力是真金白银。
- 理解要建立在实现上:这条推的深度来自作者亲手写过每一行。想真正内化它,最短路径是跟着 Zero to Hero 用几百行代码把 GPT 写出来——「可优化性」这种东西,只有在你亲眼看过 loss 曲线之后才算懂。
- 把「可优化性」思维用到产品上:好架构是「能被梯度下降爬上去的」,好产品同样是「能被快速迭代改进的」。做 AI 应用时,优先选择反馈闭环短、每天能改进一点的形态——可迭代性本身就是竞争力。
延伸
- 解读:AI 大一统 —— 前一年的现象观察,这条推是它的原理解释
- 视频:Let's build GPT from scratch —— 三个月后的代码版答案
- 解读:llm.c —— 把这台「计算机」用纯 C 写一遍
- 解读:nanochat —— 2025 年的全流程极简实现