AI 大一统:当所有方向都收敛到同一个架构
一句话
卡帕西观察到一个正在发生的历史性变化:视觉、语音、自然语言、强化学习这些原本各自为政的 AI 子领域,正在架构层面收敛到同一个东西——Transformer。这条推成了描述「基础模型时代」到来的经典引文,后来人们常用一句话概括它:Transformers are eating the field(Transformer 正在吞噬整个领域)。
他说了什么
他的开场感叹被引用至今:
"The ongoing consolidation in AI is incredible." —— @karpathy,2021-12-08 · 查看原推 →
他回顾说,十年前他入行时,视觉、语音、NLP、强化学习是完全独立的社区,隔行如隔山,论文互相读不懂。后来大家先统一到了机器学习和神经网络的框架下,但各领域仍有专属架构:视觉用 CNN,序列用 RNN/LSTM。而到 2021 年,连架构也统一了——不管什么模态,大家都在往 Transformer 上迁移,区别只剩下数据和输入输出的细节。他在随后的跟帖(见此)里继续展开了这一收敛趋势。
背景:2021 年正是收敛的拐点
时间点选得极准。2017 年《Attention Is All You Need》发表时,Transformer 还只是机器翻译的新架构;2018–2020 年 BERT 和 GPT 系列拿下 NLP;2020 年底 ViT 证明视觉不需要卷积归纳偏置;2021 年语音识别、蛋白质结构(AlphaFold 2 的核心也是注意力机制)、乃至把强化学习当序列建模做的 Decision Transformer 相继落地。卡帕西自己在 Tesla 的 Autopilot 视觉栈也在向 Transformer 迁移。他做的事情是把这些散点连成了线,并指出其含义:当所有人共享同一个架构,任何一处的改进都能瞬间传导到所有领域——软件、硬件、人才从此可以复用。
它引发了什么
- 「基础模型时代」的标准引文:此后几年,讲 foundation model、讲多模态大一统的文章几乎都要引用这条推。2023 年起 GPT-4V、Gemini 等原生多模态模型,把「一个架构处理所有模态」从趋势变成了产品现实。
- 整个产业栈围绕单一架构优化:GPU 设计、注意力算子(FlashAttention 等)、推理引擎、训练框架,全部押注 Transformer——收敛带来了惊人的复利,也带来「硬件彩票」式的路径锁定争论。
- 挑战者出现但未改变格局:2023 年后 Mamba 等状态空间模型试图挑战注意力机制,取得局部战果,但到 2026 年,主流前沿模型的骨干仍是 Transformer(及其混合变体)——收敛判断至今成立。
- 他本人的后续注解:2022 年 10 月他又用一条推解释了收敛的原因——Transformer 是一台「通用可微分计算机」,表达力、可优化性、并行效率三者兼得。
对你意味着什么
- 学一次,用十年:深入理解 Transformer(注意力、KV cache、位置编码)是当下性价比最高的技术投资——它同时是你理解 LLM、多模态、语音、图像生成的钥匙。跟着 Zero to Hero 亲手写一遍 GPT,胜过泛读百篇论文。
- 收敛意味着应用层护城河转移:架构统一后,模型能力人人可租用,差异化只能来自数据、场景和产品——独立开发者应把精力放在「用同一个模型家族解决一百个具体问题」上,而不是追逐架构新闻。
- 识别「收敛拐点」是一种可迁移的眼力:卡帕西在收敛完成前一步说破了它。今天你也可以问:agent 工具链、评测方法、上下文管理——哪一层正在收敛?站在收敛完成的前夜下注,回报最大。
延伸
- 解读:Transformer 三性质 —— 他对「为什么赢家是它」的正式回答
- 解读:Software 2.0 —— 更早一层的范式判断
- 解读:像素可能优于 text tokens —— 2025 年他对输入端统一的新思考
- 课程汉化:Zero to Hero —— 从零手写 Transformer