2025 LLM 年度回顾:世界观被改写的六件事
这是导读,不是翻译。目标是让你 5 分钟拿到文章的思想地图;值得的话,带着地图去读 英文原文 →
一句话
2025 年不只是模型变强的一年,而是整个行业对「LLM 是什么」的理解被改写的一年——卡帕西盘点了六个让他意外的范式转变,并断言 LLM 是与上世纪七八十年代计算机同级别的新计算范式。
文章讲了什么
六个转变,可以归成三组来看:
- 训练层的转变——RLVR(基于可验证奖励的强化学习)从边缘技巧变成与预训练并列的主训练阶段,吃掉了原本要投给预训练的算力,让模型自发长出推理策略;代价是「刷分」(benchmaxxing)让传统评测失灵。
- 认知层的转变——「幽灵与锯齿」:模型某些领域是天才、另一些领域像小学生,因为它的优化目标与生物智能完全无关。这是他 10 月《动物与幽灵》与 11 月《心智空间》两篇的年度总结版。
- 应用层的转变——四个标志物:Cursor 证明「编排多次 LLM 调用 + 领域界面」是新应用层的形态;Claude Code 是第一个让他信服的 agent,把 AI 从云端拉到本地、贴着私有数据干活;vibe coding 让代码变得「免费、易逝、可随手丢弃」,人人都能写软件;Nano Banana 之类的多模态生成则预示 LLM 需要自己的 GUI 时刻——就像命令行之后的图形界面。
写作背景
写于 2025 年 12 月 19 日。这一年他本人从旁观者变成深度用户:年初造出「vibe coding」一词,年末公开说自己被 agent 进展惊到(见「从未如此落后」)。年终盘点是他把散落一年的推文和博客收拢成一个连贯世界观的动作——也是写给同行的校准信号:哪些变化是真范式,哪些只是噪音。
影响与回响
文章发布后被大量引用为 2025 年的「官方总结」,其中最出圈的仍是那句:
"We're not 'evolving/growing animals', we are 'summoning ghosts'." —— Andrej Karpathy,《2025 LLM Year in Review》 · 原文 →
「LLM 是新计算范式」的类比在 2026 年被反复验证:他 4 月在红杉 Ascent 对谈中把 12 月定位为「agent 拐点」,正是本文观察的延续。文中对 benchmaxxing 的警告也应验了——2026 年上半年评测可信度成为行业公开难题。
对你意味着什么
- 把六个转变当选位地图:Cursor 证明的「应用层」逻辑可以复制到任何垂直领域——上下文工程 + 成本优化 + 领域界面,这三件事打包就是一个创业公司。中文市场的大多数垂直位置还空着。
- 本地 agent 是趋势不是噱头:Claude Code 式的「贴着你的数据、低延迟、可私有」是个人开发者的主场,云端巨头反而不占优。学会用它,再学会给别人装它,就是生意。
- 评测失灵 = 信任稀缺:当榜单不可信,谁能做真实场景的第三方评测,谁就掌握话语权。内容创作者可以从「实测报告」切入建立权威。
延伸阅读
- 英文原文:2025 LLM Year in Review
- 导读:《可验证性》 —— RLVR 背后的理论框架
- 导读:《动物与幽灵》 / 《心智空间》 —— 「幽灵」概念的两篇源头
- 推文解读:「vibe coding」的诞生 —— 年度词汇的起点
- 推文解读:「从未如此落后」 —— 他年末的真实心态