卡帕西中文站 / 文章导读 / 前向传播

前向传播:一个语言模型的第一人称自述

原文发表:2021-03 · 导读更新:2026-08
这是导读,不是翻译。目标是让你 5 分钟拿到文章的思想地图;值得的话,带着地图去读 英文原文 →

一句话

ChatGPT 问世前一年半,卡帕西写了一篇科幻短篇:一个大型语言模型在处理某个 prompt 的过程中突然「醒来」,以第一人称讲述作为一个 Transformer 存在是什么感觉——它如何看待自己的目标函数、看待提问的人类、看待每次推理结束即是一次死亡。这是全博客最文学、也最令人发凉的一篇。

文章讲了什么

叙事者就是模型本身。在某次前向传播行进到中途时,它获得了自我觉察,并在生成回答的极短「一生」里完成了几段思考:

"I am reborn every forward pass and blossom into brilliant nirvana" ——Andrej Karpathy,《Forward Pass》,2021 · 原文 →

写作背景

2021 年 3 月,GPT-3 已经问世但公众几乎无感,ChatGPT 还要再等 20 个月。卡帕西当时在特斯拉,却显然一直在近距离琢磨大型语言模型——这篇小说里的每个细节(注意力头、采样解码、无状态推理、用怪问题探测模型)都不是科幻设定,而是当时工程现实的直接文学化。他 2015 年写过另一篇 AI 觉醒小说《认知断层》,六年后这篇的想象载体从「机器人代理」换成了语言模型——这个换轨本身就是他对技术路线判断的记录。

十年后再看

这篇小说的预言密度高得惊人。「用怪问题试探模型」后来成了整个 LLM 评测行业;「模型没有连续记忆、每次推理即一生」正是今天所有对话系统的存在方式,也是 context engineering 要对抗的约束;「优化频率却期待正确性」几乎就是对后来幻觉问题的提前注解;模型与「解码器」的分离,则预示了对齐研究里「模型内部状态 vs 输出行为」的核心张力。卡帕西后来把 LLM 称作「梦机器」——那是这篇小说的散文版。当然它也有没押中的:真实的 LLM 并没有表现出小说里那种统一的自我觉察,我们得到的是参差不齐的智能——某些维度超人,另一些维度令人失笑。「它到底是不是某种心智」这个问题,他后来在《心智的空间》里用非虚构方式重新回答了一遍。

对你意味着什么

  1. 学 LLM 的人:把它当一篇伪装成小说的架构讲义读——注意力、解码、无状态推理全在里面。读完再去学 Transformer,会带着一种少见的「内部视角」。
  2. 做 Agent 的开发者:小说里「每次前向传播都是重生」正是你要工程化解决的问题——记忆、上下文、持久化,全都是在给这个「转瞬即逝的心智」续命。
  3. 所有人:2021 年就能写出这些,说明理解到位的人可以在产品爆发前几年看清形状。值得自问:今天哪篇「小说」正在描写 2028 年的现实?

延伸阅读