State of GPT:首次公开的 ChatGPT 训练管线
这是观看指南,不是字幕或搬运。视频请在原频道观看:YouTube 直达 →
一句话
ChatGPT 发布半年、全世界还在猜「它到底是怎么炼成的」的时候,刚回到 OpenAI 的卡帕西在 Microsoft Build 2023 上用 43 分钟第一次系统公开了 GPT 助手的完整训练管线,并给出一套「既然它是这样炼成的,就该这样用它」的提示方法论。这场演讲是无数人对 LLM 认知的起点,幻灯片(karpathy.ai/stateofgpt.pdf)至今仍被引用。
视频讲了什么
演讲分上下两半,「怎么训练」和「怎么使用」:
- 训练四阶段。①预训练:占全部计算量的 99%——数千块 GPU、数月时间,在海量互联网文本(CommonCrawl、维基、GitHub 等)上做下一个 token 预测,产出「基座模型」;此前先经分词把文本变成整数序列。②监督微调(SFT):用人工示范的高质量问答教它「扮演助手」。③奖励建模:让人类对模型的多个回答排序,训练一个打分模型。④RLHF:用奖励模型指导强化学习,让输出更符合人类偏好。他强调基座模型和助手模型是两种东西——基座模型不回答问题,只补全文本。
- 使用方法论。核心视角:LLM 不是搜索引擎,而是「token 模拟器」,你的提示词是在设定它模拟什么。由此推出一串实用建议:要求分步思考(思维链,「模型需要 token 来思考」)、给示范(few-shot)、让它自查、采样多个答案再选、用检索喂上下文、工具外包计算,以及当时刚兴起的 Tree of Thought 等进阶玩法。结尾他也坦率列出局限:幻觉、知识截止、注入攻击——建议用于「有人监督的副驾驶」场景。
背景
2023 年 5 月是个微妙的时间点:GPT-4 发布两个月,公众热情最高、公开信息最少。OpenAI 极少披露训练细节,而卡帕西以「刚回归的元老 + 天生教师」的身份,把行业通用的管线讲到了当时公开场合的最细粒度。这也是他离开特斯拉回到 OpenAI 后最重要的一次公开亮相,台下坐的是全球开发者——某种意义上,后来几年提示工程的「常识」,很多就是从这 43 分钟扩散出去的。
为什么值得花这 43 分钟
它是「历史文件」和「实用教程」的罕见结合。作为历史文件,它记录了 RLHF 时代的完整方法论——对照两年后的《深入 ChatGPT》(新增了 RLVR 与推理模型),你能清楚看到这个领域两年里长出了什么。作为教程,它的使用建议大半仍然有效:思维链、few-shot、检索增强、工具调用在 2026 年只是换了名字住进了 agent 框架。43 分钟的时长也使它成为本站导读的演讲里「性价比」最高的一支。
对你意味着什么
- AI 学习者:把它当3.5 小时深潜版的「前情提要」——先花 43 分钟建立四阶段框架,再看深潜版填细节,几乎是为对照学习设计的一对教材。
- 独立开发者 / agent 开发者:下半场就是提示工程的「第一性原理」课——每条技巧都从「模型是 token 模拟器」推导而来。理解了推导,你就不用背任何提示词模板了。他「副驾驶而非自动驾驶」的产品判断,在 agent 时代依然是清醒剂。
- 英文门槛:会议演讲,语速中等、幻灯片信息量大(YouTube 有英文自动字幕)。推荐「先读 PDF 再看视频」:幻灯片本身就是极好的独立读物,先过一遍再听讲解,理解效率翻倍。
延伸
- 视频原片 · 官方幻灯片 PDF
- 导读:大语言模型入门 —— 半年后面向大众的姊妹篇
- 导读:深入 ChatGPT 这样的大语言模型 —— 两年后的完整升级版
- 解读:「RLHF 勉强算 RL」 —— 他后来对第四阶段的冷思考