深入 ChatGPT 这样的大语言模型:3.5 小时全栈拆解
这是观看指南,不是字幕或搬运。视频请在原频道观看:YouTube 直达 →
一句话
这是卡帕西播放量最高的视频(超过 840 万次观看):面向大众、全程无代码,把「ChatGPT 是怎么造出来、为什么会这样表现」从头到尾讲了一遍——训练三阶段(预训练、监督微调、强化学习)逐层展开,顺带解释幻觉、分词怪癖、「模型需要 token 来思考」这些日常困惑的根源。看完它,你对 LLM 的理解会超过绝大多数从业者。
视频讲了什么
官方描述附完整章节,主线就是训练管线的三个阶段,外加「怎么用」的心智模型:
- 预训练:从真实数据集 FineWeb 讲起(约 44TB 文本、15 万亿 token 量级)——互联网文本如何被抓取、过滤;分词(BPE 如何把文本变成约十万种符号的序列);神经网络的输入输出与内部结构;推理是怎么一个 token 一个 token 采样的。他用 GPT-2 和 Llama 3.1 基座模型做实例,说明基座模型只是「互联网文本模拟器」,还不是助手。
- 监督微调(SFT):用人工标注的对话数据把基座模型变成助手。这一段是全片最实用的部分:幻觉从何而来、怎么缓解(教模型说「我不知道」、给它联网工具);为什么模型数不清「strawberry 里有几个 r」(分词的锅);为什么「模型需要 token 来思考」——计算量摊在生成的每个 token 上,逼它一步出答案就是逼它失误。
- 强化学习:他把 RLHF 和可验证奖励的 RL(RLVR)明确分开:前者用奖励模型模拟人类偏好,能打磨风格但容易被「钻空子」;后者在数学、代码这类可自动判分的领域让模型大规模试错,这才是 DeepSeek-R1 展示的路线——推理能力(思维链)是从 RL 里自己涌现出来的,类比 AlphaGo 超越人类棋谱。视频发布时恰逢 R1 引爆舆论,这一段是当时最清晰的原理讲解。
背景
2023 年的一小时入门大受欢迎后,观众一直在催「完整版」。2025 年 2 月他一连发布两支长视频,本片是「原理篇」,《我如何使用 LLM》是「实战篇」。当时正值 DeepSeek-R1 发布、全世界争论「推理模型是什么」的风口,这支视频等于把答案讲给了所有人,播放量因此一骑绝尘。
为什么值得花这三个半小时
市面上的 LLM 科普要么太浅(只讲比喻),要么太深(直接上论文),这支视频是罕见的中间层:不写代码,但每个环节都给你看真实的数据集、真实的模型输出。它最大的价值是把「LLM 的怪毛病」全部还原成训练管线里的具体原因——看完之后,幻觉、算错数、过度自信这些现象在你眼里不再是玄学,而是工程结果。三个半小时可以分三次看,按上面三个阶段切分正好。
对你意味着什么
- AI 学习者:这是概念课的天花板,但它刻意不碰代码。想真懂,看完每一段就去 Zero to Hero 写对应的代码(从micrograd 开始)——「看懂」和「写出来」之间隔着一整个学习闭环。
- 独立开发者 / agent 开发者:SFT 一章值得反复看——幻觉缓解、「给模型 token 思考」直接对应你写提示词和设计工作流的日常决策;RL 一章帮你判断「推理模型」该用在哪、贵在哪。
- 英文门槛:只有英文原声(可开英文自动字幕),但他讲得极慢、重复关键概念、全程画图演示。建议照本导读的三段结构分次观看,每次带着「这段要回答什么问题」再进去,理解压力会小很多。
延伸
- 视频原片(描述区附章节与资料链接)
- 导读:我如何使用 LLM —— 同期发布的实战篇
- 解读:「RLHF 勉强算 RL」 —— 视频 RL 章节观点的推文原型
- 解读:DeepSeek 冲击 —— 视频发布时的行业语境
- 导读:《神经网络训练配方》 —— 训练方法论的博文版