卡帕西中文站 / 视频导读 / 深入大语言模型

深入 ChatGPT 这样的大语言模型:3.5 小时全栈拆解

视频发布:2025-02 · 时长:3:31 · 导读更新:2026-08
这是观看指南,不是字幕或搬运。视频请在原频道观看:YouTube 直达 →

一句话

这是卡帕西播放量最高的视频(超过 840 万次观看):面向大众、全程无代码,把「ChatGPT 是怎么造出来、为什么会这样表现」从头到尾讲了一遍——训练三阶段(预训练、监督微调、强化学习)逐层展开,顺带解释幻觉、分词怪癖、「模型需要 token 来思考」这些日常困惑的根源。看完它,你对 LLM 的理解会超过绝大多数从业者。

视频讲了什么

官方描述附完整章节,主线就是训练管线的三个阶段,外加「怎么用」的心智模型:

背景

2023 年的一小时入门大受欢迎后,观众一直在催「完整版」。2025 年 2 月他一连发布两支长视频,本片是「原理篇」,《我如何使用 LLM》是「实战篇」。当时正值 DeepSeek-R1 发布、全世界争论「推理模型是什么」的风口,这支视频等于把答案讲给了所有人,播放量因此一骑绝尘。

为什么值得花这三个半小时

市面上的 LLM 科普要么太浅(只讲比喻),要么太深(直接上论文),这支视频是罕见的中间层:不写代码,但每个环节都给你看真实的数据集、真实的模型输出。它最大的价值是把「LLM 的怪毛病」全部还原成训练管线里的具体原因——看完之后,幻觉、算错数、过度自信这些现象在你眼里不再是玄学,而是工程结果。三个半小时可以分三次看,按上面三个阶段切分正好。

对你意味着什么

  1. AI 学习者:这是概念课的天花板,但它刻意不碰代码。想真懂,看完每一段就去 Zero to Hero 写对应的代码(从micrograd 开始)——「看懂」和「写出来」之间隔着一整个学习闭环。
  2. 独立开发者 / agent 开发者:SFT 一章值得反复看——幻觉缓解、「给模型 token 思考」直接对应你写提示词和设计工作流的日常决策;RL 一章帮你判断「推理模型」该用在哪、贵在哪。
  3. 英文门槛:只有英文原声(可开英文自动字幕),但他讲得极慢、重复关键概念、全程画图演示。建议照本导读的三段结构分次观看,每次带着「这段要回答什么问题」再进去,理解压力会小很多。

延伸