nanochat 发布:100 美元,8000 行代码,训练你自己的 ChatGPT
一句话
卡帕西开源了 nanochat:一个约 8000 行、从零开始的全栈管线,覆盖分词器训练、预训练、中期训练、SFT、可选 RL、推理引擎到 ChatGPT 式网页界面。跑一个脚本、租 8 张 H100 约 4 小时、花约 100 美元,你就拥有一个能对话的迷你 ChatGPT。发布数天内 GitHub 星标破 2 万。
他说了什么
他把 nanochat 定位为 nanoGPT 的继任者:不再只是预训练,而是把「做出一个 ChatGPT」的完整流程压进一个极简、可读、可魔改、依赖最少的代码库。他给它的宣传语是:
"the best ChatGPT that $100 can buy" —— @karpathy,2025-10-13 · 查看原推 →
他对能力预期非常克制:100 美元档的模型像个能聊天的「幼儿园小孩」,会写诗、答简单问题,也会一本正经地胡说;加钱训到千元级会明显更连贯。他明确说这是为 Eureka Labs 的 LLM101n 课程准备的压轴(capstone)项目——重点从来不是做出可用产品,而是让整条链路变得可以被一个人完整读懂。
背景:极简复现三部曲的终章
这是他「用最少代码祛魅 LLM」路线的第三部:2022 年的 nanoGPT 让预训练可读,2024 年的 llm.c 把 GPT-2 训练写进纯 C,nanochat 则第一次把「从互联网文本到能对话的助手」全程打通。背后是训练成本的持续坍缩——他 2024 年已演示过 20 美元复现 GPT-2 级别模型。当复现 ChatGPT 雏形的成本降到一顿饭钱,「LLM 是少数巨头的黑魔法」这个叙事就被物理性地拆掉了。
它引发了什么
- 现象级传播:数天内星标破 2 万,成为当月 GitHub 最热项目之一;中文科技媒体大规模报道,「100 美元自训 ChatGPT」成为标题模板。
- 社区速通竞赛:repo 的 discussions 里聚集起一批人刷「更低成本、更高分数」,nanochat 事实上成了小模型训练的公共基准场。
- LLM101n 的事实成果:Eureka Labs 官宣的课程一直未完整发布,nanochat 被广泛视为这门课的实质交付物;2026 年 5 月他加入 Anthropic 后,这个 MIT 协议的开源库仍是最完整的单人可读 LLM 全栈教材。
对你意味着什么
- 最划算的一次深度学习投资:通读这 8000 行(配合 AI 辅助逐模块提问),比读十篇论文综述更能建立对 LLM 的物理直觉。不必真花 100 美元训练,读懂代码本身就是主要收益。
- 别把它当创业捷径:100 美元模型的能力远低于任何商用 API。独立开发者做产品仍应调用大模型 API;nanochat 的价值是让你在选型、微调、排错时不再把模型当黑箱。
- 成本直觉即判断力:知道「多少钱能训出什么水平」,你就能快速识别市面上「自研大模型」宣传的成色——这在与客户和投资人的对话里是真实的信息优势。
延伸
- GitHub:karpathy/nanochat —— 源码、speedrun 脚本与社区讨论(MIT 协议)
- 解读:llm.c 发布 —— 三部曲的第二部,纯 C 训练 GPT-2
- 解读:创立 Eureka Labs —— nanochat 所属课程 LLM101n 的来处
- 解读:DeepSeek V3 点评 —— 他对「训练成本坍缩」的另一次预判
- 解读:加入 Anthropic —— Eureka Labs 章节的收尾