卡帕西中文站 / 推文解读 / nanochat

nanochat 发布:100 美元,8000 行代码,训练你自己的 ChatGPT

原推发布:2025-10-13 · 解读更新:2026-08 · 阅读约 4 分钟

一句话

卡帕西开源了 nanochat:一个约 8000 行、从零开始的全栈管线,覆盖分词器训练、预训练、中期训练、SFT、可选 RL、推理引擎到 ChatGPT 式网页界面。跑一个脚本、租 8 张 H100 约 4 小时、花约 100 美元,你就拥有一个能对话的迷你 ChatGPT。发布数天内 GitHub 星标破 2 万。

他说了什么

他把 nanochat 定位为 nanoGPT 的继任者:不再只是预训练,而是把「做出一个 ChatGPT」的完整流程压进一个极简、可读、可魔改、依赖最少的代码库。他给它的宣传语是:

"the best ChatGPT that $100 can buy" —— @karpathy,2025-10-13 · 查看原推 →

他对能力预期非常克制:100 美元档的模型像个能聊天的「幼儿园小孩」,会写诗、答简单问题,也会一本正经地胡说;加钱训到千元级会明显更连贯。他明确说这是为 Eureka Labs 的 LLM101n 课程准备的压轴(capstone)项目——重点从来不是做出可用产品,而是让整条链路变得可以被一个人完整读懂

背景:极简复现三部曲的终章

这是他「用最少代码祛魅 LLM」路线的第三部:2022 年的 nanoGPT 让预训练可读,2024 年的 llm.c 把 GPT-2 训练写进纯 C,nanochat 则第一次把「从互联网文本到能对话的助手」全程打通。背后是训练成本的持续坍缩——他 2024 年已演示过 20 美元复现 GPT-2 级别模型。当复现 ChatGPT 雏形的成本降到一顿饭钱,「LLM 是少数巨头的黑魔法」这个叙事就被物理性地拆掉了。

它引发了什么

对你意味着什么

  1. 最划算的一次深度学习投资:通读这 8000 行(配合 AI 辅助逐模块提问),比读十篇论文综述更能建立对 LLM 的物理直觉。不必真花 100 美元训练,读懂代码本身就是主要收益。
  2. 别把它当创业捷径:100 美元模型的能力远低于任何商用 API。独立开发者做产品仍应调用大模型 API;nanochat 的价值是让你在选型、微调、排错时不再把模型当黑箱。
  3. 成本直觉即判断力:知道「多少钱能训出什么水平」,你就能快速识别市面上「自研大模型」宣传的成色——这在与客户和投资人的对话里是真实的信息优势。

延伸