DeepSeek V3 点评:早于全球破圈一个月的「先知推」
一句话
2024 年 12 月 26 日,DeepSeek V3 发布当天,多数西方观察者还没反应过来,卡帕西已经给出判断:这是一家中国公司用零头级别的预算训出的前沿级开放权重模型,说明「资源受限逼出工程创新」是真的。一个月后 DeepSeek 全球刷屏,这条推被网友挖出来奉为先知。
他说了什么
他概括了 V3 的反差:性能对标第一梯队,训练投入却只用了约 2048 张 GPU、两个月、几百万美元——而美国头部实验室动辄以数万卡集群为标配。原话里最传神的是这个短语:
"a frontier-grade LLM trained on a joke of a budget" —— @karpathy,2024-12-26 · 查看原推 →
他同时给出了两层严谨的补充:一,这不代表大集群没用了——前沿探索仍然吃算力,V3 证明的是「已知配方下的执行效率」可以高到什么程度;二,资源约束(如出口管制下只能用 H800)反而逼出了极致的工程优化。
背景:数字的口径
DeepSeek V3 是 671B 参数的 MoE 模型,技术报告给出的口径是约 278.8 万 H800 GPU 时、按租用价折算约 557.6 万美元——且明确只计入最后一次正式训练,不含前期实验与人力。这个「约 600 万美元」后来在传播中经常被误当成 DeepSeek 的全部成本,而卡帕西当天就把口径说清楚了,这也是这条推文经得起回看的原因。
它引发了什么
- 一个月后的全球地震:2025 年 1 月 20 日 DeepSeek-R1 发布,1 月末 DeepSeek 应用登顶美区 App Store,1 月 27 日英伟达单日跌约 17%、市值蒸发近 6000 亿美元。Hacker News 上有人翻出这条推(讨论帖):真正的信号一个月前就摆在那里。
- 「算力效率」叙事确立:这条推预演了 2025 年的核心辩论——算力护城河 vs 算法效率。市场恐慌过后,行业共识回到他的原判断:效率提升会扩大而非消灭算力需求(杰文斯悖论),但「巨额预算 = 领先」的等式被永久打破。
- 开放权重竞赛提速:V3/R1 之后,开放权重模型从「落后半代的替代品」变成第一梯队的常规参与者,中国团队成为其中主力——这条推是最早为此定调的西方一线声音之一。
对你意味着什么
- 别把算力焦虑当结论:个人和小团队做不了预训练,但 V3 证明效率创新的空间始终存在。你的层级上同样如此——推理成本、上下文用量、模型选型,抠细节的回报是数量级的。
- 开放权重是中文开发者的主场优势:可自部署、可商用、成本可控的国产开源模型,是做 AI agent 生意时绕开 API 依赖和合规风险的现实选项。选型时把它们放进候选,而不是默认海外闭源。
- 跟对信息源就是套利:市场比一线工程师晚了一个月才看懂 V3。持续跟踪少数「亲手摸过技术」的判断者(而非转述媒体),信息差本身就能变成决策优势。
延伸
- DeepSeek V3 仓库与技术报告 —— 成本口径的一手来源
- 解读:「RLHF 只是勉强算 RL」 —— R1 的 RLVR 突破正走在他指的方向上
- 解读:llm.c 发布 —— 同一主题的另一端:训练成本坍缩到个人可及
- 解读:「是智能体十年」 —— 一个月后他对下一个热潮的降温判断