卡帕西中文站 / 推文解读 / DeepSeek V3

DeepSeek V3 点评:早于全球破圈一个月的「先知推」

原推发布:2024-12-26 · 解读更新:2026-08 · 阅读约 4 分钟

一句话

2024 年 12 月 26 日,DeepSeek V3 发布当天,多数西方观察者还没反应过来,卡帕西已经给出判断:这是一家中国公司用零头级别的预算训出的前沿级开放权重模型,说明「资源受限逼出工程创新」是真的。一个月后 DeepSeek 全球刷屏,这条推被网友挖出来奉为先知。

他说了什么

他概括了 V3 的反差:性能对标第一梯队,训练投入却只用了约 2048 张 GPU、两个月、几百万美元——而美国头部实验室动辄以数万卡集群为标配。原话里最传神的是这个短语:

"a frontier-grade LLM trained on a joke of a budget" —— @karpathy,2024-12-26 · 查看原推 →

他同时给出了两层严谨的补充:一,这不代表大集群没用了——前沿探索仍然吃算力,V3 证明的是「已知配方下的执行效率」可以高到什么程度;二,资源约束(如出口管制下只能用 H800)反而逼出了极致的工程优化。

背景:数字的口径

DeepSeek V3 是 671B 参数的 MoE 模型,技术报告给出的口径是约 278.8 万 H800 GPU 时、按租用价折算约 557.6 万美元——且明确只计入最后一次正式训练,不含前期实验与人力。这个「约 600 万美元」后来在传播中经常被误当成 DeepSeek 的全部成本,而卡帕西当天就把口径说清楚了,这也是这条推文经得起回看的原因。

它引发了什么

对你意味着什么

  1. 别把算力焦虑当结论:个人和小团队做不了预训练,但 V3 证明效率创新的空间始终存在。你的层级上同样如此——推理成本、上下文用量、模型选型,抠细节的回报是数量级的。
  2. 开放权重是中文开发者的主场优势:可自部署、可商用、成本可控的国产开源模型,是做 AI agent 生意时绕开 API 依赖和合规风险的现实选项。选型时把它们放进候选,而不是默认海外闭源。
  3. 跟对信息源就是套利:市场比一线工程师晚了一个月才看懂 V3。持续跟踪少数「亲手摸过技术」的判断者(而非转述媒体),信息差本身就能变成决策优势。

延伸