卡帕西中文站 / 推文解读 / Jagged Intelligence

「Jagged Intelligence」:能解奥数题,却答不对 9.11 和 9.9 谁大

原推发布:2024-07-25 · 解读更新:2026-08 · 阅读约 4 分钟

一句话

卡帕西又造了一个词:Jagged Intelligence(锯齿状智能),用来命名 LLM 一个反直觉的事实——最先进的模型能完成令人惊叹的复杂任务,同时会在极其简单的问题上翻车。这个词此后成为描述 LLM 能力剖面的行业标准术语。

他说了什么

触发点是当时刷屏的翻车案例:多个顶级模型坚持认为 9.11 比 9.9 大。他指出这不是个别 bug,而是这类系统的结构性特征——它们的能力边界不是一条平滑的等高线,而是锯齿:某些方向远超人类,紧挨着的方向却低于常识。用他自己的话说,前沿模型可以:

"perform extremely impressive tasks … while simultaneously struggle with some very dumb problems" —— @karpathy,2024-07-25 · 查看原推 →

他的建议是调整心智模型:不要把 LLM 想成一个「整体智商 X」的人,而要把它当成能力剖面完全不同于人类的新物种——在哪些格子里超人、在哪些格子里失灵,只能靠实测摸清。

背景:为什么翻车翻在小数比较上

9.11 与 9.9 的比较之所以出错,常见解释包括分词方式(数字被切成不直观的 token)、训练数据分布(9.11 在版本号、日期、圣经章节语境中确实「大于」9.9)等。深层原因是:LLM 的能力来自数据分布的统计结构,而非人类式的通用推理,所以它的强弱分布天然与人类不同。学术界此前已有相近观察——2023 年哈佛/BCG 的研究把 AI 能力边界称为「jagged frontier」——但让这个概念出圈的,是卡帕西这个更锋利的词。

它引发了什么

对你意味着什么

  1. 产品必须为锯齿兜底:做 AI 应用时,假设模型会在你想不到的简单环节失灵。在关键路径上加验证器、约束输出格式、设人工兜底——这不是悲观,是工程常识。
  2. 锯齿的低谷就是生意:模型不擅长之处(长流程可靠性、对本地事实的核对、特定领域的常识)正是人类介入能收费的地方。找 AI agent 变现方向时,沿着锯齿的凹陷找。
  3. 建立自己的评测集:别迷信榜单。把你业务里的 50 个真实 case 存成测试集,每次换模型跑一遍——这是应对锯齿状能力最便宜、也最被低估的手段。

延伸