「Jagged Intelligence」:能解奥数题,却答不对 9.11 和 9.9 谁大
一句话
卡帕西又造了一个词:Jagged Intelligence(锯齿状智能),用来命名 LLM 一个反直觉的事实——最先进的模型能完成令人惊叹的复杂任务,同时会在极其简单的问题上翻车。这个词此后成为描述 LLM 能力剖面的行业标准术语。
他说了什么
触发点是当时刷屏的翻车案例:多个顶级模型坚持认为 9.11 比 9.9 大。他指出这不是个别 bug,而是这类系统的结构性特征——它们的能力边界不是一条平滑的等高线,而是锯齿:某些方向远超人类,紧挨着的方向却低于常识。用他自己的话说,前沿模型可以:
"perform extremely impressive tasks … while simultaneously struggle with some very dumb problems" —— @karpathy,2024-07-25 · 查看原推 →
他的建议是调整心智模型:不要把 LLM 想成一个「整体智商 X」的人,而要把它当成能力剖面完全不同于人类的新物种——在哪些格子里超人、在哪些格子里失灵,只能靠实测摸清。
背景:为什么翻车翻在小数比较上
9.11 与 9.9 的比较之所以出错,常见解释包括分词方式(数字被切成不直观的 token)、训练数据分布(9.11 在版本号、日期、圣经章节语境中确实「大于」9.9)等。深层原因是:LLM 的能力来自数据分布的统计结构,而非人类式的通用推理,所以它的强弱分布天然与人类不同。学术界此前已有相近观察——2023 年哈佛/BCG 的研究把 AI 能力边界称为「jagged frontier」——但让这个概念出圈的,是卡帕西这个更锋利的词。
它引发了什么
- 进入行业词典:此后两年,「jagged」成为讨论 LLM 能力时的默认形容词,论文、评测报告、产品文档广泛采用;谷歌 CEO 皮查伊后来也借用了「artificial jagged intelligence(AJI)」的说法来描述当前阶段。
- 评测方式的反思:既然能力是锯齿状的,单一 benchmark 分数就失去了代表性——这直接助推了「vibe check」文化和面向具体业务自建评测集的实践。
- 他自己的续篇:2025 年他在「动物 vs 幽灵」的论述中进一步展开——我们召唤出的不是数字动物,而是能力剖面怪异的「幽灵」,锯齿正是其表征之一。推理模型让部分锯齿被磨平(如今模型基本不再算错 9.11),但新的锯齿仍在不断被发现。
对你意味着什么
- 产品必须为锯齿兜底:做 AI 应用时,假设模型会在你想不到的简单环节失灵。在关键路径上加验证器、约束输出格式、设人工兜底——这不是悲观,是工程常识。
- 锯齿的低谷就是生意:模型不擅长之处(长流程可靠性、对本地事实的核对、特定领域的常识)正是人类介入能收费的地方。找 AI agent 变现方向时,沿着锯齿的凹陷找。
- 建立自己的评测集:别迷信榜单。把你业务里的 50 个真实 case 存成测试集,每次换模型跑一遍——这是应对锯齿状能力最便宜、也最被低估的手段。
延伸
- 解读:「我们在召唤幽灵,不是养动物」 —— 锯齿智能的世界观续篇
- 解读:「LLM 是造梦机」 —— 幻觉视角下的同一枚硬币
- 解读:像素可能优于 text tokens —— 分词这个锯齿之源的清算
- 解读:AGI 还有十年 —— 锯齿被磨平需要多久