卡帕西中文站 / 推文解读 / 造梦机

「造梦机」:卡帕西如何把幻觉从缺陷讲成本质

原推发布:2023-12-09 · 解读更新:2026-08 · 阅读约 4 分钟

一句话

面对「怎么解决 LLM 幻觉问题」这个 2023 年最热的质疑,卡帕西给出一个颠覆性的回答:幻觉不是 LLM 的 bug,而是它的全部工作方式——LLM 就是造梦机,我们用提示词引导它做梦。真正有「幻觉问题」的不是模型,而是把模型包装成「助手」的产品——问题应该在产品层解决,而不是指望模型停止做梦。

他说了什么

他说每次被问到「幻觉问题」都有点无从答起,因为从某种意义上讲:

"hallucination is all LLMs do. They are dream machines." —— @karpathy,2023-12-09 · 查看原推 →

展开转述他的论证:LLM 的本职就是根据训练数据的分布「续写梦境」,提示词只是给梦起个头。梦到的内容大多有用,撞上事实错误时我们才管它叫「幻觉」——但对模型而言两者是同一个过程。他还给出一个精彩的对照:搜索引擎有相反的问题——它毫无创造力,只会原样返回已有内容;LLM 百分之百在创造,搜索引擎百分之零。而「AI 助手」这种产品形态需要在两者之间找位置:既要创造力,又要事实可靠。所以幻觉是助手产品要用工程手段(检索增强、工具调用、多次采样验证等)去约束的问题,而不是 LLM 本身的病。

背景:2023 年底,幻觉是行业头号指控

这条推的时机是对一整年舆论的回应。2023 年,律师引用 ChatGPT 编造的判例被法庭处罚等新闻反复出圈,「AI 一本正经地胡说八道」成为大众对 LLM 的头号印象,学界还在争论幻觉能否根治。当时主流话语把幻觉当成待修复的缺陷清单上的第一项;卡帕西则把问题重新分层:模型层的「做梦」是能力来源,产品层的「失实」才是待解问题。分层之后,讨论第一次有了正确的着力点。

它引发了什么

对你意味着什么

  1. 按容错度选赛道:做 AI 产品前先问:这个场景欢迎梦(创意、陪伴、起草),还是恐惧梦(医疗、法律、财务数据)?前者可以轻装上阵,后者必须预算检索、引用和人工复核的成本——很多失败项目死于把恐惧梦的场景当欢迎梦来做。
  2. 把「上缰绳」当成核心工程量:一个能赚钱的 agent,其代码量大头往往不在调用模型,而在验证输出:交叉检索、结构化校验、让模型引用来源再核对。理解「模型永远在做梦」,你就不会幻想升级模型能替你省掉这层。
  3. 向用户诚实传达机制:在产品文案和交付物里明确「AI 生成,需核实」并附上来源链接,短期看似示弱,长期是信任资产——尤其在中文市场,用户被「一本正经胡说」伤害过的记忆还很新。

延伸