像素会取代 token 吗?卡帕西评 DeepSeek-OCR 与分词器的末路
一句话
DeepSeek 发布 OCR 论文,演示了「光学压缩」:约 1000 个文本 token 渲染成图片后,用约 100 个视觉 token 就能以 97% 精度还原。卡帕西借题发挥,抛出一个激进设想:也许 LLM 的所有输入都应该是像素,纯文本反而是浪费且丑陋的接口。
他说了什么
他说自己喜欢这篇论文,但真正让他兴奋的不是 OCR 本身,而是它暗示的方向——把文字渲染成图像再喂给模型,可能全面优于喂 text token。他列了四条理由:信息压缩率更高、上下文更短;像素天然携带粗体、颜色、排版等信息,还能混排任意图像;输入端可以用双向注意力而非自回归;以及他念叨多年的心病——可以顺手干掉分词器。对分词器他毫不留情:
"The tokenizer must go." —— @karpathy,2025-10-20 · 查看原推 →
他也点明了不对称性:这个设想只针对输入端,输出端仍然要生成文本——像素出口并不现实。
背景:他跟 tokenizer 的多年恩怨
这不是临时起意。2023 年 5 月他就发推希望「扔掉 tokenization」;2024 年 2 月他专门录了两小时的分词器课程,示范 LLM 的大量怪异行为(拼写错误、算术翻车、对某些字符串的迷惑)都能追溯到分词这个「丑陋的历史包袱」。分词器把字节切成词表碎片,带来 Unicode 边角案例甚至安全隐患。DeepSeek-OCR 提供的新证据是:视觉通路的压缩效率可能比词表更高——这让「绕开分词」第一次有了工程上的正面论据。
它引发了什么
- 「分词器时代终结」大讨论:HN 长帖、各技术媒体跟进;中文科技圈报道尤其密集,「文本已死、视觉当立」一类标题刷屏——比他原文激进得多。
- 给国产开源加了权重:继 DeepSeek V3 之后,卡帕西再次公开为 DeepSeek 的工作站台,强化了「前沿方向可以由中国团队的开源论文引领」的认知。
- 研究跟进:光学压缩、以像素为统一输入接口的思路在其后一年持续有论文跟进;截至 2026 年中,主流生产模型仍在用分词器——方向被认真对待,革命尚未发生。
对你意味着什么
- 分词知识仍要懂,但别当成永恒:今天排查模型在字数统计、生僻词、多语言上的怪行为,分词仍是第一嫌疑人;同时要知道这层抽象正被行业有意识地瓦解。
- 长上下文成本有新解法可关注:如果你的 agent 产品被上下文费用卡住,留意「渲染成图再输入」类的压缩方案——这可能成为文档类应用降本的实用路径。
- 学会看「评论的评论」:一篇 OCR 论文经他一条推升维成接口哲学问题。识别谁能把具体成果放进大框架,是筛选值得长期关注的信息源的好标准。
延伸
- GitHub:DeepSeek-OCR —— 引发本推的论文与代码
- 2023 年原推:希望扔掉 tokenization —— 恩怨的起点
- 视频:Let's build the GPT Tokenizer —— 他亲授的分词器课程
- 解读:DeepSeek V3 点评 —— 他与 DeepSeek 的上一次交集
- 解读:Jagged Intelligence —— 分词正是「锯齿状智能」的病因之一