卡帕西中文站 / 推文解读 / 像素 vs token

像素会取代 token 吗?卡帕西评 DeepSeek-OCR 与分词器的末路

原推发布:2025-10-20 · 解读更新:2026-08 · 阅读约 4 分钟

一句话

DeepSeek 发布 OCR 论文,演示了「光学压缩」:约 1000 个文本 token 渲染成图片后,用约 100 个视觉 token 就能以 97% 精度还原。卡帕西借题发挥,抛出一个激进设想:也许 LLM 的所有输入都应该是像素,纯文本反而是浪费且丑陋的接口

他说了什么

他说自己喜欢这篇论文,但真正让他兴奋的不是 OCR 本身,而是它暗示的方向——把文字渲染成图像再喂给模型,可能全面优于喂 text token。他列了四条理由:信息压缩率更高、上下文更短;像素天然携带粗体、颜色、排版等信息,还能混排任意图像;输入端可以用双向注意力而非自回归;以及他念叨多年的心病——可以顺手干掉分词器。对分词器他毫不留情:

"The tokenizer must go." —— @karpathy,2025-10-20 · 查看原推 →

他也点明了不对称性:这个设想只针对输入端,输出端仍然要生成文本——像素出口并不现实。

背景:他跟 tokenizer 的多年恩怨

这不是临时起意。2023 年 5 月他就发推希望「扔掉 tokenization」;2024 年 2 月他专门录了两小时的分词器课程,示范 LLM 的大量怪异行为(拼写错误、算术翻车、对某些字符串的迷惑)都能追溯到分词这个「丑陋的历史包袱」。分词器把字节切成词表碎片,带来 Unicode 边角案例甚至安全隐患。DeepSeek-OCR 提供的新证据是:视觉通路的压缩效率可能比词表更高——这让「绕开分词」第一次有了工程上的正面论据。

它引发了什么

对你意味着什么

  1. 分词知识仍要懂,但别当成永恒:今天排查模型在字数统计、生僻词、多语言上的怪行为,分词仍是第一嫌疑人;同时要知道这层抽象正被行业有意识地瓦解。
  2. 长上下文成本有新解法可关注:如果你的 agent 产品被上下文费用卡住,留意「渲染成图再输入」类的压缩方案——这可能成为文档类应用降本的实用路径。
  3. 学会看「评论的评论」:一篇 OCR 论文经他一条推升维成接口哲学问题。识别谁能把具体成果放进大框架,是筛选值得长期关注的信息源的好标准。

延伸