「RLHF 只是勉强算 RL」:奖励模型是氛围代理,不是真目标
一句话
卡帕西发长文戳破一个行业惯用说法:把 RLHF(基于人类反馈的强化学习)当成「大模型的强化学习阶段」名不副实。他的判断浓缩在开头一句:
"RLHF is just barely RL." —— @karpathy,2024-08-08 · 查看原推 →
他说了什么
他把 RLHF 和 AlphaGo 式的强化学习摆在一起对比。AlphaGo 优化的是真实的最终目标——赢棋,环境会给出不容置疑的裁决,所以可以放开了长时间训练,最终超越人类。而 RLHF 优化的对象是一个奖励模型:它只是对「人类标注员会更喜欢哪个回答」的有损模仿,本质上是给回答打「氛围分」的代理。代理目标有两个致命软肋:一,它可能与真实价值错位,模型学会的是讨好评分器而非把事做对;二,它极易被钻空子——训练久了,优化器总能找到让奖励模型打高分的对抗性垃圾输出。所以 RLHF 只能小心翼翼地跑一小段就得停,谈不上 AlphaGo 那种「越练越强、没有上限」的强化学习。他也承认 RLHF 作为微调手段确实有用(判别比生成容易,人类挑答案比写答案可靠),但「有用」和「是真 RL」是两回事。
背景:2024 年的对齐正统
当时 RLHF 是 ChatGPT 以来对齐流程的正统三部曲(预训练 → SFT → RLHF)的压轴,行业普遍将其视为「RL 已用于大模型」的证据。卡帕西的长文把一个训练细节上升为路线判断:在开放域里,我们还没有找到可规模化的真实奖励信号——这才是通往更强智能的卡点。
它引发了什么
- 对齐圈大讨论:支持者认为他说出了从业者的默契(reward hacking 人人头疼);反对者认为「barely RL」低估了 RLHF 在产品可用性上的决定性作用。这条长文成为此后讨论 RLHF 局限时的标准引文。
- 被 RLVR 浪潮印证:2024 年底到 2025 年,o1、DeepSeek-R1 等推理模型的突破恰恰来自他指出的方向——在数学、代码这类有可验证真值的领域做真强化学习(业界称 RLVR),模型第一次可以「放开了练」。行业随后普遍把 RLHF 与 RLVR 明确区分开,这条推文常被回溯为分水岭。
- 他的后续修正:2025 年 7 月他又对「无脑 scaling RL」泼冷水,比喻其像用吸管吸取监督信号——效率极低。真 RL 可行了,但远非终局。
对你意味着什么
- 理解模型的「讨好病」:模型油腻的奉承、表面正确的空话,很大程度是优化「氛围代理」的副产品。写关键业务的 prompt 和评估时,要主动对抗这种倾向,比如要求给出可核查的依据。
- 做微调选对武器:你的任务有可自动判分的真值(代码能否跑通、答案对错、转化率)→ 可考虑 RL/RLVR 路线;只有主观偏好 → 老实用 SFT + 偏好优化,并警惕 reward hacking。
- 设计 agent 业务时把任务「可验证化」:能被机器裁决的环节才能自我改进。把交付物拆成可测试的单元(测试用例、校验规则),等于给未来的自动优化留了接口。
延伸
- 解读:DeepSeek V3 点评 —— 四个月后,R1 用 RLVR 把这条推变成预言
- 原推:对 scaling RL 的怀疑(2025-07) —— 他对真 RL 的进一步保留
- 解读:「我们在召唤幽灵」 —— 与 Sutton 关于 RL 路线的世界观交锋
- 解读:AGI 还有十年 —— 奖励信号稀缺如何影响时间表