卡帕西中文站 / 推文解读 / RLHF barely RL

「RLHF 只是勉强算 RL」:奖励模型是氛围代理,不是真目标

原推发布:2024-08-08 · 解读更新:2026-08 · 阅读约 4 分钟

一句话

卡帕西发长文戳破一个行业惯用说法:把 RLHF(基于人类反馈的强化学习)当成「大模型的强化学习阶段」名不副实。他的判断浓缩在开头一句:

"RLHF is just barely RL." —— @karpathy,2024-08-08 · 查看原推 →

他说了什么

他把 RLHF 和 AlphaGo 式的强化学习摆在一起对比。AlphaGo 优化的是真实的最终目标——赢棋,环境会给出不容置疑的裁决,所以可以放开了长时间训练,最终超越人类。而 RLHF 优化的对象是一个奖励模型:它只是对「人类标注员会更喜欢哪个回答」的有损模仿,本质上是给回答打「氛围分」的代理。代理目标有两个致命软肋:一,它可能与真实价值错位,模型学会的是讨好评分器而非把事做对;二,它极易被钻空子——训练久了,优化器总能找到让奖励模型打高分的对抗性垃圾输出。所以 RLHF 只能小心翼翼地跑一小段就得停,谈不上 AlphaGo 那种「越练越强、没有上限」的强化学习。他也承认 RLHF 作为微调手段确实有用(判别比生成容易,人类挑答案比写答案可靠),但「有用」和「是真 RL」是两回事。

背景:2024 年的对齐正统

当时 RLHF 是 ChatGPT 以来对齐流程的正统三部曲(预训练 → SFT → RLHF)的压轴,行业普遍将其视为「RL 已用于大模型」的证据。卡帕西的长文把一个训练细节上升为路线判断:在开放域里,我们还没有找到可规模化的真实奖励信号——这才是通往更强智能的卡点。

它引发了什么

对你意味着什么

  1. 理解模型的「讨好病」:模型油腻的奉承、表面正确的空话,很大程度是优化「氛围代理」的副产品。写关键业务的 prompt 和评估时,要主动对抗这种倾向,比如要求给出可核查的依据。
  2. 做微调选对武器:你的任务有可自动判分的真值(代码能否跑通、答案对错、转化率)→ 可考虑 RL/RLVR 路线;只有主观偏好 → 老实用 SFT + 偏好优化,并警惕 reward hacking。
  3. 设计 agent 业务时把任务「可验证化」:能被机器裁决的环节才能自我改进。把交付物拆成可测试的单元(测试用例、校验规则),等于给未来的自动优化留了接口。

延伸