【Transformer 与注意力机制】33|RLHF:从 PPO 到 DPO,再到 GRPO
内容提要
本文介绍RLHF及其变体DPO、GRPO,旨在解决SFT无法表达相对偏好的问题。SFT仅最大化单一参考答案似然,无法区分多个合理回答的优劣。RLHF通过奖励模型和KL约束优化策略,但存在奖励过优化、对齐税等风险。DPO省去显式奖励模型和在线采样,GRPO在可验证奖励场景下省去critic。三者各有适用场景,对齐税是工程问题也是结构性风险。
延伸解读
SFT 的天花板:目标函数而非数据量
文章指出,SFT 的似然目标只能最大化给定参考答案的似然,无法表达多个合理回答之间的相对偏好。这不是数据量能解决的问题,而是目标函数本身的表达力上限。Stiennon 等人的实验显示,1.3B 参数的人类反馈模型在人工评测中优于 10 倍参数量的纯监督模型,说明监督模仿单一参考存在用规模换不出来的天花板。理解这一点,有助于避免盲目增加数据或模型规模来弥补偏好对齐的缺陷。
RLHF 的代价:从 Goodhart 曲线到对齐税
PPO 版 RLHF 虽然有效,但代价高昂:需要在线采样和四模型计算,且存在多种不稳定症状。Gao 等人量化的 Goodhart 曲线表明,随着策略偏离初始策略,proxy reward 单调上升,但真实质量先升后降。Ouyang 等人报告的对齐税在公开基准上可观测,但可通过 PPO-ptx 等工程手段缓解。这些证据说明,RLHF 的代价既有工程性的一面,也有代理目标带来的结构性风险,不能简单通过调参消除。
DPO 与 GRPO:省了什么,又转移了什么风险
DPO 通过从 KL 正则目标直接解出策略,省去了显式奖励模型和在线采样,但依赖参考模型和离线数据,面临分布漂移和长度偏置风险。GRPO 在可验证奖励场景下,用组内相对优势替代 critic,省去价值网络,但依赖可重复采样和可靠验证器,组内全对或全错时优势会塌缩。选择哪种方法取决于数据形态和任务性质,并非越新越好。
Q&A
为什么SFT无法表达多个合理回答之间的相对偏好?
SFT的训练目标是最大化给定参考答案的对数似然,它只关心当前这条参考答案的概率是否被推高,没有机制去比较多个都合理的回答哪个更好。这是目标函数本身的表达力上限,不是数据量能解决的问题。
RLHF中的奖励模型是如何训练的?
奖励模型使用成对偏好数据(x, y_w, y_l)训练,其中y_w是更优回答,y_l是较差回答。通过Bradley-Terry模型将成对偏好转化为标量分数,训练目标是最大化P(y_w > y_l)的对数似然,等价于最小化-log σ(r(x,y_w)-r(x,y_l))。
PPO版RLHF为什么需要KL约束?
KL约束防止策略为了最大化奖励而偏离SFT模型太远,避免策略利用奖励模型的漏洞(如格式套话、过度自信)而生成不符合人类意图的内容。它定义了偏离SFT行为的代价,β控制对齐收益和语言能力回退之间的张力。
DPO相比PPO版RLHF省去了哪些组件?
DPO省去了显式奖励模型、在线采样和critic。它直接从KL正则目标中解出最优策略,将奖励表示为策略和参考策略的log-ratio,从而无需单独训练奖励模型,也无需在线采样和PPO的裁剪目标。
GRPO在什么场景下适用?
GRPO适用于可验证奖励的场景,如数学、代码等答案可由规则或程序判定的任务。它通过组内相对优势替代critic,省去价值网络,但依赖可重复采样和可靠验证器。
对齐税是什么?能否被彻底消除?
对齐税是指对齐流程(如RLHF)带来的公开基准性能回归,是可观测的。它可以通过工程手段(如PPO-ptx)缓解,但RM过优化是代理目标的结构性风险,不能通过调参彻底消除。
PPO-RLHF、DPO和GRPO三者如何选择?
选择取决于数据形态和任务性质:PPO-RLHF适用于通用偏好对齐的经典基线;DPO适用于已有高质量偏好对、离线对齐;GRPO适用于数学/代码等规则可判定的推理任务。不是越新越好。