【强化学习与大模型后训练】09|RLHF 全链路:用 PPO 对齐语言模型

💡 原文中文,约12100字,阅读约需29分钟。
📝

内容提要

本文介绍经典PPO-RLHF训练流程:以SFT模型为初始策略,通过奖励模型打分、参考模型计算KL惩罚、价值模型估计优势,用PPO更新策略。强调KL约束防止奖励黑客,需动态调整系数,并指出该路线成本高,后被DPO、GRPO等方法部分替代。

🔎

延伸解读

四模型闭环的显存与计算代价

经典PPO-RLHF训练时,内存中通常有四个逻辑模型:策略、参考、奖励和价值。即使参考和奖励模型冻结,仍需前向推理计算KL和奖励,导致同一批响应至少需要四路计算。采样是自回归生成,无法像SFT那样并行teacher forcing,因此训练吞吐远低于同等token数的SFT。理解这一成本,有助于评估为何后续DPO、GRPO等方法试图简化或替代该路线。

KL惩罚的工程细节与陷阱

KL惩罚放在token级,使优势估计有逐步奖励,并能监控每个token的偏离。但实现中需注意:采样token上的log-ratio不是完整词表KL的精确值;response mask写错会把prompt token算入,污染KL;EOS后的padding参与计算会失真。此外,若奖励模型鼓励长回答,KL会随长度累积,β实际上参与长度控制,需在训练稳定性中专门处理。

奖励白化与自适应KL的必要性

奖励模型输出无天然单位,PPO对奖励尺度敏感,因此常见做法是batch内白化,使数值尺度可控。β控制策略偏离参考的程度,太小易奖励黑客,太大则更新无效,故采用自适应KL:根据实际KL与目标KL的偏差动态调整β。但β只是控制回路中的一个执行器,学习率、采样温度等也会影响KL,需综合监控reward、KL、entropy、length等指标。

PPO-RLHF的边界与替代路线

PPO-RLHF解决的是在KL约束下提高代理奖励,但不保证奖励模型正确、事实性提升或长推理能力出现。若任务有可验证答案,RLVR更贴近正确性;若资源有限,DPO等离线方法更省工程;若需大规模推理采样,GRPO去critic更有吸引力。理解经典链路是理解后续简化与替代的基线,但需根据任务和资源选择合适路线。

Q&A

PPO-RLHF 中四个模型分别是什么?各自的作用是什么?

PPO-RLHF 训练时通常有四个逻辑模型:Policy/Actor(策略模型,可训练,负责采样回答并接受 PPO 更新)、Reference(参考模型,冻结,提供参考 log-prob 以计算 KL 惩罚)、Reward Model(奖励模型,冻结,对 prompt-response 打分以近似人类偏好)、Value/Critic(价值模型,可训练,估计状态价值以计算优势、降低方差)。

为什么 RLHF 的目标不是简单地最大化奖励模型分数?

因为奖励模型是在偏好数据上学到的代理目标,不是真实人类偏好的完美函数。如果策略无限探索,会找到奖励模型的漏洞,如格式套话、冗长解释、过度自信等,导致 reward hacking。因此 InstructGPT 的 RLHF 目标会加入 KL 约束,防止策略偏离 SFT 模型太远。

PPO-RLHF 中 KL 惩罚为什么放在 token 级?有什么好处和潜在问题?

KL 惩罚放在 token 级是因为序列概率可分解为 token 条件概率连乘,因此 KL 可逐 token 累积。好处:优势估计有逐步 reward,critic 不必只在最后 token 看到信号;长回答的偏离被逐 token 累积,更公平;可监控每个 token 的 KL 便于稳定性诊断。潜在问题:采样 token 上的 log-ratio 不是完整词表 KL 的精确值;若 mask 错误会污染 KL;若 padding 参与计算会失真;若 reward model 鼓励长回答,KL 会随长度累积,β 参与长度控制。

PPO-RLHF 中为什么需要奖励白化?

奖励模型输出的标量没有天然单位,不同 reward model 的尺度可能不同。PPO 对奖励尺度敏感,奖励变大优势变大,更新步子变大,若 β 不变,KL 约束相对强度会被削弱。奖励白化(如在一个 batch 内标准化)能让 PPO 的数值尺度可控,避免因奖励尺度差异导致训练不稳定。

自适应 KL 控制中,β 是如何动态调整的?

自适应 KL 控制通常设定一个 target KL,然后根据实际 KL 与目标的偏差动态调整 β。如果实际 KL 高于目标,就增大 β 以加强惩罚;如果低于目标,就减小 β。实现上常用比例控制器,如 β = β * (1 + clip(error, -0.2, 0.2) * n_steps / horizon),其中 error = kl / target_kl - 1.0。

什么是 alignment tax?在 PPO-RLHF 中它可能来自哪些方面?

alignment tax(对齐税)指模型为了更符合人类偏好或安全策略,可能在原始能力上付出的代价。在 PPO-RLHF 中可能来自:SFT 数据覆盖窄导致模板化;reward model 只反映标注偏好,可能牺牲简洁性;KL 约束限制策略探索更优行为;PPO 训练可能降低熵,减少多样性。

PPO-RLHF 相比 DPO 有哪些优缺点?

PPO-RLHF 优点:表达力强,只要 reward model 能给分,就能通过在线采样发现比离线数据更高 reward 的回答。缺点:复杂,需要训练 reward model、在线采样、维护 critic、调 KL、防 reward hacking、持续评测能力回归。DPO 从同一 KL 正则目标推导离线分类损失,省去 RM 和在线 rollout,工程成本低,但无法在线探索新回答。

PPO-RLHF 训练中需要监控哪些关键指标?

需要监控:reward mean/std(奖励尺度,均值升高但人工评测下降可能 reward hacking)、KL per token(策略偏离程度,突然升高说明更新过猛)、response length(长度行为,reward 上升伴随长度膨胀要检查长度偏置)、entropy(策略分布尖锐程度,快速下降可能模式坍缩)、clip fraction(PPO 裁剪比例,过高说明 rollout 太旧或学习率太大)、value loss(critic 拟合质量,持续爆炸污染优势估计)、advantage mean/std(更新信号尺度,未归一化或异常尖峰导致不稳定)。

🏷️

标签

➡️

继续阅读