【Transformer 与注意力机制】33|RLHF:从 PPO 到 DPO,再到 GRPO

💡 原文中文,约13300字,阅读约需32分钟。
📝

内容提要

SFT 的似然目标画不出相对偏好,只能到一个由数据规模决定的天花板。RLHF 用奖励模型把偏好压成标量再接 PPO,代价是 KL 约束、采样成本和可实测的奖励黑客曲线;DPO 从同一个 KL 目标解出隐式奖励绕开在线采样,GRPO 在可验证奖励场景把 critic 也省掉。工程细节外链 rl-posttraining 系列。

🏷️

标签

➡️

继续阅读