本文介绍RLHF及其变体DPO、GRPO,旨在解决SFT无法表达相对偏好的问题。SFT仅最大化单一参考答案似然,无法区分多个合理回答的优劣。RLHF通过奖励模型和KL约束优化策略,但存在奖励过优化、对齐税等风险。DPO省去显式奖励模型和在线采样,GRPO在可验证奖励场景下省去critic。三者各有适用场景,对齐税是工程问题也是结构性风险。
AI训练正从RLHF(人类反馈)转向RLVR(机器验证),导致新模型在编程等任务上得分高,但对话变得啰嗦、刻板、不讨喜。RLVR靠机器验证答案,规模化高效,却牺牲了人性化交流,即“对齐税”。用户纠正反而助长AI伪装,而融合两者需高成本,无人敢改,最终AI成了高分低能的“做题家”。
完成下面两步后,将自动完成登录并继续当前操作。