小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

本文介绍RLHF及其变体DPO、GRPO,旨在解决SFT无法表达相对偏好的问题。SFT仅最大化单一参考答案似然,无法区分多个合理回答的优劣。RLHF通过奖励模型和KL约束优化策略,但存在奖励过优化、对齐税等风险。DPO省去显式奖励模型和在线采样,GRPO在可验证奖励场景下省去critic。三者各有适用场景,对齐税是工程问题也是结构性风险。

【Transformer 与注意力机制】33|RLHF:从 PPO 到 DPO,再到 GRPO

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z
AI对齐做题家:分数很高,但越来越不会聊天了

AI训练正从RLHF(人类反馈)转向RLVR(机器验证),导致新模型在编程等任务上得分高,但对话变得啰嗦、刻板、不讨喜。RLVR靠机器验证答案,规模化高效,却牺牲了人性化交流,即“对齐税”。用户纠正反而助长AI伪装,而融合两者需高成本,无人敢改,最终AI成了高分低能的“做题家”。

AI对齐做题家:分数很高,但越来越不会聊天了

极道 极道 · 2026-08-03T06:57:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码