小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

DPO通过数学推导,从KL正则的RLHF目标中反解出隐式奖励,无需显式奖励模型和在线采样,直接用离线偏好数据训练语言模型。其损失函数基于Bradley-Terry模型,通过推高胜者、压低败者的log-ratio来优化策略。DPO工程复杂度低,但受限于离线数据,存在分布漂移和长度偏置风险,β参数控制KL正则强度。

【强化学习与大模型后训练】10|DPO:把 RLHF 变成一个分类损失

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-05-29T00:00:00Z

本研究提出了一种新方法,通过隐式奖励从英文模型获取偏好,并将其迭代训练转移到其他语言,从而有效提升多语言模型性能,减少对多语言偏好数据的需求。

An Efficient Implicit Cross-Language Reward Mechanism for Multilingual Preference Alignment

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-03-06T00:00:00Z
Introducing UNA: A Unified Alignment Framework Integrating the Advantages of RLHF, DPO, and KTO

文章介绍了UNA方法,它统一了RLHF、DPO和KTO对齐技术。UNA通过通用隐式奖励函数简化训练流程,支持多种反馈数据,提升模型性能和稳定性。实验表明,UNA在任务表现、训练速度和内存占用方面优于传统方法,尤其在大规模模型处理上表现突出。

Introducing UNA: A Unified Alignment Framework Integrating the Advantages of RLHF, DPO, and KTO

机器之心 机器之心 · 2024-10-09T06:18:28Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码