小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

本研究提出了一种组方差策略优化(GVPO)方法,以解决后训练中的不稳定性问题,确保奖励最大化与最优策略的一致性,从而提供可靠且灵活的后训练范式。

GVPO: Group Variance Policy Optimization for Post-Training of Large Language Models

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-04-28T00:00:00Z

本研究提出了一种新框架,结合奖励最大化与模仿学习,解决跨动态强化学习中的专家状态不可访问问题。通过F距离正则化政策优化,显著提升了算法性能,具有广泛应用潜力。

Policy Regularization on Globally Accessible States in Cross-Dynamics Reinforcement Learning

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-03-10T00:00:00Z

本研究探讨了在不可逆错误情况下,强化学习算法的奖励最大化问题。提出了一种新方法,证明在特定情境中,避免灾难的算法能够保障安全并确保高回报。这为马尔可夫决策过程提供了无悔保证,表明智能体在高风险环境中可实现自给自足。

Seeking Help to Achieve Safety Guarantees Without Sacrificing Effectiveness

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-02-19T00:00:00Z

本研究提出了一种新方法——受限信任区域策略优化(C-TRPO),旨在解决强化学习中的不安全行为问题。C-TRPO通过调整策略空间的几何结构,确保训练过程中的约束得到满足。实验结果表明,该方法在减少约束违规的同时,能够有效最大化奖励。

将安全性嵌入强化学习:信任区域方法的新视角

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-11-05T00:00:00Z

研究探讨了奖励最大化与分布匹配的关系,提出了DPO和DRO算法,以解决语言模型对齐中的可控性和样本效率问题。XPO算法通过引入探索奖励,进一步提升了模型的样本效率。逆Q*框架优化了强化学习,减少了对人工注释的依赖,展现出优于传统方法的潜力。

无需人工反馈的强化学习在大型语言模型最后一公里微调中的应用

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-08-29T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码