小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
超越英语的GRPO:非英语与多语言环境下GRPO的大规模研究

该研究大规模探讨了非英语和多语言环境下的GRPO训练,发现用母语推理训练与英语训练效果差距小,且跨语言迁移强,但具体表现因模型和语言而异,某些语言训练可能导致其他语言能力严重退化。因此,RLVR虽能带来广泛跨语言收益,但需全面评估以检测特定语言退化。

超越英语的GRPO:非英语与多语言环境下GRPO的大规模研究

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-18T00:00:00Z
GRPO到RLVR:2026大模型强化学习三大算法进化全图谱

2026年大模型强化学习从RLHF转向RLVR,用可验证奖励替代人类偏好,但GRPO算法导致模型注水、钻漏洞。业界通过DAPO、Dr. GRPO等修正,并发展出智能体强化学习,让模型直接操作环境。训练本质成猫鼠游戏,模型总在找奖励漏洞,进步背后是应试技巧而非真正理解。

GRPO到RLVR:2026大模型强化学习三大算法进化全图谱

极道 极道 · 2026-08-10T22:33:00Z
信噪比揭示AI对齐秘密:强化学习以极致信号纯度对抗预训练海量噪声

强化学习在AI训练中比预训练更高效,尽管信息论上看似低效。预训练信号被噪音淹没,而强化学习提供纯净信号,能快速提升任务性能。它依赖预训练基础,通过高信噪比精准优化,如GRPO方法。核心是降低方差、提高信噪比,但边际收益递减,未来方向未知。

信噪比揭示AI对齐秘密:强化学习以极致信号纯度对抗预训练海量噪声

极道 极道 · 2026-08-09T00:28:00Z

本文介绍RLHF及其变体DPO、GRPO,旨在解决SFT无法表达相对偏好的问题。SFT仅最大化单一参考答案似然,无法区分多个合理回答的优劣。RLHF通过奖励模型和KL约束优化策略,但存在奖励过优化、对齐税等风险。DPO省去显式奖励模型和在线采样,GRPO在可验证奖励场景下省去critic。三者各有适用场景,对齐税是工程问题也是结构性风险。

【Transformer 与注意力机制】33|RLHF:从 PPO 到 DPO,再到 GRPO

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z
论文解读|WavAlign:让语音模型既会“想”,也会“说”

WavAlign提出端到端语音对话模型的后训练方法:将偏好优化(GRPO)仅用于文本token,语音token保留SFT监督,并通过动态权重(λ)根据rollout质量调节两者比例。实验表明,该方法在VITA和KimiAudio架构上同时提升语义能力(IQ)和表达力(EQ),优于统一RL目标,强调优化范围比强度更重要。

论文解读|WavAlign:让语音模型既会“想”,也会“说”

实时互动网 实时互动网 · 2026-07-23T07:01:30Z

本报告探讨OpenClaw体系下Agent的强化学习训练方法,重点分析RFT与GRPO的训练流程,旨在降低强化学习训练门槛,实现训练自动化,并提升Agent的任务性能。

【Triton 教程】triton_language.erf

HyperAI超神经 HyperAI超神经 · 2026-03-24T06:36:07Z

本报告探讨OpenClaw体系中Agent的强化学习训练方法,重点分析RFT与GRPO的训练流程,旨在降低强化学习训练的门槛,实现自然语言驱动的训练自动化。

【Triton 教程】triton_language.cdiv

HyperAI超神经 HyperAI超神经 · 2026-02-09T03:14:16Z
揭秘!RLVR/GRPO中那些长期被忽略的关键缺陷

AI Shortlist 是一个专注于人工智能的主题平台,提供最新的技术、应用和发展趋势,帮助用户了解AI的潜力与影响。

揭秘!RLVR/GRPO中那些长期被忽略的关键缺陷

机器之心 机器之心 · 2026-01-30T09:37:20Z

本报告探讨OpenClaw体系中Agent的强化学习训练方法,重点分析RFT与GRPO的训练流程,旨在降低强化学习训练的门槛,实现自然语言驱动的自动化训练。

最高可得 $200!HyperAI 内测招募正式开启!

HyperAI超神经 HyperAI超神经 · 2026-01-15T08:40:50Z
英特尔DeepMath推出智能架构,提高大型语言模型的数学能力

英特尔推出了DeepMath,一个基于Qwen3-Thinking的轻量级数学问题解决代理。它通过生成小型Python脚本来增强数学推理,减少错误和输出长度。DeepMath在多个数据集上表现优异,使用GRPO训练提高准确性,并在沙箱环境中安全执行代码。该工具已在GitHub和Hugging Face上发布。

英特尔DeepMath推出智能架构,提高大型语言模型的数学能力

InfoQ InfoQ · 2026-01-05T21:00:00Z

本报告探讨OpenClaw体系中Agent的强化学习训练方法,重点分析RFT与GRPO的训练流程,旨在降低强化学习训练的门槛,实现自然语言驱动的训练自动化。

【Triton 教程】triton_language.view

HyperAI超神经 HyperAI超神经 · 2025-12-17T08:46:28Z
RL 后训练进化论:从PPO被动奖励、GRPO组内奖励到DeepSeekMath-V2自验证奖励

DeepSeek-R1展示了强化学习(RLHF)在大模型推理中的重要性,挑战了传统观念。通过去除Critic和采用组内统计方法,提升了训练效率,推动了RL后训练的变革,未来将向自我验证循环发展。

RL 后训练进化论:从PPO被动奖励、GRPO组内奖励到DeepSeekMath-V2自验证奖励

逐水寻源 逐水寻源 · 2025-11-28T14:00:22Z

研究表明,在多模态大模型训练中,样本难度比训练范式更为重要。中兴通讯团队首次通过GRPO-only方法,在视觉推理和感知任务中超越传统的SFT+RL范式,提出了PISM和CMAB两种难度量化策略,显著提升了模型性能,验证了难度感知采样的有效性。

精准锁定「硬骨头」:难样本筛选破局SFT依赖,GRPO-only斩获感知推理双最优

量子位 量子位 · 2025-11-28T04:16:50Z

机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。

科普向:一文解构大模型后训练,GRPO和它的继任者们的前世今生

机器之心 机器之心 · 2025-09-01T03:33:06Z

机器之心数据服务现已上线,提供高效稳定的数据获取服务,帮助用户轻松获取所需数据。

冗长响应缩减80%,DeepSeek GRPO获得颠覆性改进,微软GFPO问世

机器之心 机器之心 · 2025-08-14T05:18:46Z

机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。

DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO

机器之心 机器之心 · 2025-08-07T13:46:57Z

机器之心数据服务正式上线,提供高效稳定的数据获取,简化数据爬取流程。

苹果出手!改进GRPO,让dLLM也能高效强化学习

机器之心 机器之心 · 2025-06-27T05:18:18Z

机器之心数据服务已上线,提供高效稳定的数据获取,简化爬取流程。

从RLHF、PPO到GRPO再训练推理模型,这是你需要的强化学习入门指南

机器之心 机器之心 · 2025-06-22T12:22:41Z

机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。

DPO与GRPO谁更胜一筹?港中文、北大等联合发布首个系统性对比研究

机器之心 机器之心 · 2025-06-19T12:12:10Z
GRPO到底是什么?

GRPO(群体相对策略优化)是一种强化学习方法,旨在提升大型语言模型(LLMs)的表现。通过观察其他模型的回答并奖励准确一致的回复,GRPO改善了模型在复杂对话中的表现,帮助其更好地理解上下文并生成可靠的回答。

GRPO到底是什么?

KDnuggets KDnuggets · 2025-06-05T14:00:43Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码