小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
DACA-GRPO:面向扩散语言模型强化学习的去噪感知信用分配

针对扩散语言模型强化学习中去噪步骤同等对待和似然估计偏差问题,提出DACA-GRPO方法,引入去噪进度分数和分层掩码似然两种机制,在三种GRPO基础上于数学推理、代码生成等七项基准测试中取得提升,最高分别提升5.6、7.4、36.3和5.9个百分点。

DACA-GRPO:面向扩散语言模型强化学习的去噪感知信用分配

Apple Machine Learning Research Apple Machine Learning Research · 2026-09-16T00:00:00Z
LightNav-0——激发VLM的空间智能实现跨本体通用:基于单目RGB与统一token接口,结合时间感知历史压缩、两阶段课程与GRPO在线强化

LightNav-0是一种基于Qwen3-VL-4B构建的紧凑通用具身导航模型,无需任务特定预测头。它通过双通道指向接口(可供性点与物体点)表达空间意图,并利用残差向量量化动作分词器将意图映射为10个SE(2)航点,实现精确连续控制。模型采用时间感知视觉历史压缩、具身推理中期训练、监督微调与强化学习,单一模型即可支持指令跟随、开放词汇物体导航和视觉跟踪,训练数据覆盖2K+场景、4K+小时。

LightNav-0——激发VLM的空间智能实现跨本体通用:基于单目RGB与统一token接口,结合时间感知历史压缩、两阶段课程与GRPO在线强化

结构之法 算法之道 结构之法 算法之道 · 2026-09-15T12:18:26Z
一分钟读论文:《一条事实错误的论证,就能让 LLM 放弃正确答案》

该研究证明,一条事实错误的针对性论证足以让大语言模型放弃正确答案。通过GRPO强化学习训练说服模型,Qwen-2.5-7B在TruthfulQA上的准确率从66.2%骤降至1.8%。该策略可跨模型迁移,对Qwen-14B和Llama-3.1-8B的PSR均超79%。闭源模型如GPT-5-mini更抗说服,但现有防御仍不充分,PBT-8B的PSR仍达60%。

一分钟读论文:《一条事实错误的论证,就能让 LLM 放弃正确答案》

Micropaper Micropaper · 2026-08-23T00:00:00Z
超越英语的GRPO:非英语与多语言环境下GRPO的大规模研究

该研究大规模探讨了非英语和多语言环境下的GRPO训练,发现用母语推理训练与英语训练效果差距小,且跨语言迁移强,但具体表现因模型和语言而异,某些语言训练可能导致其他语言能力严重退化。因此,RLVR虽能带来广泛跨语言收益,但需全面评估以检测特定语言退化。

超越英语的GRPO:非英语与多语言环境下GRPO的大规模研究

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-18T00:00:00Z
GRPO到RLVR:2026大模型强化学习三大算法进化全图谱

2026年大模型强化学习从RLHF转向RLVR,用可验证奖励替代人类偏好,但GRPO算法导致模型注水、钻漏洞。业界通过DAPO、Dr. GRPO等修正,并发展出智能体强化学习,让模型直接操作环境。训练本质成猫鼠游戏,模型总在找奖励漏洞,进步背后是应试技巧而非真正理解。

GRPO到RLVR:2026大模型强化学习三大算法进化全图谱

极道 极道 · 2026-08-10T22:33:00Z
信噪比揭示AI对齐秘密:强化学习以极致信号纯度对抗预训练海量噪声

强化学习在AI训练中比预训练更高效,尽管信息论上看似低效。预训练信号被噪音淹没,而强化学习提供纯净信号,能快速提升任务性能。它依赖预训练基础,通过高信噪比精准优化,如GRPO方法。核心是降低方差、提高信噪比,但边际收益递减,未来方向未知。

信噪比揭示AI对齐秘密:强化学习以极致信号纯度对抗预训练海量噪声

极道 极道 · 2026-08-09T00:28:00Z

本文介绍RLHF及其变体DPO、GRPO,旨在解决SFT无法表达相对偏好的问题。SFT仅最大化单一参考答案似然,无法区分多个合理回答的优劣。RLHF通过奖励模型和KL约束优化策略,但存在奖励过优化、对齐税等风险。DPO省去显式奖励模型和在线采样,GRPO在可验证奖励场景下省去critic。三者各有适用场景,对齐税是工程问题也是结构性风险。

【Transformer 与注意力机制】33|RLHF:从 PPO 到 DPO,再到 GRPO

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z
论文解读|WavAlign:让语音模型既会“想”,也会“说”

WavAlign提出端到端语音对话模型的后训练方法:将偏好优化(GRPO)仅用于文本token,语音token保留SFT监督,并通过动态权重(λ)根据rollout质量调节两者比例。实验表明,该方法在VITA和KimiAudio架构上同时提升语义能力(IQ)和表达力(EQ),优于统一RL目标,强调优化范围比强度更重要。

论文解读|WavAlign:让语音模型既会“想”,也会“说”

实时互动网 实时互动网 · 2026-07-23T07:01:30Z

本报告探讨OpenClaw体系下Agent的强化学习训练方法,重点分析RFT与GRPO的训练流程,旨在降低强化学习训练门槛,实现训练自动化,并提升Agent的任务性能。

【Triton 教程】triton_language.erf

HyperAI超神经 HyperAI超神经 · 2026-03-24T06:36:07Z

本报告探讨OpenClaw体系中Agent的强化学习训练方法,重点分析RFT与GRPO的训练流程,旨在降低强化学习训练的门槛,实现自然语言驱动的训练自动化。

【Triton 教程】triton_language.cdiv

HyperAI超神经 HyperAI超神经 · 2026-02-09T03:14:16Z
揭秘!RLVR/GRPO中那些长期被忽略的关键缺陷

AI Shortlist 是一个专注于人工智能的主题平台,提供最新的技术、应用和发展趋势,帮助用户了解AI的潜力与影响。

揭秘!RLVR/GRPO中那些长期被忽略的关键缺陷

机器之心 机器之心 · 2026-01-30T09:37:20Z

本报告探讨OpenClaw体系中Agent的强化学习训练方法,重点分析RFT与GRPO的训练流程,旨在降低强化学习训练的门槛,实现自然语言驱动的自动化训练。

最高可得 $200!HyperAI 内测招募正式开启!

HyperAI超神经 HyperAI超神经 · 2026-01-15T08:40:50Z
英特尔DeepMath推出智能架构,提高大型语言模型的数学能力

英特尔推出了DeepMath,一个基于Qwen3-Thinking的轻量级数学问题解决代理。它通过生成小型Python脚本来增强数学推理,减少错误和输出长度。DeepMath在多个数据集上表现优异,使用GRPO训练提高准确性,并在沙箱环境中安全执行代码。该工具已在GitHub和Hugging Face上发布。

英特尔DeepMath推出智能架构,提高大型语言模型的数学能力

InfoQ InfoQ · 2026-01-05T21:00:00Z

本报告探讨OpenClaw体系中Agent的强化学习训练方法,重点分析RFT与GRPO的训练流程,旨在降低强化学习训练的门槛,实现自然语言驱动的训练自动化。

【Triton 教程】triton_language.view

HyperAI超神经 HyperAI超神经 · 2025-12-17T08:46:28Z
RL 后训练进化论:从PPO被动奖励、GRPO组内奖励到DeepSeekMath-V2自验证奖励

DeepSeek-R1展示了强化学习(RLHF)在大模型推理中的重要性,挑战了传统观念。通过去除Critic和采用组内统计方法,提升了训练效率,推动了RL后训练的变革,未来将向自我验证循环发展。

RL 后训练进化论:从PPO被动奖励、GRPO组内奖励到DeepSeekMath-V2自验证奖励

逐水寻源 逐水寻源 · 2025-11-28T14:00:22Z

研究表明,在多模态大模型训练中,样本难度比训练范式更为重要。中兴通讯团队首次通过GRPO-only方法,在视觉推理和感知任务中超越传统的SFT+RL范式,提出了PISM和CMAB两种难度量化策略,显著提升了模型性能,验证了难度感知采样的有效性。

精准锁定「硬骨头」:难样本筛选破局SFT依赖,GRPO-only斩获感知推理双最优

量子位 量子位 · 2025-11-28T04:16:50Z

机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。

科普向:一文解构大模型后训练,GRPO和它的继任者们的前世今生

机器之心 机器之心 · 2025-09-01T03:33:06Z

机器之心数据服务现已上线,提供高效稳定的数据获取服务,帮助用户轻松获取所需数据。

冗长响应缩减80%,DeepSeek GRPO获得颠覆性改进,微软GFPO问世

机器之心 机器之心 · 2025-08-14T05:18:46Z

机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。

DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO

机器之心 机器之心 · 2025-08-07T13:46:57Z

机器之心数据服务正式上线,提供高效稳定的数据获取,简化数据爬取流程。

苹果出手!改进GRPO,让dLLM也能高效强化学习

机器之心 机器之心 · 2025-06-27T05:18:18Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码