内容提要
针对扩散语言模型强化学习中去噪步骤同等对待和似然估计偏差问题,提出DACA-GRPO方法,引入去噪进度分数和分层掩码似然两种机制,在三种GRPO基础上于数学推理、代码生成等七项基准测试中取得提升,最高分别提升5.6、7.4、36.3和5.9个百分点。
延伸解读
扩散语言模型强化学习的两个关键弱点
文章指出,现有扩散语言模型的强化学习方法存在两个根本性缺陷:一是去噪轨迹中缺乏时间信用分配,所有去噪步骤被同等对待;二是用于策略优化的平均场似然估计存在系统性偏差且方差高。这两个问题限制了强化学习在扩散语言模型上的效果,DACA-GRPO正是针对这两点提出改进。
DACA-GRPO的两项互补机制
DACA-GRPO引入去噪进度分数和分层掩码似然两种机制。去噪进度分数从中间预测中提取每个token的重要性权重,且不增加额外前向计算成本;分层掩码似然将token位置分区,使每个token在预测时能利用大部分序列作为上下文,从而减少平均场偏差。这两种机制互补,共同提升策略优化的质量。
即插即用与跨基准一致提升
DACA-GRPO是一种轻量级、即插即用的增强方法,可应用于任何GRPO风格的训练器。在三种GRPO基础方法上应用后,于数学推理、代码生成、约束满足和受限生成等七项基准测试中均取得一致提升,最高分别提升5.6、7.4、36.3和5.9个百分点,显示出其通用性和有效性。
Q&A
DACA-GRPO是什么?它主要解决什么问题?
DACA-GRPO是一种针对扩散语言模型强化学习的去噪感知信用分配方法,旨在解决现有方法中将所有去噪步骤同等对待以及似然估计存在偏差和高方差的问题。
DACA-GRPO包含哪些核心机制?它们分别有什么作用?
DACA-GRPO包含两个互补机制:去噪进度分数(Denoising Progress Scores)从中间预测中提取每个token的重要性权重,且不增加额外前向计算成本;分层掩码似然(Stratified Masking Likelihood)将token位置分层,使每个token在预测时能利用大部分序列作为上下文,从而减少平均场偏差。
DACA-GRPO在哪些任务上进行了评估?效果如何?
DACA-GRPO在七个基准测试上进行了评估,涵盖数学推理、代码生成、约束满足和受限生成等任务。在三种GRPO基础方法上应用后,均取得一致提升,最高提升幅度为:数学推理5.6个百分点,代码生成7.4个百分点,约束满足36.3个百分点,JSON模式遵循5.9个百分点。
DACA-GRPO可以应用于哪些现有的强化学习训练器?
DACA-GRPO是一种轻量级、即插即用的增强方法,可以应用于任何GRPO风格的训练器。
扩散语言模型强化学习存在哪些根本弱点?
扩散语言模型强化学习存在两个根本弱点:一是去噪轨迹中缺乏时间信用分配,二是用于策略优化的平均场似然估计存在系统性偏差。
DACA-GRPO中的去噪进度分数是如何计算的?
去噪进度分数从中间预测中提取每个token的重要性权重,且不产生额外的前向计算成本。