针对扩散语言模型强化学习中去噪步骤同等对待和似然估计偏差问题,提出DACA-GRPO方法,引入去噪进度分数和分层掩码似然两种机制,在三种GRPO基础上于数学推理、代码生成等七项基准测试中取得提升,最高分别提升5.6、7.4、36.3和5.9个百分点。
完成下面两步后,将自动完成登录并继续当前操作。