本文介绍了Goldilocks强化学习方法,该方法通过教师模型预测问题难度,从而选择适合学生模型的题目,提升稀疏奖励下的学习效率。在OpenMathReasoning数据集上,该方法的表现优于传统的GRPO,能够适应学生能力的变化,优化学习过程。
完成下面两步后,将自动完成登录并继续当前操作。