本文提出了一种名为Ctrl-R的框架,通过可控轨迹学习结构化推理,旨在系统性地发现和强化多样化的推理模式。实验表明,Ctrl-R能有效探索并内化以往难以获得的推理模式,提升语言和视觉-语言模型在数学推理任务上的表现。
完成下面两步后,将自动完成登录并继续当前操作。