通过轨迹收集和过程奖励合成学习基于规划的推理

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

研究人员发现大型语言模型(LLMs)在处理推理步骤时存在一致性问题。通过引入“规划标记”作为指南并微调模型参数,解决了这个问题,并在三个数学问题数据集上取得了显著的准确性提升。

🏷️

标签

➡️

继续阅读