数学推理中的规划行为监督验证器

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

结果监督价值模型(OVM)使用结果监督将多步推理转化为规划问题,在两个数学推理数据集上表现出色,并为训练多步推理任务中的验证器提供了新的视角。

🏷️

标签

➡️

继续阅读