Enhanced Coarse-to-Fine Process Reward Modeling for Mathematical Reasoning

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本文提出了一种粗到精的框架,旨在解决数学推理任务中过程奖励模型的不足,通过合并相邻步骤进行粗略推理,并逐步细化以提升推理性能。

🏷️

标签

➡️

继续阅读