小红花·文摘 - 小红花技术领袖俱乐部

本文提出了一种推理一致性评估指标，分析大型语言模型在高中数学新问题上的推理能力。研究发现，推理步骤增多时，模型的准确率显著下降，主要问题在于推导结论的能力，而理解输入前提的能力相对稳定。

Deductive Consistency: A Framework for Evaluating Reasoning in Large Language Models

BriefGPT - AI 论文速递 ·

本研究探讨了过程奖励模型（PRMs）在应对分布外挑战时的问题，提出了一种增强检索过程奖励模型（RetrievalPRM），通过两阶段检索机制提高了模型的通用性和推理一致性，实验结果表明其在多个真实数据集上表现优异。

Enhanced Retrieval Process Reward Model for Generalizable Mathematical Reasoning

BriefGPT - AI 论文速递 ·