小红花·文摘

本研究探讨了过程奖励模型（PRMs）在应对分布外挑战时的问题，提出了一种增强检索过程奖励模型（RetrievalPRM），通过两阶段检索机制提高了模型的通用性和推理一致性，实验结果表明其在多个真实数据集上表现优异。