Efficient Training of Process Reward Models through Active Learning

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出了一种主动学习方法ActPRM,旨在解决大规模语言模型训练中过程奖励模型标注数据获取困难的问题。ActPRM能够有效选择不确定样本,减少50%的标注成本,同时提升模型性能,取得了新的效果。

🏷️

标签

➡️

继续阅读