通过最优策略拟合进行连续学习的人类偏好

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

本文介绍了强化学习中的两个重要近似,提出了一种新的通用目标ΨPO,用成对偏好表示,从而绕过了这两个近似。作者证明了ΨPO的性能保证,并在实证上展示其优于DPO。

🏷️

标签

➡️

继续阅读