Curiosity-Driven Reinforcement Learning Based on Human Feedback

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出了一种好奇心驱动的强化学习框架(CD-RLHF),旨在解决人类反馈强化学习中输出多样性降低的问题。实验结果表明,CD-RLHF在多个任务上显著提升了输出多样性,同时与人类偏好的对齐效果相当。

🏷️

标签

➡️

继续阅读