双重力量:在模仿约束下增强离线多样性最大化

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

本研究提出了一种新颖的离线算法,利用范德瓦尔斯力和功能奖励编码,显著提高机器人任务中的学习效率和稳定性,同时增强了多样性和处理非平稳奖励的能力。

🏷️

标签

➡️

继续阅读