有效模仿在误设定下的学习

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

本研究提出了“与奖励无关的策略完整性”概念,以解决交互式模仿学习中无法完全模仿专家的问题,避免离线方法中的错误,并通过额外的离线数据提升样本效率。

🏷️

标签

➡️

继续阅读