有界理性曲线下的鲁棒对抗强化学习

💡 原文中文,约200字,阅读约需1分钟。
📝

内容提要

本文提出了对抗性强化学习方法,通过二人零和博弈自动确定环境参数范围,训练的优化代理更具鲁棒性。在网格世界和三个 MuJoCo 控制环境中验证。

🏷️

标签

➡️

继续阅读