通过人类反馈实现多样性

💡 原文中文,约200字,阅读约需1分钟。
📝

内容提要

本文介绍了一种通过约束优化观点,在多样性和质量之间权衡的方法,成功地在一个本地导航任务中训练出的策略转移到了实际的四足机器人 Solo12 上,展示了多样的机敏行为和成功的障碍物穿越。

🏷️

标签

➡️

继续阅读