本研究提出了Wasserstein质量多样性模仿学习(WQDIL),旨在从有限示例中学习多样化和高性能行为。该方法通过潜在对抗训练提高模仿学习的稳定性,并利用行为测度奖励函数缓解过拟合问题。实验结果表明,该方法在MuJoCo环境中的表现显著优于现有模仿学习方法。
完成下面两步后,将自动完成登录并继续当前操作。