小红花·文摘

我们提出了一种学习模仿专家行为并进行迁移学习的算法，通过使用AnnealedVAE学习解缠状态表示，并学习单一的Q函数来模仿专家，克服了奖励函数设计、不同领域部署学习策略和在现实世界中学习的困难。在3个环境中展示了算法的有效性。