小红花·文摘

本研究探讨了模型驱动强化学习中的困惑，即如何解决不良经验与理论性质之间的矛盾。通过构造反例，证明了“MuZero loss”在随机环境中的失败和确定性环境中的样本复杂度。