本文探讨了强化学习中的新模型和算法,重点是上下文决策过程与扩散模型的结合。提出了一种基于期望扩展统计距离的回报估计方法,并介绍了最大熵反向强化学习以提高生成模型的样本质量。实验验证了新方法的有效性,并展望了扩散模型在强化学习中的应用前景。
完成下面两步后,将自动完成登录并继续当前操作。