本文研究了带有滞后奖励的对抗马尔可夫决策过程中的近端政策优化(PPO)算法,提出了Delay-Adapted PO算法及其优化机制,取得了显著成果,推动了强化学习领域的发展。
完成下面两步后,将自动完成登录并继续当前操作。