该文介绍了应用Lagrange乘数法对带有不等式约束的C-MDP中的actor critic和natural actor critic算法进行非渐近分析的结果。证明了这些算法在非独立同分布环境中能够找到性能函数的一阶稳定点,其采样复杂度分别为ε^{-2.5}。实验结果表明这两个算法在大网格尺寸上表现良好,受限的自然actor critic稍微优于受限的actor critic,而对于小网格尺寸,后者稍微优于前者。
完成下面两步后,将自动完成登录并继续当前操作。