小红花·文摘

本研究使用卷积神经网络作为函数逼近器，研究了神经策略镜像下降算法的样本复杂性。通过观察高维度环境具有低维结构的经验现象，我们证明在每次迭代中，值函数和策略都可以很好地近似于卷积神经网络。因此，通过适当选择网络大小和超参数，NPMD 可以通过大约 O (ε^(-d/α-2)) 个样本找到一个 ε- 最优策略，从而解释深度策略算法的有效性。