自然策略梯度法结合基于 Hessian 辅助的动量方差减小的全局收敛性

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

加速自然策略梯度算法(ANPG)用于解决无限时间折扣奖励马尔可夫决策过程问题。ANPG在一般参数化情况下具有较低的样本复杂度和迭代复杂度,通过改进样本复杂度提高了效率。

🏷️

标签

➡️

继续阅读