Policy Gradient for Robust Markov Decision Processes

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出了一种通用的策略梯度方法DRPMD,旨在解决强健马尔可夫决策过程中的模型不确定性问题,确保全局最优性,并在复杂场景中验证其强健性和全局收敛性。

🏷️

标签

➡️

继续阅读