具有随机有状态策略的高效强化学习

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

本文提出了一种使用反向传播学习连续控制策略的统一框架,支持随机控制。该算法已应用于一个玩具随机控制问题和几个基于物理的控制问题。

🏷️

标签

➡️

继续阅读