风险敏感马尔可夫决策过程与普遍效用函数下的学习

💡 原文中文,约200字,阅读约需1分钟。
📝

内容提要

本文提出了一种利用泛化的效用函数来解决风险敏感的强化学习问题的方法,并设计了可实现的近似算法来求解该问题。

➡️

继续阅读