聚类线性情境强化学习与背匠

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

本文提出了一种集群上下文强化学习算法,具有亚线性遗憾和不需要访问所有臂的特点。通过结合计量经济学和约束条件强化学习,实现了最大化总回报的目标。

🏷️

标签

➡️

继续阅读