离线强化学习多任务数据共享的悲观值迭代

💡 原文中文,约500字,阅读约需2分钟。
📝

内容提要

这篇文章介绍了一种基于不确定性的多任务数据共享(MTDS)方法,用于改进离线强化学习(RL)。该方法通过共享整个数据集,使用基于集合的不确定性量化进行悲观值迭代,提供了统一框架。实验证明,该方法在具有挑战性的MTDS问题中优于先前的方法。

🏷️

标签

➡️

继续阅读