通过策略卷积进行大动作空间的离策度量

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

该研究提出了基于动作嵌入的边际化逆向倾向评分来减少离策略评估中估计器的方差,并提出了双重稳健估计器来提高准确性。经验实验证实了该方法的卓越性。

🏷️

标签

➡️

继续阅读