Near-optimal Sample Complexity of Offline KL-Regularized Contextual Bandits under Single-Policy Concentration

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究解决了KL正则化上下文强盗的样本复杂度问题,提出的算法实现了$ ilde{O}( rac{1}{ ext{ε}})$的样本复杂度,展示了算法的近似最优性,并扩展到上下文对抗强盗问题。

🏷️

标签

➡️

继续阅读