该研究探讨了利用历史数据评估新政策的方法,提出了一种自适应估计器选择方法,显著提高了评估准确性。研究中引入了新指标SharpeRatio@k,用于评估反事实政策的有效性,并应用于开源软件SCOPE-RL。此外,研究还解决了深度强化学习中的模型选择问题,提出了一种基于Q函数的度量方法,适用于连续动作空间和稀疏奖励的马尔可夫决策过程。
完成下面两步后,将自动完成登录并继续当前操作。