强化学习与入场控制的懊悔界限
📝
内容提要
任何强化学习算法的期望遗憾在无折扣回报情况下下界为 $\Omega\left (\sqrt {DXAT}\right)$,其中 $D$ 表示马尔科夫决策过程的直径,$X$ 表示状态空间的大小,$A$ 表示动作空间的大小,$T$ 表示时间步数。然而,这个下界是一般性的,考虑到问题结构的一些具体知识可以获得更小的遗憾。在本文中,我们考虑了一个具有 $m$ 个作业类和类依赖奖励和持有成本的...