Double Continuous Over-Relaxation Q-Learning and Its Extension to Deep Reinforcement Learning

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出了一种新的Q学习算法,解决了在接近一的折扣因子下收敛缓慢的问题。该算法在深度强化学习中表现出更低的偏差,并在大规模问题上显示出有效性。

🏷️

标签

➡️

继续阅读