内容提要
本文综述深度强化学习中的探索策略,涵盖ε-贪婪、UCB、汤普森采样等经典方法,以及熵正则、噪声注入等深度RL技巧,重点讨论稀疏奖励下的硬探索与噪声电视问题,并系统梳理基于内在奖励的探索方法,包括计数、预测、记忆和直接探索等类别。
延伸解读
经典探索策略的适用场景
文章回顾了ε-贪婪、UCB、玻尔兹曼探索和汤普森采样等经典方法,这些方法在多臂老虎机或简单表格型RL中表现良好。但在深度RL中,由于状态空间连续高维,直接应用这些方法面临挑战。读者需注意,这些策略常作为基线,而深度RL中更常用熵正则和噪声注入等技巧来促进探索。
稀疏奖励与噪声电视:两大探索难题
硬探索问题指环境奖励极其稀疏甚至具有欺骗性,随机探索难以发现有效状态,Montezuma's Revenge是典型例子。噪声电视问题则指智能体被不可控的随机噪声吸引,获得新颖性奖励却无法取得实际进展。这两个问题揭示了单纯依赖新颖性奖励的局限性,需要更复杂的探索机制。
内在奖励:基于计数的探索方法
基于计数的探索通过统计状态访问次数来分配奖励,鼓励访问稀有状态。由于连续状态空间难以直接计数,文章介绍了密度模型伪计数和哈希计数两种思路。伪计数通过密度模型估计状态出现概率,哈希计数则利用局部敏感哈希将状态映射为离散码。这些方法为稀疏奖励环境提供了可行的探索信号。
基于预测的探索与直接探索方法
基于预测的探索利用前向动力学模型的预测误差作为内在奖励,误差越大表示越不熟悉。ICM通过逆动力学学习状态编码,排除不可控因素。直接探索方法如Go-Explore则通过记忆有希望的状态并返回继续探索,在硬探索问题上表现突出,但依赖确定性模拟器。这些方法各有优劣,需根据任务特点选择。
Q&A
深度强化学习中,为什么探索比利用更难?
在强化学习中,智能体需要尽快找到最优解,但过早地确定解决方案而缺乏足够探索可能导致局部最优或完全失败。现代RL算法能高效地优化利用,而探索仍是一个开放问题。
深度强化学习中有哪些经典的探索策略?
经典探索策略包括:ε-贪婪(以概率ε随机探索,否则选最优动作)、UCB(选择最大化置信上界的动作)、玻尔兹曼探索(根据Q值的softmax分布采样动作,由温度参数调节)、汤普森采样(维护最优动作概率的信念并从中采样)。
什么是深度强化学习中的硬探索问题?
硬探索问题指在奖励非常稀疏甚至具有欺骗性的环境中进行探索。随机探索很难发现成功状态或获得有意义的反馈。例如Atari游戏《蒙特祖玛的复仇》就是硬探索问题的典型例子。
噪声电视问题是什么?如何解决?
噪声电视问题指当智能体因寻求新奇体验而获得奖励时,一个无法控制且不可预测的随机噪声电视会永久吸引智能体的注意力,使其无法取得有意义的进展。解决方法包括基于预测的探索奖励(如RND)和情节好奇心(EC)模块,这些方法能克服噪声电视问题。
基于内在奖励的探索方法有哪些主要类别?
基于内在奖励的探索方法主要分为两类:一是发现新颖状态(如基于计数的探索、基于哈希的计数);二是提高智能体对环境的知识(如基于预测的探索,包括前向动力学、随机网络蒸馏等)。此外还有基于记忆的探索和直接探索(如Go-Explore)。
基于计数的探索方法如何解决高维状态空间的计数问题?
基于计数的探索方法通过密度模型(如CTS、PixelCNN、变分高斯混合模型)估计状态的伪计数,或通过哈希函数(如SimHash)将高维状态映射为离散哈希码,从而跟踪状态出现次数并分配探索奖励。
什么是随机网络蒸馏(RND)?它如何提供探索奖励?
随机网络蒸馏(RND)引入一个与主任务无关的预测任务:用一个固定随机初始化的神经网络提取观测特征,另一个网络预测这些特征。探索奖励定义为预测误差,即两个网络输出之间的均方误差。误差越大表示状态越新颖,从而鼓励探索。
Go-Explore算法如何解决硬探索问题?
Go-Explore分为两个阶段:第一阶段“探索直到解决”维护有趣状态及其轨迹的记忆,通过回到有希望的状态并继续随机探索来找到解决方案;第二阶段“鲁棒化”通过模仿学习(如Backward算法)使解决方案对随机性鲁棒。它依赖可重置的确定性模拟器,后续的基于策略的Go-Explore改进了这一点。