论文部分内容阅读
在强化学习中,智能体与环境交互并从环境给出的评价式反馈中进行学习。该学习过程十分类似于人类自身在学习新事物时的学习方式,因此强化学习也被认为是迈向通用人工智能的重要途径之一。本文提出了一种应用于强化学习的加权双重机制,分别在表格式强化学习和深度强化学习中进行研究和分析。主要研究内容可以概括为以下三部分:(1)经典的表格式Q学习算法在利用最大估计器评估最大期望值时,将不可避免地产生正偏差,且该偏差会随着迭代过程逐渐累积,最终导致策略质量的下降。而双Q学习算法利用双估计器,虽然有效地抑制了正偏差,但也带来了负偏差的影响。理论上,最大期望值的无偏估计一定介于Q学习与双Q学习的评估值之间。因此利用加权双重机制,设计了一种加权双估计器来评估最大期望值。通过在多臂赌博机上进行实验,本文分析了一些重要因素对权重的影响,从而确定了一种启发式的权重计算方式。由加权双估计器衍生而来的加权双Q学习算法不仅可以更为精准地评估值函数,同时还提升了策略的质量。(2)在深度强化学习中,经验重放机制不仅打破了数据样本之间的相关性,使得数据样本满足了独立同分布的假设,同时还增强了算法的稳定性。但当经验池已满后,先进先出的保留策略会用最新的样本替代最旧的样本。一旦这些被替代的样本无法恢复,那么随着时间的推移,神经网络便会逐渐遗忘这些样本中的知识。针对该问题,利用加权双重机制,设计了一种双经验池框架。该框架中,两个经验池将分别维持不同的状态分布,同时自适应的采样比例也进一步地提高了数据样本的使用效率。在离散和连续动作问题中,利用该框架所产生的策略有效地缓解了遗忘问题,并提升了策略的泛化能力。(3)值迭代网络通过循环卷积神经网络近似模拟了值迭代过程,从而使其产生的策略具备了一定的泛化能力。但值迭代网络等价地对整个状态空间中的每个状态进行更新,会使其陷入到重复而又无意义的更新中,导致更新效率降低。针对此问题,利用加权双重机制的思想,在规划模块中将值迭代和异步更新两种更新方式进行结合,提出异步值迭代网络。在更大,更加复杂的导航问题中,该网络有效地减少了状态的更新次数,同时其产生的策略表现出了更强的泛化能力。