基于加权双重机制的强化学习方法研究

来源 :苏州大学 | 被引量 : 1次 | 上传用户:yintao001
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
在强化学习中,智能体与环境交互并从环境给出的评价式反馈中进行学习。该学习过程十分类似于人类自身在学习新事物时的学习方式,因此强化学习也被认为是迈向通用人工智能的重要途径之一。本文提出了一种应用于强化学习的加权双重机制,分别在表格式强化学习和深度强化学习中进行研究和分析。主要研究内容可以概括为以下三部分:(1)经典的表格式Q学习算法在利用最大估计器评估最大期望值时,将不可避免地产生正偏差,且该偏差会随着迭代过程逐渐累积,最终导致策略质量的下降。而双Q学习算法利用双估计器,虽然有效地抑制了正偏差,但也带来了负偏差的影响。理论上,最大期望值的无偏估计一定介于Q学习与双Q学习的评估值之间。因此利用加权双重机制,设计了一种加权双估计器来评估最大期望值。通过在多臂赌博机上进行实验,本文分析了一些重要因素对权重的影响,从而确定了一种启发式的权重计算方式。由加权双估计器衍生而来的加权双Q学习算法不仅可以更为精准地评估值函数,同时还提升了策略的质量。(2)在深度强化学习中,经验重放机制不仅打破了数据样本之间的相关性,使得数据样本满足了独立同分布的假设,同时还增强了算法的稳定性。但当经验池已满后,先进先出的保留策略会用最新的样本替代最旧的样本。一旦这些被替代的样本无法恢复,那么随着时间的推移,神经网络便会逐渐遗忘这些样本中的知识。针对该问题,利用加权双重机制,设计了一种双经验池框架。该框架中,两个经验池将分别维持不同的状态分布,同时自适应的采样比例也进一步地提高了数据样本的使用效率。在离散和连续动作问题中,利用该框架所产生的策略有效地缓解了遗忘问题,并提升了策略的泛化能力。(3)值迭代网络通过循环卷积神经网络近似模拟了值迭代过程,从而使其产生的策略具备了一定的泛化能力。但值迭代网络等价地对整个状态空间中的每个状态进行更新,会使其陷入到重复而又无意义的更新中,导致更新效率降低。针对此问题,利用加权双重机制的思想,在规划模块中将值迭代和异步更新两种更新方式进行结合,提出异步值迭代网络。在更大,更加复杂的导航问题中,该网络有效地减少了状态的更新次数,同时其产生的策略表现出了更强的泛化能力。
其他文献
与集成电路芯片相比,集成光子芯片具有能耗低、速度快和带宽大等优点,在信息等领域得到了极大的关注。在集成光子芯片中,集成光波导和光学微谐振腔是最主要的器件单元。集成
有关早商文化的研究一直是学术界关注的热点问题之一。豫北地区处于中原腹地,是夏族和商族重要活动区域之一,也是夏文化和商文化互相交流的重要地区之一。豫北地区一般而言是
随着社会经济和科学技术的发展,人们对空间地理信息的要求越来越高,而空间地理信息的质量与空间地理信息数据的准确性又是息息相关的,空间地理信息数据的获取则来源于测绘仪
随着我国经济高速发展,工业水平不断提高,环境污染问题也日益严重,特别是水体环境的污染已经开始严重影响动植物和人类的健康。随着环保意识的提高和相关法律法规的颁布,我国
重大科研项目主要是进行重大、基础性研究工作,解决构成国民经济和社会发展进程中的障碍的问题,由于基础性问题的公共属性,重大科研项目主要由国家出资资助,体现了国家战略意
随着大数据时代的到来,各大互联网公司对数据越来越重视,各大国内外的电商网站的实际需求是推进推荐算法研究的动力。国内外的电商网站和社交网络,最常见的推荐算法是根据用
螺旋桨的噪声越来越受到人们的关注,因此有必要对螺旋桨的噪声进行计算。对于螺旋桨噪声的计算,多数采用Lighthill的声学类比法。本文利用基于Lighthill的声学类比法的Kirchh
心脑血管疾病是一种严重威胁人类健康的常见病,心脑血管疾病已成为人类死亡的头号杀手。现代药理研究及临床应用证实,抱茎苦荬菜提取物可以广泛用于心脑血管疾病的治疗,且疗
真菌毒素(Mycotoxins)是指产毒的真菌污染农作物后,在适宜的温度、湿度环境下生长繁殖产生的一类有毒的次级代谢产物,对人和动物有极大的危害。其中,黄曲霉毒素(Aflatoxins,A
铁在微生物的各关键代谢中起重要辅因子的作用。铁吸收调节因子Fur是革兰氏阴性菌中铁代谢的核心调控元件,在含铁蛋白的活性调控及微生物–宿主互作过程中发挥重要作用。施氏