基于协同强化学习的群体决策方法研究

来源 :大连理工大学 | 被引量 : 0次 | 上传用户:willzhang86
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
现如今,多智能体系统已经成为人工智能中的一个研究热点。单个智能体的计算及决策能力有限,导致其不能处理复杂的任务,因此越来越多的学者开始研究能够应用于多智能体系统的技术。随着深度强化学习在单智能体系统中取得成功的应用,越来越多的工作开始将单智能体强化学习的思想扩展并应用到多智能体系统中。在单智能体强化学习中,智能体所在的环境相比多智能体所在的环境是稳定的。在多智能体强化学习中,环境是更加复杂的,因此会给学习过程带来很大的挑战,而且其中的智能体大多会涉及到合作的行为,这就需要多智能体强化学习引入某些协同机制来促进智能体之间的合作。为了解决上述问题,本文针对如何通过交流通讯机制促进智能体更好地合作进行了研究,主要工作如下:(1)在“静态”多智能体系统中,每个智能体的位置及观测到的其它智能体的信息量不是时变的。针对这类系统中具有现实意义的多路口信号灯控制问题,我们提出了一个带有多视角状态编码器的多智能体迁移强化学习算法,该算法是全分布式训练与执行的。它有两个重要的部分,第一个是包含注意力机制的多视角状态编码器,它将由不同的视角获取的状态信息进行编码,并在编码过程中有效地整合了其它智能体传来的信息,将编码结果作为智能体的实际输入,达到丰富智能体状态信息的目的。第二个是一种可迭代的迁移学习的范式,它从老师指导学生的范式出发,使得掌握不同知识的智能体协作指导一个学生智能体,并使学生智能体在掌握尽可能多的知识后进行进一步的自适应学习,达到提高其泛化能力的作用。在人工合成及真实世界仿真环境上进行的多组实验,验证了该算法能够促使智能体相互合作。(2)在“动态”多智能体系统中,每个智能体的位置和可视范围内的信息量都是时变的。因此,算法应当能够处理动态变化的信息量。针对此类环境中被广泛研究的星际争霸2下的微观操控问题,我们提出了一个带有信息整合机制的多智能体强化学习算法,该算法是集中式训练分布式执行的。它利用图注意力网络整合了邻域信息,提出的改进多头注意力机制,使得单个注意力头只计算属于同一概念的特征,使其具有更好的可解释性。此外,考虑到并不是所有的额外信息都会对智能体产生积极的影响,我们还提出了一个信息门控机制来控制智能体是否需要借助邻域的信息辅助决策。在高难度的对抗环境中进行的实验,验证了所提出的算法的有效性。
其他文献
非编码RNA在许多动植物生命活动中扮演着重要的角色,具有代表性的是miRNA和lncRNA。越来越多的研究表明,miRNA不仅可以与mRNA相互作用,还可以与lncRNA相互作用,影响生物学过程。目前对于miRNA和lncRNA的研究主要集中在人和动物上,对于植物的miRNA和lncRNA研究相对较少,而对植物miRNA和lncRNA相互作用的研究就更少了,且分散在不同物种中。植物miRNA和ln
随着人工智能时代的到来,人们对于机器设备的期望不再只停留于科学计算,如何让计算机更加智能高效成为更多科技从业者的工作目标和价值追求。其中,情感智能计算是改善人机交互的重要组成部分。但目前智能情感计算的发展仍然面临严峻的挑战,包括多模态特征使用不充分、情景信息挖掘不完全等,导致情感识别率较低。本文基于目前计算机领域和心理学相关研究成果,模拟现实生活中人类情感的表达方式,提出基于情景注意力神经网络的多
具有强大探索能力和自主学习能力的深度强化学习(Deep Reinforcement Learning,DRL)是实现自主机器人行为控制的重要技术之一。在动态环境中,高维度的连续决策空间常常使机器人控制策略的学习过程陷入局部最优。此外,深度学习遵循“端到端”的训练理念缺乏对机器人关节之间依赖关系的解释。针对机器人的维度诅咒的问题,本文提出了基于注意网络的可分解策略-值网络方法(Decomposed
近年来,针对智能体或多智能体系统的研究已经成为当前人工智能领域的研究热点之一。在多智能体系统中,多个智能体往往需要通过交互(例如,合作、竞争等)完成目标任务。本质上,智能体之间的高效交互可以通过分析并预测其他智能体的行为实现,进而提升整体系统任务完成的速率和成功率。其中,一种广泛使用的方法是利用智能体历史交互信息构建对手行为模型来预测当前交互过程中相关智能体的策略或行为。然而,该类方法需要在大量的
本文主要研究的是多任务优化问题中的任务选择算法。多任务优化问题是指多个优化任务在并发过程中相互进行知识迁移,从而提升各任务自身的优化性能。而在知识迁移前,对迁移的对象任务进行选择具有深刻意义。多任务优化问题中,由于随机选择任务进行知识迁移时会产生大量负迁移,从而导致各任务优化性能下降。因此,本文致力于设计合适的任务选择算法,使各任务能够选择合适的迁移任务进行知识迁移,减少负向迁移影响,提升正向迁移
实施"三线一单"生态环境分区管控制度是贯彻习近平生态文明思想的重要举措。习近平总书记多次强调要加快划定并严守生态保护红线、环境质量底线、资源利用上线三条红线。2021年4月以来,31个省(区、市)及新疆生产建设兵团均已完成"三线一单"省级成果发布工作,全面进入成果落地和实施应用阶段。近日,生态环境部印发《关于实施"三线一单"生态环境分区管控的指导意见(试行)》(环环评[2021]108号,以
期刊
资源受限项目调度问题是项目管理领域中的重要问题之一。该问题假设在所有活动工期及其所耗资源数量已知的情况下,求得一种以项目工期最短为目标的调度方案,是一种NP-hard问题。对大规模资源受限项目调度问题的求解仍然是难点。此外,由于实际项目环境中存在着大量不确定性因素,以模糊数形式表达这些不确定性因素形成的模糊资源受限项目调度问题又会让问题的复杂度进一步提升。本文主要研究内容如下:首先针对资源受限项目
铰接式拖挂机器人具有载货量大、机动灵活、运货成本低以及能源消耗低等优点,目前已广泛应用于各大货运场景中。然而传统铰接式拖挂机器人可操纵性差,尤其面对狭窄路况时,挂车的位姿难以精确控制,整车灵活度及避障能力受到很大限制。为解决这些缺陷,本文提出一种新颖的主动铰接式拖挂机器人结构,并开展其建模与运动控制策略的研究。首先,为了对运动控制策略的研究奠定基础,进行了主动铰接式拖挂机器人系统建模。通过分析该移
SLAM技术作为实现巡检机器人智能化应用的关键技术之一。本文以自主研发设计的四轮独立驱动与独立转向防爆巡检机器人为研究对象,通过搭载激光雷达和惯性传感器分别作为环境感知和定位传感器,利用ROS平台搭建了一套完整的SLAM系统框架,实现防爆巡检机器人在天然气调压站内自主定位与地图构建功能。首先,根据天然气调压站作业环境及防爆要求,设计了一款适应性强、安全性高的四轮独立驱动与独立转向防爆巡检机器人,针
在航空燃气涡轮发动机中,涡轮部件承受了最大的机械负荷、空气动力负荷和热负荷,因此在发动机运行过程中最容易产生各种故障,甚至引起安全事故。本文为了解决航空发动机故障知识获取难、推理慢的问题,降低排除故障的代价,提高航空发动机的健康检测和故障诊断水平,设计了航空发动机涡轮部件故障诊断专家系统并进行了实现。首先,研究了故障知识获取。采用知识约简算法进行知识获取,利用分辨矩阵对离散化的专家知识数据进行属性