论文部分内容阅读
深度强化学习(DRL)结合了深度学习的感知能力和强化学习的决策能力,从而能够处理传统强化学习难以解决的复杂决策问题。然而,深度强化学习模型仍面临着样本利用率低、对环境的微小变化泛化性不足等局限。这些局限性主要体现在深度强化学习往往会过度拟合训练数据,进而无法解决具有复杂逻辑和关系结构的问题。针对上述问题,DeepMind 在 18年提出了新的关系强化学习(RRL)算法。该算法提倡学习和复用以实体和关系为中心的函数,由于函数内部隐含了关系推理,从而显著提高了算法的性能、样本利用率和归纳能力等。
关系推理对于RRL模型的成功起到了至关重要的作用。然而当前的RRL模型中仅考虑了实体之间的二元关系。在现实世界中,多元关系更能体现实体之间的连接方式。不幸的是,计算更高一元关系会使得计算复杂度呈指数级增加。因此,在保持计算效率的同时计算多元关系是一个巨大挑战。另一方面,深度强化学习在多智能体环境中会面临比单智能体环境更困难的挑战,其中包括环境的非稳定性、多智能体的信用分配等。在多智能体领域,还未有针对RRL的相关研究。综上所述,本文针对以上挑战,分别在单智能体和多智能体领域提出了对应的多元关系DRL算法。
在单智能体环境中,当前的RRL模型通过使用多头注意力点积机制(MHDPA)赋予智能体关系推理的能力。但是该模型只考虑了二元关系且很难被扩展到多元关系。本文提出了一种新的多元关系核心(MRC),并将其和经典A3C算法相结合构成完整的单智能体多元关系演员-评论家(MRAC)算法。MRC 模块主要有两个特点:实体之间的多元关系可以被高效地近似计算,以及模块的计算复杂度不会随深度的增加而呈指数级增加。为进一步降低MRC的计算复杂度,本文通过优化模块内部结构,从而提出了单头简化版本的多元关系核心(MRCSH)。MRCSH模块可以在减少计算开销的同时保留智能体的关系推理能力。
在多智能体环境中,基于单智能体算法Soft Actor-Critic(SAC),本文提出了一种新的多智能体多元关系演员-评论家(MMRAC)算法。所有智能体的评论家(Critic)之间共享一个多元关系机制。该机制通过计算当前智能体和其他智能体的关系,动态地选择需要关注的智能体,增强了智能体之间的交流、合作能力,从而提升了算法性能。此外,MMRAC算法通过引入新的多智能体优势函数,进一步增强了模型的稳定性,同时缓解了多智能体信用分配问题。MMRAC算法具有足够的灵活性,可以被应用于大多数多智能体学习任务中。
最后,本文在不同的游戏环境中对MRAC算法和MMRAC算法的有效性进行了验证。实验结果表明,在单智能体环境中,MRAC算法不仅可以学习到更优策略,而且提高了模型的样本利用率和泛化能力。同时,相较于MRC模块,MRCSH能够在保证模型性能的同时缩短收敛时间。在多智能体环境中,MMRAC算法的性能优于其他对比算法,并且具有更好的鲁棒性和扩展性。
关系推理对于RRL模型的成功起到了至关重要的作用。然而当前的RRL模型中仅考虑了实体之间的二元关系。在现实世界中,多元关系更能体现实体之间的连接方式。不幸的是,计算更高一元关系会使得计算复杂度呈指数级增加。因此,在保持计算效率的同时计算多元关系是一个巨大挑战。另一方面,深度强化学习在多智能体环境中会面临比单智能体环境更困难的挑战,其中包括环境的非稳定性、多智能体的信用分配等。在多智能体领域,还未有针对RRL的相关研究。综上所述,本文针对以上挑战,分别在单智能体和多智能体领域提出了对应的多元关系DRL算法。
在单智能体环境中,当前的RRL模型通过使用多头注意力点积机制(MHDPA)赋予智能体关系推理的能力。但是该模型只考虑了二元关系且很难被扩展到多元关系。本文提出了一种新的多元关系核心(MRC),并将其和经典A3C算法相结合构成完整的单智能体多元关系演员-评论家(MRAC)算法。MRC 模块主要有两个特点:实体之间的多元关系可以被高效地近似计算,以及模块的计算复杂度不会随深度的增加而呈指数级增加。为进一步降低MRC的计算复杂度,本文通过优化模块内部结构,从而提出了单头简化版本的多元关系核心(MRCSH)。MRCSH模块可以在减少计算开销的同时保留智能体的关系推理能力。
在多智能体环境中,基于单智能体算法Soft Actor-Critic(SAC),本文提出了一种新的多智能体多元关系演员-评论家(MMRAC)算法。所有智能体的评论家(Critic)之间共享一个多元关系机制。该机制通过计算当前智能体和其他智能体的关系,动态地选择需要关注的智能体,增强了智能体之间的交流、合作能力,从而提升了算法性能。此外,MMRAC算法通过引入新的多智能体优势函数,进一步增强了模型的稳定性,同时缓解了多智能体信用分配问题。MMRAC算法具有足够的灵活性,可以被应用于大多数多智能体学习任务中。
最后,本文在不同的游戏环境中对MRAC算法和MMRAC算法的有效性进行了验证。实验结果表明,在单智能体环境中,MRAC算法不仅可以学习到更优策略,而且提高了模型的样本利用率和泛化能力。同时,相较于MRC模块,MRCSH能够在保证模型性能的同时缩短收敛时间。在多智能体环境中,MMRAC算法的性能优于其他对比算法,并且具有更好的鲁棒性和扩展性。