论文部分内容阅读
本文将单agent Q学习引入到多agent环境,提出了一种多agent协作团队的Q学习方法,即基于承诺和约定先给agent分配求解子目标,然后针对系统求解过程中的相似性,用相似性来减少学习过程的状态空间,并利用Q值共享来实现协作,进而加速多agent的学习,提高求解效率。根据上述思想,我们就猎人捕物问题域(pursuit game)实验了我们的方法,结果表明该方法是完全可行的。