论文部分内容阅读
部分可观测马尔可夫决策过程(POMDP)是描述Agent在环境状态和行动效果不确定的条件下,通过一系列决策达到效益最大化的决策计划问题模型。由于现存算法的低效性,将POMDP用于解决实际问题还存在着障碍。目前,寻找基于值迭代的启发式近似求解算法成为POMDP问题领域的研究热点之一。
本文对POMDP模型、求解算法以及POMDP的应用进行了研究,提出了新的基于点的值迭代近似算法和预处理算法,并利用POMDP对入侵环境中的入侵者的思维进行建模以分析其入侵意图。具体研究成果如下:
1)在对POMDP模型及其求解算法研究的基础上,提出了一个基于预取样点集的值迭代算法BPBVI。其思想是预先利用启发式方法选取一个高质量的信念点集,然后在每次迭代过程中从预取样点集中选取点进行值迭代,实验证明算法具有良好的速度与效果。
2)针对基于点的值迭代算法(PBA)中出现的大量重复和无意义的计算,提出一个基于点的POMDP算法的预处理方法(PPBA)。其主要思想是:首先对每个样本信念点作预处理,并且在生成α-向量之前首先计算出该选取那个动作和哪些α-向量,然后再对信念点进行值迭代操作。实验结果表明:该方法很大地提高了运行速度,尤其对于稀疏问题更明显。另外,预处理过程消耗了很少的时间,需要的额外空间也在可接受范围之内。
3)在POMDP进行思维建模研究的基础上,把POMDP用于单个入侵对手的思维建模,提出了基于对手思维建模的入侵检测系统IRAIDS。