论文部分内容阅读
随着互联网的飞速发展,视频数据的爆炸式增长和内容的多样化给分析、处理视频数据提出了新的挑战。人体跟踪和行为识别是视频分析的核心问题,也是目前计算机视觉和模式识别的研究热点。跟踪属于视觉的中层部分,通过跟踪我们可以获得目标的运动轨迹、姿态参数等信息。这些信息为后续的高层视频内容分析,如行为识别等,奠定了基础。而行为识别是通过融合底层特征和中层跟踪系统达到理解视频中的语义信息的目的。这在大规模视频监控系统和网络视频搜索中都有广泛的应用空间。
以前的跟踪算法着重于对目标外观的建模,即如何有效地刻画目标外观随时间的变化。本论文中研究了如何利用背景信息提高目标跟踪的性能,有效处理跟踪中产生的漂移问题。针对行为识别,本论文评测了当前流行的各种时空兴趣点检测子和描述子。同时和跟踪结合起来,考虑如何描述视频中的运动信息。然后讨论了各种特征融合方法,提高了行为识别的性能。本文的主要研究内容和贡献包括:
1.通过同时给目标和背景建立非参数的概率密度估计模型,有效地融合了背景信息,提高了跟踪系统的鉴别能力。设计了一种检测遮挡(occlusion)和扰乱(distraction)的准则,利用该准测可以调整概率密度模型中样本权重。在准确捕捉目标和背景外观变化的同时,提升了对遮挡和扰乱的鲁棒性。这种在生成式模型中融入鉴别信息的方式提高了跟踪的效果。
2.通过将每帧图像中的新样本当作未标记样本,把跟踪问题建模为一个半监督学习问题。这种建模方式增强了跟踪系统对概念漂移的鲁棒性。具体来说,我们引入了半监督鉴别分析(SDA),为该算法设计了一种增量更新方式,使其具备在线学习能力。同时我们针对SDA设计了新的正则项,提出了扩展的半监督鉴别分析(ESDA)。最后我们将SDA和ESDA嵌入到online boosting框架中,通过boosting融合多个分类器,提高了系统的鉴别能力。
3.时空兴趣点检测子和描述子成为行为识别的主要特征表述方式。与传统的方法相比,时空特征不需要跟踪、分割等预处理,对遮挡,光照,姿态等各种变化更加鲁棒。利用词包(bag-of-features)模型,可以识别复杂视频中的行为,显著提高识别精度。本文对当前主流的4种时空兴趣点检测子和6种时空兴趣点描述子做了系统的评测。同时提出了对视频直接进行稠密采样(dense sampling)的方法。大量的实验结果表明稠密采样在复杂视频数据中要好于稀疏的时空兴趣点检测子。稠密采样能够更加有效的捕捉视频中场景的上下文信息,提高识别性能。
4.提出了稠密轨迹(dense trajectories)的特征描述方法。与时空兴趣点相比,轨迹能够更好地刻画视频中的运动信息。我们通过在光流场中跟踪特征点的方式提取稠密轨迹。在数量和质量上都要优于由KLT跟踪和SIFT特征匹配生成的轨迹。稠密轨迹能够准确捕捉视频中的快速运动,对镜头边界也很鲁棒。由于其自身的稠密属性,可以有效地覆盖视频中上下文信息。我们还提出了一种新的运动边界直方图描述子。该特征能有效地抑制视频中镜头运动,提高了在复杂视频中的识别精度。在主要行为识别数据库(如:KTH,YouTube,Hollywood2,UCF sports,IXMAS,UIUC,Olympic Sports和UCF50)上的测试结果要显著好于the state of the art。
5.由于视频数据本身的复杂性,融合不同的特征往往能够提高系统性能。本文研究了稀疏的和非稀疏的特征融合方式。首先利用时空金字塔扩充了初始特征集合,然后比较了稀疏的和非稀疏的多核学习(MKL)方法。实验结果表明非稀疏的Lp-norm MKL要优于稀疏的MKL。受到这个启发,我们把LPBoost特征融合方法扩展成Lp-norm的形式,并给相应的优化问题提供了求解算法。进一步的实验结果表明对于行为识别非稀疏的特征融合方式要优于稀疏的方式。