论文部分内容阅读
本文的研究目标是视频中的行人行为识别。行为识别的定义为评估视频给定帧中是否发生了给定动作。由于人类行为(动作,活动)的高度复杂性,例如摄像机角度,行人外观变化,运动方式,遮挡等,使行人动作识别变得复杂。当前已有的部分模型主要依赖于特定的局部时空特征和卷积神经网络去解决此类问题。虽然取得了相对较好的结果,但是仍然存在一些缺陷。为了充分解决由于行人行为复杂而导致的行为识别困难问题,我们提出了如何对局部特征之间的关系尤其是在时空背景下的关系进行建模的方法。
在本文中,提出了三种方法来解决这个具有挑战性的问题。在第一种方法中,提出了一种基于密集轨迹和局部时空特征的分类模型。该模型使用经典描述符方式(例如Fisher向量)对特征进行编码。在第二种方法中,和先前的一些进行连续特征学习的无监督解决方案不同,本文以胶囊网络的方式定义这些学习到的特征,因此能够在端到端结构中有判别地优化本文提出的第二个模型,并通过动态路由算法进行权重更新。最后,在第三个方法中,采用可变形卷积网络和自平衡敏感度分段器(SuBSENSE)方法对视频帧进行前景分离,并预测视频中潜在的动作。此解决方案是通用的,无论是基于人工标注还是基于深度学习的方法,都能有效提升网络性能。
(1)提出了一种通过结合密集特征轨迹进行动作分类的新方法。该方法不仅利用了传统方法中的形状轨迹信息,还着重于结合运动密集轨迹的信息。在本研究中,视频样本是根据更全面的特征集进行分类的,该特征集引入了运动和形状密集轨迹特征,从而包含了有关视频活动或类别的更多信息。
(2)提出了一种基于变型胶囊神经网络的动作分类模型。在该模型中,网络权重不是采用传统默认方式进行更新,而是通过反向传播过程中动态路由损失来更新权重,以确保模型捕获的信息与其表示一致。另外,该模型不需要大量的样本训练,从而与传统方法相比,资源消耗更低。
(3)提出了一种用于动作检测、分类与预测的可变卷积序列模型框架。该模型在能够对动作进行分类的同时,还能够对未来活动进行预测。实验结果证明,与传统方法相比,所提模型通过SuBSENSE进行前景提取,并结合可变卷积网络,使得分类与预测性能得到了较大提升。
我们的工作表明,与最新的基准或传统方法相比,所提模型取得了显著改进,同时大大减少了所需训练参数和输入的样本数量。实验显示,实时处理视频的能力决定了模型能否在潜在应用中快速识别预测动作。本文提出的所有方法都可以应用于实时系统,并且已通过开发系统或提出解决方案证明其可行性。
综上,我们的工作已在动作分类和根据视频内容进行预测的领域中取得了一定突破性成果。该成果的取得得力于模型中考虑的几个关键技术因素:特征轨迹、权重更新、胶囊网络、背景去除和时间信息。同时,与传统方法需要更多的样本集和昂贵的资源相比,本文所提出的模型大大减少了对大量训练数据集的依赖,降低了资源需求。
在本文中,提出了三种方法来解决这个具有挑战性的问题。在第一种方法中,提出了一种基于密集轨迹和局部时空特征的分类模型。该模型使用经典描述符方式(例如Fisher向量)对特征进行编码。在第二种方法中,和先前的一些进行连续特征学习的无监督解决方案不同,本文以胶囊网络的方式定义这些学习到的特征,因此能够在端到端结构中有判别地优化本文提出的第二个模型,并通过动态路由算法进行权重更新。最后,在第三个方法中,采用可变形卷积网络和自平衡敏感度分段器(SuBSENSE)方法对视频帧进行前景分离,并预测视频中潜在的动作。此解决方案是通用的,无论是基于人工标注还是基于深度学习的方法,都能有效提升网络性能。
(1)提出了一种通过结合密集特征轨迹进行动作分类的新方法。该方法不仅利用了传统方法中的形状轨迹信息,还着重于结合运动密集轨迹的信息。在本研究中,视频样本是根据更全面的特征集进行分类的,该特征集引入了运动和形状密集轨迹特征,从而包含了有关视频活动或类别的更多信息。
(2)提出了一种基于变型胶囊神经网络的动作分类模型。在该模型中,网络权重不是采用传统默认方式进行更新,而是通过反向传播过程中动态路由损失来更新权重,以确保模型捕获的信息与其表示一致。另外,该模型不需要大量的样本训练,从而与传统方法相比,资源消耗更低。
(3)提出了一种用于动作检测、分类与预测的可变卷积序列模型框架。该模型在能够对动作进行分类的同时,还能够对未来活动进行预测。实验结果证明,与传统方法相比,所提模型通过SuBSENSE进行前景提取,并结合可变卷积网络,使得分类与预测性能得到了较大提升。
我们的工作表明,与最新的基准或传统方法相比,所提模型取得了显著改进,同时大大减少了所需训练参数和输入的样本数量。实验显示,实时处理视频的能力决定了模型能否在潜在应用中快速识别预测动作。本文提出的所有方法都可以应用于实时系统,并且已通过开发系统或提出解决方案证明其可行性。
综上,我们的工作已在动作分类和根据视频内容进行预测的领域中取得了一定突破性成果。该成果的取得得力于模型中考虑的几个关键技术因素:特征轨迹、权重更新、胶囊网络、背景去除和时间信息。同时,与传统方法需要更多的样本集和昂贵的资源相比,本文所提出的模型大大减少了对大量训练数据集的依赖,降低了资源需求。