论文部分内容阅读
暴力场景检测对于网络信息净化、保护未成年人身心健康、自动视频监控等方向具有广阔的应用前景。视频和音频是媒体中主要信息,但除了视频中的暴力画面和音频中的暴力声音之外,类似愤怒或憎恨情绪的字幕出现往往伴随着暴力场景的发生。字幕文本中所包含的情绪也有很多值得参考的补充信息。尤其是在视频帧或音频帧缺失的情况下,字幕信息对于暴力场景检测有着十分重要的作用。本文对融合视听特征和字幕特征的暴力场景检测方法进行了研究,主要研究工作如下:
(1)针对现有的暴力数据集种类不多且规模较小的问题,提出一种结合镜头分割和深度学习技术的自动暴力数据搜集方法对公开人群暴力数据集VIF(Violent Flow)、暴力音频数据集VioAudio的数据集进行扩充。此外,针对现有暴力数据集较少包含视频、音频与字幕三种模态的情况,本文将暴力视频数据、暴力音频数据和暴力字幕数据合并构建为暴力媒体数据集。
(2)针对传统特征方法获取的特征普适性较低的问题,构建了基于CRNN网络的视觉特征和字幕特征提取方法模型。针对传统暴力检测方法在音频信噪比发生变化时模型的鲁棒性不高的问题,构建了基于暴力Gammtone图谱的COPE音频特征模型提取音频特征并与视觉特征和字幕特征结合。
(3)在现有暴力场景检测方法的基础上,结合视觉、听觉和字幕特征,提出了一种新的分类模型FoAVS(Fusion of Audio-visual and Subtitle)用于媒体中的暴力场景检测,实现了将媒体中视频、音频和字幕信息结合用于识别暴力。在模型的多模态特征融合部分,针对传统串联融合方法未考虑多模态特征的“语义鸿沟”导致识别性能下降的问题,提出了通过全连接层将每个模态特征转化为相同的特征表达空间的特征级融合方法。该方法相比于传统串联融合方法在一定程度上消除了不同模态特征间的语义间隔,提高了特征级早融合方法的分类精度。实验表明,与现有方法相比,本文的方法结合了视听与字幕三种模态的信息,检测效果得到提升,并且对不同音频信噪比的媒体具有很强的鲁棒性。
(4)将本文研究的暴力检测方法应用于IPTV流媒体点播系统中。
(1)针对现有的暴力数据集种类不多且规模较小的问题,提出一种结合镜头分割和深度学习技术的自动暴力数据搜集方法对公开人群暴力数据集VIF(Violent Flow)、暴力音频数据集VioAudio的数据集进行扩充。此外,针对现有暴力数据集较少包含视频、音频与字幕三种模态的情况,本文将暴力视频数据、暴力音频数据和暴力字幕数据合并构建为暴力媒体数据集。
(2)针对传统特征方法获取的特征普适性较低的问题,构建了基于CRNN网络的视觉特征和字幕特征提取方法模型。针对传统暴力检测方法在音频信噪比发生变化时模型的鲁棒性不高的问题,构建了基于暴力Gammtone图谱的COPE音频特征模型提取音频特征并与视觉特征和字幕特征结合。
(3)在现有暴力场景检测方法的基础上,结合视觉、听觉和字幕特征,提出了一种新的分类模型FoAVS(Fusion of Audio-visual and Subtitle)用于媒体中的暴力场景检测,实现了将媒体中视频、音频和字幕信息结合用于识别暴力。在模型的多模态特征融合部分,针对传统串联融合方法未考虑多模态特征的“语义鸿沟”导致识别性能下降的问题,提出了通过全连接层将每个模态特征转化为相同的特征表达空间的特征级融合方法。该方法相比于传统串联融合方法在一定程度上消除了不同模态特征间的语义间隔,提高了特征级早融合方法的分类精度。实验表明,与现有方法相比,本文的方法结合了视听与字幕三种模态的信息,检测效果得到提升,并且对不同音频信噪比的媒体具有很强的鲁棒性。
(4)将本文研究的暴力检测方法应用于IPTV流媒体点播系统中。