基于卷积神经网络的快速视频目标分割方法研究

来源 :国防科技大学 | 被引量 : 0次 | 上传用户:xiaosanhuah
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
视频目标分割是计算机视觉的重要研究内容,在视频监控以及人机交互等领域具有广阔的应用前景。随着深度学习在视频目标分割任务上取得重大突破,如何将性能优异的视频目标分割模型快速应用到实际的监控场景中,已经成为建设智慧城市、维护公共安全的迫切需求。本文针对实际应用场景下的视频目标分割问题,着重解决在实际应用过程中进行快速准确的视频目标分割,论文的主要创新点包括以下几个方面:(1)提出了一种基于目标注意力机制的视频初始帧选取方法。该方法研究利用卷积神经网络来学习视频序列的整体特征,从中推理出视频序列中最能代表指定目标运动信息的初始帧,从而避免真实视频中进行目标分割任务时需要人工去尝试选择视频初始帧的耗时问题。针对视频中帧与帧之间所包含目标信息的不同,本文设计了相对性能排序网络结构,借助冒泡排序的思想,依次比较相邻两帧的分割性能直到预测出性能最佳的帧位置。为了优化学习到的特征,本文在Faster R-CNN提取特征的基础上,提出了注意力模块来显式地加强关键特征图的重要性。实验结果表明,本文设计的方法能够自适应地挑选出视频序列中较合适的初始帧,从而提供更加准确的分割效果。(2)提出了一种适用于高层次视频目标分割任务的网络模型通道裁剪方法。深度网络模型的参数量和计算量过于庞大是限制诸多分割模型实际应用的瓶颈性问题。针对这个问题,本文设计了一种简单有效的模型轻量化的方法,通过对网络模型的损失函数进行泰勒展开,来识别出需要裁剪的低贡献度的网络通道。在尽量保留原始模型性能的前提下,尽可能地去除视频目标分割模型中的冗余参数,减少部署设备上的计算开销。在多个常见的分类网络上的实验结果表明,该方法优于现有的通道裁剪方法,充分验证了本文所提方法的有效性。随后,本文将设计的通道裁剪方法应用到视频目标分割模型上来。最终在DAVIS16数据集的实验效果表明,本文所提出的通道裁剪方法可以在去除OSVOS网络模型50%通道的情况下,使模型的计算量和参数量分别减少了近50%和75%,而裁剪后模型的分割性能与原始模型的效果接近,且更接近实际应用的需求。
其他文献
目标检测作为图像理解和计算机视觉的一个分支,是大量视觉任务的必要前提,当前也是机器学习领域中的一个热门方向。目标检测被广泛应用于许多的领域上,例如道路交通车辆以及标识、安保系统中的检测、军事领域中目标的识别。针对不同的应用场景而言,目标检测核心思想都是要解决物体在背景中的精确定位。对于红外图像中的目标,检测目标并对其物体轨迹进行分析是实际需求中必须要解决的难点。由于红外目标本身的特征弱、颜色缺失,
学位
天基红外光学监视系统利用部署在多个轨道平台所组成的光学传感器星座,对弹道导弹、航天发射等重要事件进行实时探测、跟踪、识别以及预报。对国土安全可能存在重大威胁事件的即时发现,有助于快速反应及时决策,增强我国战略防御能力。在这种应用背景下,天基红外光学监视系统面临着多种类、多型号目标的威胁考验。所以天基光学监视系统采用的探测体制和其中涉及的信息处理技术对系统效能具有决定性影响。天基红外光学监视系统星座
虽然当前基于图像的三维重建已经取得了较大的成功,但是有一类物体表面的重建效果仍然不理想,这类表面在现实场景中非常常见,主要包括镜面物体(比如玻璃、水面等)和弱纹理物体(比如白墙、瓷砖地面等)的表面。在传统的三维重建框架中,该类表面在稠密点云重建过程后会出现点云缺失的情况,造成没有足够的点云支撑进行表面重建,所以称之为弱支撑表面。本文主要针对含此类表面中平面形状的场景(即“弱支撑平面”)的三维重建问
移动机器人同步定位与建图(Simultaneous Localization and Mapping,SLAM)方法是用于机器人环境感知和导航的主流建图方法。传统的视觉SLAM方法中RGB-D信息非常重要,系统可以从RBG-D相机中获取颜色和深度等数据,其中,在获取深度数据的过程中会受到距离、光照等因素的限制,难以获得较好的建图效果。单目相机结构灵活、价格低廉,在实际中有较高的应用价值。如何使SL
受限于高中教学课时、安全风险及新冠疫情等因素,户外远距离开展研学活动以培养学生的地理实践力较为困难。本文以重庆南山风景区为研学活动基地,依托基地的研学资源,从研学设计思路、研学主题及目标设计入手,围绕“初识南山、探秘南山、造化南山”三大主题进行研学内容、研学任务、活动实施及评价的系统设计。该设计方案有利于提高学生的地理调查与考察能力,增强学生地理实践力。
近年来5G技术发展成熟,移动设备中相机配置越来越高,人们更愿意拍摄视频上传到网络上,互联网上视频数量持续急速增长,因此迫切需要高效的视频处理方法来满足海量视频处理的需求。视频分类技术是根据视频中内容自动判断视频所属类别的技术,是视频处理领域的重要组成部分,是计算机视觉领域的基础研究课题,对视频分类技术进行研究是必要的,同时视频分类技术也可以被广泛应用到生活中的各个领域,所以对视频分类任务的研究正在
在这个计算机、通信发展迅速的年代,人们接触到的文本、视频、音频,包括图像等多媒体信息越来越多。通过互联网,人们正在一步一步的实现全球多媒体信息的共享。用户对多媒体信息的查询也变得越来越普遍。各种新的应用需求也随之而来。跨媒体检索技术,指的不同模态之间可以相互交叉检索的检索方式,即通过某一种模态的实例检索出与之语义相关的其它模态的样本。跨模态检索到的结果与单模态相比,内容丰富,能将查询对象更加立体地
近几年,在计算机视觉领域,目标跟踪问题成为研讨热点之一。视频单目标跟踪是计算机视觉的重要研究课题,在视频监控、机器人、人机交互等方面具有广泛应用。作为计算机视觉领域的关键问题,单目标跟踪算法可以根据在连续图像序列中的跟踪信息,绘制给定物体的轨迹信息,方便后续进行行为分析和异常检测。大数据时代的到来及深度学习方法的出现,为视频目标跟踪的研究提供了新的契机。因此,单目标跟踪问题具有重要的理论意义和研究