基于全景图像的目标检测算法研究

来源 :广东工业大学 | 被引量 : 0次 | 上传用户:efsdfe
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
随着全景视觉在智能交通、视觉监控、VR等领域的应用,对全景图像中的人,车等目标的检测需求逐渐增大。等矩形全景图像是全景图像最常用的表现形式,本文围绕它进行研究。由于等矩形全景图像中存在图像畸变、失真等问题,且不同位置上的失真程度不一,使用常规图像检测方法难以完整地提取出物体的特征信息,造成误检、漏检问题。因此,本文提出使用组卷积网络获取图像子区域特征,从而对图像进行特征修正,并引入多尺度特征融合结构增强小尺寸目标特征以支持高准确度的目标检测。为了缓解图像内容畸变失真的影响,本课题提出组卷积网络,并通过提取子图像中的特征与原图像特征进行融合,实现对原图像的特征修正。针对全景图像中不同位置处失真程度差异,本课题基于分组卷积层构建轻量级网络,利用分组卷积在特征提取过程中以不同的卷积参数变量的形式来提取各个子图像区域的特征信息,从而提升图像特征表达的能力,有效克服常规方法检测过程中特征信息不完整的问题。在特征计算过程中,首先对输入图像进行均匀切分来获得子图像,并通过通道连接方式组合子图像。接下来使用组卷积网络提取特征,将分组数设置为子图像数目并逐层减少。最后对组卷积网络输出的特征数据进行切分、拼接等操作进行排列,通过Skip Connection方式实现与原图像特征进行特征融合,从而达到降低图像畸变失真影响、修正输入图像特征的目的。考虑到全景图像中的目标物体在同一场景下存在尺度差异、远距离目标占比小的问题,本文在检测网络中引入多尺度特征融合的方法,并采用concat级联的方式将不同层的特征图融合。通过采用自顶向下的方式融合网络相邻层的特征,实现将高层特征图丰富的语义信息融入低层特征图中,以提升对目标的表征能力。接着对特征融合后得到的每个特征图作为RPN网络的输入,生成包含物体的候选框,最后通过使用全连接的分类网络对候选框中包含的物体进行分类,得到物体类别信息。本课题实验采用了从网络上自行收集的全景图像数据构建实验数据集,并按VOC格式进行标注。为了检验目标检测算法的有效性,使用Pytorch深度学习框架搭建检测算法模型,使用训练集对算法模型进行训练,再使用测试集评估模型对全景图像中的人和车辆目标检测结果,检测精度分别为72.63%、78.85%,总体的检测精度(m AP)为75.74%,说明提出的检测算法是有效的。相较于已有的检测算法m-p YOLO、R-SSD,在总体的检测精度上分别提高了6%、2%,这表明提出的检测算法在对全景图像的检测识别上优于当前已有的算法模型。
其他文献
目标检测在近年来一直都是众多学者研究的热点问题。其目的是对自然图像中的实例对象进行分类并找出实例对应位置的包围框,在医学图像检测、人脸识别、视频监控等领域都有着非常广泛的应用。传统的目标检测技术都是建立在大量带有精确注释的图像数据集基础上,然而收集并标注该类数据耗时耗力,相较之下,基于弱监督学习的目标检测仅利用图像级别注释信息的数据即可完成目标检测模型构建。图像级注释仅需标注图像中的类别信息,不需
协同致死关系是基因之间的一种特殊的相互作用,当构成协同致死关系的两个基因同时产生缺陷时,会导致细胞的死亡。利用协同致死关系开发靶向抗癌药物是现代癌症治疗理论中重要的一环,在传统的生物学实验中需要通过RNA筛选等手段探测未知的协同致死基因对,而这些实验存在成本高昂以及效率低下等问题。通过计算方法预测协同致死基因对可以为生物学实验提供目标指导,从而提高探测实验的研究效率,在一定程度上降低实验成本。随着
在晚间,多数无课程与活动安排的教室会被学生自习使用。一般情况下,用于晚自习的教室在所有教室中所占的比重较高,但平均每间晚自习教室的座位占用率较低,容易造成电能的浪费。因此,有必要对晚自习教室进行调度,提高整体的座位资源利用率。在晚自习时,学生越发关注空间上的舒适感能否被满足,即有没有足够的自习空间。当前,缺乏考虑学生晚自习所需空间的教室节能调度研究。本文通过采集与分析晚自习相关的数据,对学生微观选
在计算机视觉中,迁移学习称为领域自适应。通常,数据选自于两个有所差异的数据域,分别是源域、目标域。这两个数据域的差异在于其中数据的特征分布或者所在的特征空间不同。领域自适应的目的是从有足够标注数据的源域中学习知识来帮助没有(或只有少部分)标注数据的目标域进行模型的学习。领域自适应可以有效解决特征分布不同时的跨域识别问题,大多领域自适应方法将两个域的特征投影到子空间,在子空间进行分类器的学习,以取得
随着互联网技术的发展,互联网几乎融入社会的所有行业,并逐渐成为我们生活、学习、工作中必不可少的一部分。作为当今最热门的Web程序开发语言,PHP语言具有成本低、速度快、可移植性好等优点,被广泛应用到互联网应用开发中。伴随Ruby On Rails出现,PHP也涌现出Laravel、Symfony、Yii等优秀的开发框架,并从开始的模仿逐渐过渡到拥有自己特有的风格。但是当前主流的PHP开发框架还是存
注意力缺陷伴多动障碍(Attention Deficit Hyperactivity Disorder,ADHD)是一种常见的儿童神经发育障碍,表现为注意力不集中、过度活跃和冲动,严重影响儿童的日常学习和生活。目前医生主要依靠临床观察和评定量表来进行ADHD的诊断,定性诊断占比高,使得结果具有较大主观性。由于临床上仍然缺乏客观有效的ADHD量化评估方法,对症状较轻微的患者容易造成误诊或漏诊。近年来
技术就是对给定的单个或者多个文本进行总结概括,得到文本摘要。摘要既要能够反映原文档的主要内容,还要尽可能地保持简洁明了。最近几年,由于deep learning技术的快速发展,文本摘要技术也有了很大的改变,不再是只有传统的抽取式文本摘要技术,而是转变为抽取式与生成式共存的文本摘要技术。当原文档中存在多个主题共存这种情况时,目前大多数生成式摘要方法会对这多个主题的内容进行较为全面的总结和概括,尽可能
随着动漫、游戏、电影等产业的迅速发展,人体三维建模的需求日益增加。但传统建模需要精密仪器的测量,成本高且使用环境严苛。视觉计算的迅猛发展为人体三维建模提供另一种方法—基于图像重建模型,即从图像中获取人体三维空间信息,构建人体三维模型。单目图像重建相较于多目图像,因缺少深度信息,获得三维信息是具有难度的。为解决单目图像重建缺乏三维信息,重建模型只关注姿势而忽略形状,且重建误差较大的问题,结合参数化模
研发远程实验平台的动因源于本文作者为解决本科实验教学工作中的困境,在设备台套数不足及排课资源有限的条件下需要完成课时倍增的实验教学任务。本文作者有多个远程实验系统的开发、部署及运维经验。本文分析两个远程实验案例的开发及其技术演进过程后,提出了如下主要设计思路:以FPGA在线编程为核心,以虚拟化云服务为场景,以虚实结合为导向,实现计算机组成原理实验的云服务化。根据这个设计思路,本文展开计算机组成原理
毕业生的就业去向和质量一向是高校十分关注的问题,就业咨询和辅导也是高校十分关注的任务。高校每年都会存储大量毕业生情况和就业去向,但是通过人为分析这些数据中的规律,任务量非常大而且十分困难,并且会十分依赖主观因素。学生自身也很难应用这些数据。同时,辅导者对学生就业辅导时也会片面关注毕业生的部分特质,很难全面兼顾毕业生的所有情况。辅导者个人多年的从业经验也不易复制,无法大量普及,在面对需求量较大的时期