论文部分内容阅读
实例检索的任务是从大量的图像库中找出包含特定物体的图像,这是目前图像检索领域比较火热的一个研究课题。实例检索在原始检索任务的基础上,附加了对图像中特定物体的检索,使得检索的目的更加明确,应用的场景更加贴近实际生活。本文着重研究实例检索的三个问题:1.基于深度神经网络的实例区域检测。深度神经网络在解决区域提取任务上已经达到了不错的精度,但是对于具体问题中的数据集往往需要进行微调。针对实时检索任务,我们选择了合适的网络结构,在不影响检测效果的前提下提升检索速度;2.基于深度神经网络的实例特征提取与编码算法。不同于传统的手工特征的提取方式,我们通过训练一个深度神经网络模型,从网络中某一层的输出作为原始特征,结合实际应用的问题,设计新的检索特征;3.检索系统索引结构的设计与匹配结果的优化。随着图像数据中图像的不断增加,如果使用一般的检索策略,时间开销也非常大,而检索匹配模块需要在保证检索精度的同时保证系统反馈的实时性。本文研究的主要成果和创新点有:1.针对实例区域检测的特定任务,我们改进了目前流行的SSD框架,不仅取得了较高检测精度,也使得检索系统满足了实时性,同时也为检索系统后续的模块做了铺垫;2.基于深度卷积网络模型,我们提出了基于卷积激活响应分布的特征提取方式,在不同的网络层了提取多尺度特征、低层视觉特征、高层语义特征,使得用于检测的实例特征更加具有表征能力;3.针对大规模检索的图像数据库,我们提出了适合快速检索的索引数据结构,这让大规模图像的实例检索系统的实现变成了可能。在这个基础上,我们提出了基于区域优化的重排序算法,使得检索的结果更加符合用户的预期。我们从Flickr等图片网站上爬取了大量自然图像,并且对于每张图片进行实例区域的标注和物体类别的分类,以结构化的形式存入了数据库中。我们结合公开数据集和爬取的图像数据,训练了深度神经网络模型,对于实例区域的检测、实例特征的提取、检索结果的准确度和实时性等方面进行了实验,实验的结果显示我们的检索框架不仅在公开数据集上取得了不错的准确度,同时在大规模图像检索任务上也能做到实时的响应。