论文部分内容阅读
近年来,随着网络、计算机技术的快速发展,数据分享的兴起,人们面对的是文本与图像数据的大量增长,如何方便精准地为用户获取感兴趣的数据成为一个突出问题。在利用文本搜索图片时,其技术包括:基于文本的图像检索技术,图像数据需要有正确的标签和内容,因此该技术要求有人工语义标注。在网络上的社交数据都有用户给定的标注数据使得获取大量有语义标注的数据成为可能。然而这些文本数据具有大量的随意性,包含大量噪声并且不完整;基于内容的图像检索技术利用深度学习模型得到了巨大发展,但视觉特征与高层语义之间的语义鸿沟使得检索精度不能满足要求,另外用户难以找到与检索图片相似的样例。由于图文检索技术上存在的以上问题,通过文本与图片内容的直接关联,从而实现数据跨模态的搜索是非常核心的一个基础需求。基于该需求,本文结合文本与图像上的成熟模型,研究了融合文本与图片特征的多模态模型,具体工作如下:(1)利用高斯玻尔兹曼机作为图像特征的输入模型,重复软最大化模型作为文本特征的输入模型,本文通过联合特征完成了图片与文本关系的建模,并在Flickr8k数据集上完成跨模态图文检索实验。该模型具有能够特征重构的优点,通过建立特征索引,在较大的数据库当中的检索速度相比需要计算跨模态特征相似度的模型更快。(2)针对重复软最大化模型中单词特征简单和忽略文本结构的缺陷,本文通过依赖树分析了句子结构,同时使用词向量作为单词特征。根据依赖树的生成方式,使用递归神经网络对单词关系进行建模。最后根据在一个模态下利用特征进行搜索的原理,建立排列损失函数训练多模态模型。实验表明,该模型在检索精度上优于多模态深度玻尔兹曼模型。(3)针对一个固定长度的特征向量不足以描述复杂图片或句子的问题,本文提出在更细粒度的层面上学习图像与文本之间关系的方法。在图像方面,利用区域卷积神经网络作为物体识别算法,从物体上提取图像特征。在文本方面,利用双向循环网络使得转化后的单词特征能够包含前后文信息。最后定义细粒度图像特征与细粒度文本特征相似性评价指标,使得可以利用排列损失函数完成多模态模型训练。由于训练时间较长,该模型在深度学习框架Caffe上实现。实验表明,在检索精度上优于使用一个特征向量描述图像或文本的模型。(4)利用自然语言模型和图像特征,本文从另外一个角度建立能够进行图文搜索的多模态模型。在对数双线性自然语言模型中,引入图像特征偏置项来影响基于上下文预测下一个单词的概率,从而建立多模态模型。实验表明,在困惑度作为图像与文本关系的评价指标体系下,提出的模型尽管在检索速度上较慢,但检索精度优于深度玻尔兹曼机模型。通过以上工作,本文从粗粒度到细粒度,建立了物体或动作在视觉上与文本之间的关系。基于此,可以利用自然语言描述进行图片搜索的功能,也支持利用图片搜索最为接近的文本描述的功能。