论文部分内容阅读
在过去的几年中,互联网上的多媒体数据呈现爆炸式地增长。跨模态检索(Cross-modal retrieval)由于融合了图像、文本等多个模态而成为多媒体信息检索中的一个研究热点。但其仍存在多模态表示、跨模态关联机制等多个挑战性的问题,因此,跨模态检索具有重要的理论意义和应用价值。针对当前跨模态检索的难点,即如何有效构建图像和对应文本的相关性,本文从典型相关性分析(canonical correlation analysis,CCA)出发,利用深度学习对跨模态检索进行了深入研究,文本的主要工作如下:1.将语义一致性引入图像和文本的相关性学习中。为了增强隐空间中的语义一致性,将传统的2模态CCA扩展到3模态CCA,同时最大化图像、文本和语义的相关性。提出了 4种类型的语义模态:有监督的类别标签,无监督的超图语义、局部近邻和局部保持。针对超图语义,提出了一种快速生成超边的方法。实验结果证明了这4种语义模态对于提高跨模态检索性能的有效性。2.提出了两种防止过拟合的技术:(1)自编码器。在相关性学习之后加入一个重构层,以重构模态内的输入。通过反向传播机制回传到相关层的重构损失可以看作是一种正则项,进而克服过拟合。(2)递进框架。在传统的神经网络框架中加入一个线性的损失层,联合优化线性投影和非线性损失来学习更好的特征表示。为了验证递进框架的一般性,在3种不同的应用中嵌入递进框架。实验结果证明递进框架可以为更多神经网络优化的问题提供更好更快的解决方案。3.提出了两种相似度的度量优化方式:(1)基于检索的相似度。传统的基于CCA的算法在获得隐空间后直接采用人工设计的度量方式计算模态间的相似度。受PageRank算法的启发,提出了一种间接度量隐空间中图像和文本对相似度的方法。(2)度量学习。我们试图将行人再辨识中的度量学习方法迁移到跨模态检索中。本文利用大规模相似度学习度量相似度,并结合跨模态检索语义一致性的特点,提出了一种相似对的构建方法。实验结果表明两种度量方法都是有效的,在提高跨模态检索性能方面是互补的。4.综合语义一致性、防止过拟合技术以及度量优化提出了两种和当前最好算法相比具有竞争力的跨模态检索模型。对于无监督跨模态检索,提出了一种改进的CCA。传统的CCA不能建模隐空间中的语义一致性,难以学习模态间的非线性相关性。由于传统度量学习不直接优化隐空间中的度量,所以在相似度比较方面存在问题。为了解决这些问题,改进的CCA方法引入局部近邻和局部保持来改善隐空间的语义一致性,将CCA从2视角扩展到4视角。为了学习非线性相关性,将4视角CCA嵌入递进框架。用大规模相似度学习方法改善CCA在度量方面存在的不足。对于有监督的跨模态检索,提出了两阶段深度学习算法。为了最大化有监督语义信息的作用,在两个阶段都采用有监督的学习。为了克服过拟合,在第一阶段的训练加入重构损失来约束相关性学习。在第二个阶段,提出了一个利用对比损失和中心损失联合优化的全卷积网络。最后应用到微软必应的图像检索竞赛中,验证了算法的有效性。