论文部分内容阅读
基于音视频的跨模态检索和匹配是一项寻找人脸和语音之间对应关系的任务,大量认知科学方面的研究已经证实了人类拥有匹配同一人的面部信息和声音的能力,这对于创建自然的人机交互系统以及其他多媒体应用很有启发意义。针对人脸语音等带有身份信息的音视频跨模态数据,本文通过以下几个方面进行人脸语音跨模态检索和匹配实验研究:(1)提出一种基于自编码器结构的的人脸语音跨模态说话人标注方法,并引入联合一致性原则,结合带有标签信息的训练数据,构建音视频跨模态检索和匹配模型。在特征提取阶段,利用基于卷积神经网络的方法提取人脸图像特征,利用基于深度信念网络的方法提取语音数据的特征,最终在自编码器模型的输出层接入softmax回归损失,加入有监督训练策略,并针对跨模态交叉信息扩展为三种不同的模型结构。(2)提出一种基于协同注意力机制的人脸语音跨模态匹配和检索模型,为了更好的融合语音和人脸信息,在特征提取阶段,利用VGG-16和Soundnet提取人脸和语音特征。该模型学习人脸图像特征和语音特征之间的共同子空间嵌入,引入联合自注意力机制强化原始特征的相关性,并采用三重正负样本的训练方法,使共同子空间上的模态内距离较小,模态间距离较大,从而更好地实现跨模态人脸语音匹配和检索任务。(3)提出一种基于长短时记忆门的动态跨模态检索和匹配模型,针对来自于与同一段视频同时产生的人脸面部运动序列和声音序列数据,基于VGGface提取人脸关键点特征,对声音序列提取梅尔谱图特征,通过基于LSTM的编码器和解码器模型,最小化隐藏层Huberloss距离和帧间约束,实现动态序列人脸语音的相互检索和匹配。本文提出的三种音视频跨模态检索模型在情景剧数据集和名人数据集上进行了充分实验,在大规模多类别任务和动态任务上相较于现有方法有了明显的提升,对基于音视频的人脸语音匹配检索任务进行了深度研究。