基于音视频的跨模态说话人检索和识别

来源 :华侨大学 | 被引量 : 0次 | 上传用户:xiaokexiaoai1314
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
基于音视频的跨模态检索和匹配是一项寻找人脸和语音之间对应关系的任务,大量认知科学方面的研究已经证实了人类拥有匹配同一人的面部信息和声音的能力,这对于创建自然的人机交互系统以及其他多媒体应用很有启发意义。针对人脸语音等带有身份信息的音视频跨模态数据,本文通过以下几个方面进行人脸语音跨模态检索和匹配实验研究:(1)提出一种基于自编码器结构的的人脸语音跨模态说话人标注方法,并引入联合一致性原则,结合带有标签信息的训练数据,构建音视频跨模态检索和匹配模型。在特征提取阶段,利用基于卷积神经网络的方法提取人脸图像特征,利用基于深度信念网络的方法提取语音数据的特征,最终在自编码器模型的输出层接入softmax回归损失,加入有监督训练策略,并针对跨模态交叉信息扩展为三种不同的模型结构。(2)提出一种基于协同注意力机制的人脸语音跨模态匹配和检索模型,为了更好的融合语音和人脸信息,在特征提取阶段,利用VGG-16和Soundnet提取人脸和语音特征。该模型学习人脸图像特征和语音特征之间的共同子空间嵌入,引入联合自注意力机制强化原始特征的相关性,并采用三重正负样本的训练方法,使共同子空间上的模态内距离较小,模态间距离较大,从而更好地实现跨模态人脸语音匹配和检索任务。(3)提出一种基于长短时记忆门的动态跨模态检索和匹配模型,针对来自于与同一段视频同时产生的人脸面部运动序列和声音序列数据,基于VGGface提取人脸关键点特征,对声音序列提取梅尔谱图特征,通过基于LSTM的编码器和解码器模型,最小化隐藏层Huberloss距离和帧间约束,实现动态序列人脸语音的相互检索和匹配。本文提出的三种音视频跨模态检索模型在情景剧数据集和名人数据集上进行了充分实验,在大规模多类别任务和动态任务上相较于现有方法有了明显的提升,对基于音视频的人脸语音匹配检索任务进行了深度研究。
其他文献
光正交频分复用(O-OFDM)技术融合了光纤通信技术和正交频分复用(OFDM)技术的优点,而逐渐成为一种新兴的光传输技术。随着现场可编程门阵列(FPGA)技术的日益成熟,基于FPGA的O-
在各种模式分类问题中,半监督学习算法在利用未标记样本数据方面比一些监督学习算法和无监督学习算法有着更好的优势。半监督判别嵌入算法(Semi-supervised discriminant emb
位置服务已经在国内外各行各业都具有广泛的应用前景。但是位置服务技术发展离不开定位导航技术,尤其是室内定位导航,还需攻克很多的技术难点。—本文依托TC-OFDM室内外无缝
高能量的超短脉冲皮秒激光因其具有高峰值功率、高光束质量及理想的时间和空间波形被应用于医疗、工业加工及军用等诸多领域。采用传统技术手段获得高能皮秒脉冲激光造价高昂
岩性识别与分类是区域地质调查和矿产资源勘查中的核心工作内容。岩石为矿物的集合体,受内、外动力地质作用可形成不同的地形地貌,地形因子是由数字高程模型(DEM)所派生的,对
第一部分许兰毛癣菌的表型与基因型研究目的:了解我国新疆和华东地区许兰毛癣菌的分子流行病学特征,并研究其基因型与表型和地域来源之间联系。方法:(1)收集我国新疆和华东地
地理空间框架属于我国空间信息基础建设的重点项目,促进我国经济社会信息化的发展。地理信息数字化为社会发展、民众生活带来有力的辅助和支撑。而数字辛集地理空间框架建设
热带气旋潜在生成指数(GPI,Genesis Potential Index)是热带气旋生成可能性大小的空间分布函数,该指数包含了850hPa绝对涡度、600hPa相对湿度、垂直风切变和最大潜在强度四个
为了有效利用云计算技术提供高质量医疗服务,医疗数据被外包至医疗云中进行存储和管理。但是,将医疗数据外包给云仍存在着诸多安全问题。其中如何保护医疗云数据的完整性是重
“现在是了解过去的钥匙”。了解现代花粉组合与植被和气候的关系以及现代炭屑与森林火灾的关系,是根据化石花粉/炭屑记录重建古植被、古气候和古火灾的依据。为此,本研究在