基于视频的面部动态表情识别

来源 :中国科学院大学 | 被引量 : 0次 | 上传用户:akuma7040
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
表情是人类表达情绪的一种基本方式,是非语言交流中的一种有效手段。心理学家认为,情感的表达7%通过语言,38%通过语言的辅助信息(如讲话的节奏,声音频率及语调轮廓等),55%则通过面部表情。由此可见,表情识别构成了情感理解的基础,是计算机理解人类情感的重要前提。近年来,随着人工智能与人机交互技术的发展,人脸检测、跟踪、识别技术的不断完善,面部表情识别逐渐成为模式识别领域的新热点,它不仅在理论上具有重要的研究意义,在实际生活中也有良好的应用前景。基于视频的动态表情分析,是面部表情识别中的一类典型问题。由于表情本质上是一种由情绪引发的表观变化,动态的视频序列能够包含更丰富的上下文信息,更符合表情的实际产生机理,从而对其描述更为真实准确。但另一方面,视频中所包含的复杂时序变化以及个体在展现表情时动作速率与方式的巨大差异,也给这种模态下的表情识别带来了巨大的挑战。如何寻找更鲁棒更具解释性的面部表情特征,以及如何在表情识别中排除身份信息与图像质量的干扰等,都是实际应用中亟待研究者解决的问题。  本文正是围绕上述基本问题,通过对视频表情识别的场景分析以及已有工作的回顾总结,针对视频场景下的动态表情识别问题提出了若干创新性方法,并利用已有国内外公开表情数据库从多角度对提出方案进行验证。论文的主要研究内容如下:  (1)提出了基于流形空间统计量的表情视频建模方法。针对视频图像帧间的人脸误配准(对齐)问题,该方法基于流形空间中的各种统计量对人脸表情视频进行建模,并通过核学习的方式实现了流形上的表情分类。具体实现中首先对图像提取任意形式的表观特征,然后利用线性子空间或协方差矩阵等二阶或高阶统计模型对图像的分布加以描述,从而得到集合(视频片段)的整体描述。为更好地捕捉人脸局部信息,我们进一步从单模型的全局模式扩展到多模型对应的局部表情模式,并利用流形空间的度量学习构造了基于表情原型模式的相似性特征。这种多模型表示引入了更丰富的信息,可以有效编码人脸局部的细节变化,在多个数据库上也表现出明显优于已有方法的性能。  (2)提出了基于时-空流形动态表情部件的特征学习方法。针对上一方法中统计量难以建模视频帧时序的问题,该方法首先将人脸表情视频中连续的局部表观变化建模为非线性时-空流形,为了实现视频的时序对齐,我们利用所有流形上的底层特征训练了包含多个局部模式类的通用流形模型,其中每个模式类对应于一组来自于不同时-空流形、具有某种相似性的底层特征,这种模式类可以看作对不同流形上相似特征的一种通用化抽象,我们称之为表情部件。任意一段流形向通用模型的拟合可实例化出其各自的表情部件,这样便间接实现了各个部件进而全局流形之间的隐式对齐。进一步地,我们在具有对应关系的表情部件上利用图嵌入框架进行了判别学习,在精简维数的同时增强了特征的描述性。该框架不仅适用于视频表情识别,也可作为通用的中层特征学习方法推广到一般的视频分类问题中。  (3)提出了基于可形变表情部件建模的三维深度卷积网络模型。该方法延续了上一方法对表情类别与其引发的运动部件的关联的探究,借鉴可形变部件模型的思想,将可形变表情部件的检测模块嵌入到三维深度卷积网络的框架中,实现运动部件定位与动态表情识别两个耦合任务的端到端联合学习。方法的动机在于,首先,深度卷积网络中显式地考虑了二维图形或三维视频中的空域局部性,可生成与可形变部件模型中梯度特征图类似的卷积映射图;此外,卷积网络的每层中包含多个可训练的滤波核,可以很自然地与可形变部件模型中设置的部件滤波器相对应。具体实现中,我们在基础三维卷积网络结构中增加了可形变表情部件层,将该层中的卷积核定义为部件滤波器,在结构化空间约束下进行特定部件的检测,最后根据最末层表情标签的监督对模型参数进行判别性学习。这种深度学习策略增强了不同功能组件之间的相互作用,从而获得了在全局上优化的模型。  综上所述,本文针对基于视频的面部动态表情识别问题进行了广泛而深入的研究,从基于流形的视频时序建模以及中层表情特征学习等角度出发,提出了多种创新的实用性方案,在进一步优化视频表情识别性能的同时,也强调了对表情在生理认知学中产生机理的探索。
其他文献
在过去的几十年中,人脸识别技术作为模式识别和计算机视觉领域的一大研究热点,得到了广泛的关注和深入的研究。然而21世纪是一个大数据的时代,获取具有同一主题的大量图像数据变
光纤通道、Infiniband和iSCSI是下一代SCSI传输机制的竞争者.该文分析了三种协议的不同部分,而且对它们是否满足SAN环境的需要进行了评估.iSCSI是SCSI远程过程调用模型在TCP
针对节点电量局限性问题,除了改进电源技术外,研究者还从MAC层和网络层协议角度提出了改进方案.该文侧重于AdHoc网络的连通寿命(从网络开始构成到产生网络分割的时间)问题的
该文在综述Web数据挖掘的分类、研究内容和目前的研究现状的基础上,明确了Web用户访问日志数据挖掘研究的难点在于:如何对原始日志数据进行预处理,其中包括如何确定用户事务,
在信息时代,用户产生内容、物联网、定位系统等技术和应用加快了数据产生的速度。为了解决海量数据的挑战,学术界和工业界提出了一系列新型的NoSQL数据库,并进行了广泛的应用。
Web图形交互应用是一类有着众多共性的软件应用领域,随着网络应用技术的不断发展,其应用范围也不断扩大,目前已经渗透到计算机应用的许多领域.为了总结Web图形交互应用领域先
自二十世纪六十年代以来,计算机动画发展迅速,其中的人脸表情动画是动画领域的重要组成部分。而传统的表情动画的自动生成方法耗时耗力,低成本的表情动画的自动生成方法一直是研
二十世纪九十年代出现的分布式对象技术,为网络软件的开发提供了强有力的解决方案。分布式对象技术是将面向对象技术与网络通信技术有机结合而发展形成的,主要是指在网络计算平
随着通信技术的迅速发展,Internet网络用途的扩大,网络规模也随之加大.大规模的网络要求高性能的互连设备,因此网络设备的性能问题越来越为广大网络建设者所重视.为了公正,客
面向对象分析是面向对象软件工程的一个组成部分.它通过类和对象模拟现实世界的实体属性及其行为的分析,发现现实世界系统的层次结构.面向对象分析方法还揭示了可以通过对象/