论文部分内容阅读
表情是人类表达情绪的一种基本方式,是非语言交流中的一种有效手段。心理学家认为,情感的表达7%通过语言,38%通过语言的辅助信息(如讲话的节奏,声音频率及语调轮廓等),55%则通过面部表情。由此可见,表情识别构成了情感理解的基础,是计算机理解人类情感的重要前提。近年来,随着人工智能与人机交互技术的发展,人脸检测、跟踪、识别技术的不断完善,面部表情识别逐渐成为模式识别领域的新热点,它不仅在理论上具有重要的研究意义,在实际生活中也有良好的应用前景。基于视频的动态表情分析,是面部表情识别中的一类典型问题。由于表情本质上是一种由情绪引发的表观变化,动态的视频序列能够包含更丰富的上下文信息,更符合表情的实际产生机理,从而对其描述更为真实准确。但另一方面,视频中所包含的复杂时序变化以及个体在展现表情时动作速率与方式的巨大差异,也给这种模态下的表情识别带来了巨大的挑战。如何寻找更鲁棒更具解释性的面部表情特征,以及如何在表情识别中排除身份信息与图像质量的干扰等,都是实际应用中亟待研究者解决的问题。 本文正是围绕上述基本问题,通过对视频表情识别的场景分析以及已有工作的回顾总结,针对视频场景下的动态表情识别问题提出了若干创新性方法,并利用已有国内外公开表情数据库从多角度对提出方案进行验证。论文的主要研究内容如下: (1)提出了基于流形空间统计量的表情视频建模方法。针对视频图像帧间的人脸误配准(对齐)问题,该方法基于流形空间中的各种统计量对人脸表情视频进行建模,并通过核学习的方式实现了流形上的表情分类。具体实现中首先对图像提取任意形式的表观特征,然后利用线性子空间或协方差矩阵等二阶或高阶统计模型对图像的分布加以描述,从而得到集合(视频片段)的整体描述。为更好地捕捉人脸局部信息,我们进一步从单模型的全局模式扩展到多模型对应的局部表情模式,并利用流形空间的度量学习构造了基于表情原型模式的相似性特征。这种多模型表示引入了更丰富的信息,可以有效编码人脸局部的细节变化,在多个数据库上也表现出明显优于已有方法的性能。 (2)提出了基于时-空流形动态表情部件的特征学习方法。针对上一方法中统计量难以建模视频帧时序的问题,该方法首先将人脸表情视频中连续的局部表观变化建模为非线性时-空流形,为了实现视频的时序对齐,我们利用所有流形上的底层特征训练了包含多个局部模式类的通用流形模型,其中每个模式类对应于一组来自于不同时-空流形、具有某种相似性的底层特征,这种模式类可以看作对不同流形上相似特征的一种通用化抽象,我们称之为表情部件。任意一段流形向通用模型的拟合可实例化出其各自的表情部件,这样便间接实现了各个部件进而全局流形之间的隐式对齐。进一步地,我们在具有对应关系的表情部件上利用图嵌入框架进行了判别学习,在精简维数的同时增强了特征的描述性。该框架不仅适用于视频表情识别,也可作为通用的中层特征学习方法推广到一般的视频分类问题中。 (3)提出了基于可形变表情部件建模的三维深度卷积网络模型。该方法延续了上一方法对表情类别与其引发的运动部件的关联的探究,借鉴可形变部件模型的思想,将可形变表情部件的检测模块嵌入到三维深度卷积网络的框架中,实现运动部件定位与动态表情识别两个耦合任务的端到端联合学习。方法的动机在于,首先,深度卷积网络中显式地考虑了二维图形或三维视频中的空域局部性,可生成与可形变部件模型中梯度特征图类似的卷积映射图;此外,卷积网络的每层中包含多个可训练的滤波核,可以很自然地与可形变部件模型中设置的部件滤波器相对应。具体实现中,我们在基础三维卷积网络结构中增加了可形变表情部件层,将该层中的卷积核定义为部件滤波器,在结构化空间约束下进行特定部件的检测,最后根据最末层表情标签的监督对模型参数进行判别性学习。这种深度学习策略增强了不同功能组件之间的相互作用,从而获得了在全局上优化的模型。 综上所述,本文针对基于视频的面部动态表情识别问题进行了广泛而深入的研究,从基于流形的视频时序建模以及中层表情特征学习等角度出发,提出了多种创新的实用性方案,在进一步优化视频表情识别性能的同时,也强调了对表情在生理认知学中产生机理的探索。