论文部分内容阅读
人脸感知可由分析与合成人脸两部分构成。人自身对人脸非常熟悉和敏感。人可以轻而易举地识别出不同的人脸、不同的人脸表情,并可在脑海中浮现出不同人脸的形状,艺术家可以描绘出神态各异的人脸。然而这种对于人来说与生俱来的分析与合成能力对计算机而言却非常地困难。机器学习提供了一种可能的解决途径。 本文围绕人脸这个对象,以基于学习的方法为主线,研究了基于视频流的人脸运动数据获取的分析算法和基于图像的人脸建模、超分辨率、表情幻想等合成算法。 文中首先讨论了基于图像的个性化人脸建模。提出一种基于合成分析的个性化人脸三维模型建模方法,通过分析合成的人脸图像纹理与输入图像纹理的差异,使用纹理差异来指导对人脸网格进行局部自适应细分,进而对合成的人脸三维模型不断地调整,从而使得最终生成的人脸三维模型具有更高的真实感。 为了从视频流中提取基于人脸面部特征的运动数据,本文研究了人脸多特征跟踪算法。先后提出了基于贝叶斯网络增强预测模型的跟踪方法和基于时空概率图模型的跟踪方法。后者将传统的单特征跟踪器——粒子滤波与信任度传播算法成功地结合在一起。首先在时间域上,使用几个相互独立的Condensation类型的粒子滤波器分别跟踪人脸的每个特征。粒子滤波对独立的视觉跟踪问题非常有效,但是多个独立的跟踪器忽视了人脸的空间约束和人脸特征间的自然相互联系。然后在空间域上,事先从人脸表情库中学习人脸特征轮廓的相互关系,使用贝叶斯推理—信任度传播算法来对人脸特征的轮廓位置进行求精。 有些已经存在的视频流中人脸区域太小,以至于无法对人脸特征进行有效的跟踪,为此本文对图像中的人脸进行了超分辨率(Super-resolution)研究。提出基于steerable金字塔和贝叶斯估计的人脸超分辨算法。采用steerable金字塔学习人脸图像中的低层次局部特征的空间分布,并结合塔状的父结构和局部最优匹配算法来预测最佳先验模型;然后将先验模型结合到贝叶斯最大后验概率框架中;最后使用最速下降法(Steepest Descent)求出最优的高分辨率人脸图像。 基于人脸照片总是具有最高的真实感这一出发点,为了合成具有真实感的未知人脸表情,本文提出人脸表情幻想(Hallucination)的新方法。给定某个人中立的人脸图像,可以使用流形学习等方法预测出他的其它表情人脸图像。与现有的表情克隆或者图像类比方法不同,本文在一个人脸表情库的帮助下来幻想出合理的人脸表情。在第一步中,使用非线性流形学习来获取对未知人脸表情的一个平滑估计。在第二步中,使用马尔可夫网络来学习训练库中中立与具有表情的残差人脸图像中低层次人脸特征的相互关系,然后使用信任度传播算法来推理出该人的具有表情的残差人脸图像。通过把这两步结合在一起,获得最终的结果。 在每一章的实验部分,给出了对如上人脸感知—人脸跟踪与合成算法的分析和原型实现。另外一些相关算法也逐步集成到正在构建的基于视频流的真实感人脸动画系统中。关键词:模式识别,计算机视觉,机器学习,图像/视频理解,人脸分析与识别,人脸跟踪,人脸合成,贝叶斯理论,概率图模型,流形学习第2页