论文部分内容阅读
在人机交互领域,传统的单语音识别技术在相对安静的环境下对连续的单词或短语能够达到较高的识别率。然而,将其应用到真实环境时,其识别能力通常会由于背景噪声等因素的影响受到极大的限制。人类的语言认知过程是一个多通道的感知过程,在现实语音交流中,人们在理解他人讲话内容时不仅通过声音来感受信息,而且还用眼睛观察对方口型、表情的变化,视觉信息作为一种重要的语音理解源,可以明显提升接受者的感知能力。因此,针对视听语音识别系统,本文主要研究了计算机视觉语音特征,并探讨了基于耦合隐马尔科夫模型的双通道语音识别算法。本文首先介绍了视觉语音研究的背景和意义,详细阐述了视觉语音研究的现状,分析了主流的方法,在此基础上,提出了本文基于声视频融合的中文汉字识别系统框架,该系统包括数据的采集和预处理、特征提取、特征分析以及融合与识别四部分。其中唇区视觉特征的检测提取与声视频信息融合是提高系统整体语音识别能力的关键,亦是本文研究的重点,本文主要工作如下:1)基于口型类的AAM模版。精确的特征点定位直接影响后期几何特征提取和内唇区域定位的准确性,鉴于唇部闭合与张口、内外唇嘴角点是否重叠等状态纹理差异较大,带来AAM自动特征点定位后,需要大量手工调整工作量,本文提出基于口型分类样本后,分别训练AAM模版,建立了3种典型的AAM模板:①闭嘴AAM模板;②”O”型AAM模板;③普通AAM模板。以提高特征点定位准确性,减少手工工作量。2)内唇纹理模型的构建。特征提取在语音识别中具有重要地位,得到的特征向量是否具有很好的反映对象本征特性能力,使对象具有可区分性,将直接影响识别率的高低。根据中文发音规律,为充分表现发音过程中牙齿和舌头的状态和形状信息,本文提出了几种基于统计特性的内唇纹理模型,包括内唇纹理统计直方图、分块的内唇纹理统计直方图、牙齿比例、分块内唇子空间均像素值、颜色矩和离散余弦变换,为构建视觉特征提供基础。3)视觉特征分析。为验证各内唇纹理模型的表征能力,以及RGB、HSV、Lab、YCrCb不同颜色空间分量建模各纹理模型的可分性,本文进行筛选比较实验,利用多种有监督的分类算法,把各个特征模型、不同色度空间分量描述模型应用于静态视觉语音图片的分类,根据分类正确率实现了颜色空间的选取以及不同的特征和特征组合的内唇纹理模型确定。并通过特征降维和归一化实现了内唇纹理特征与几何特征相结合的视觉语音模型。4)基于自建双模态数据库,实现了基于耦合隐马尔科夫模型(CHMM)中期融合策略的双模态中文字识别系统。主要工作包括:第一,通过限制信息流的状态数量和限制信息流之间的异步程度简化模型结构,并通过等效变换完成了基于传统HMM的CHMM算法实现,基于CHMM中期融合的视听语音识别系统既保留了视、音特征的独立性又实现了在时间上对视、音频流状态的异步过程建模。第二,进行了基于HMM和CHMM的单、双通道的对比实验,一方面进一步验证单通道各个特征模型的表征能力,另一方面验证了基于双模态的视听识别系统具有更好的识别效果。