论文部分内容阅读
随着语音识别技术的发展,语音识别系统的系统性能有了很大的提高。
目前,建立起来的语音识别系统已经在某种程度上获得广泛认同,这是基于概率统计的一种系统结构。按照不同的功能可以将语音识别系统划分成不同的模块,这样的系统结构是基于整个语音识别的,即无论是说话内容识别还是说话人识别。一个完整的语音识别系统包括对信号的预处理、特征信号的提取、训练语音,模式匹配、判决等多个部分。每个部分在功能上可以是独立的,不同模块相互配合完成语音识别系统整体功能。因此每个部分都相当重要。按照识别的对象不同分类,语音识别可分为说话内容识别和说话人识别两类。这一技术在通信,安全,人工智能等多领域都有着广泛的应用前景。本课题研究的只要就是说话人身份识别系统中的特征信号的提取及处理这一部分。
语音信号特征提取主要是通过对语音信号的处理分析得到其中一些能够体现共性或特性的信息。这些信息的表现为一系列的数组或矩阵,而相关的语音信息则暗藏在数字元素的数值及相互关系之中。研究语音就是研究如何将语音信号转换成数值,以及如何理解数值之间的关系。
本文在系统介绍语音识别中说话人识别系统的基础上,着重阐明不同语音特征提取方法的实现。文章分析了能体现语音特性的一些基本语音处理方法(包括分帧加窗处理,短时能量和短时平均幅度,短时平均过零率,短时自相关函数及短时傅立叶变换);介绍了目前主流的特征提取方法的原理及实现(线性预测分析(LPC)及预测倒谱系数(LPCC),及美尔倒谱系数算法(MFCC));比较不同方法,不同参数,不同阶数对语音识别的识别率的影响。最后提出了MFCC算法一些改进意见。
本课题对语音信号的基音信号做了进一步分析,在基音分析的基础上提出了利用基音特征来区分说话人性别的的一种方式。并通过贝叶斯网络将基音与MFCC结合,通过概率统计的方法判别语音的性别,进而达到减小匹配样本个数,提高语音识别的效率的目的。