论文部分内容阅读
本论文主要研究噪声环境下语音检测的稳健性问题,从门限估计、稳健特征、突发性非语音段检测三个方面研究了加性噪声环境下的语音检测。论文还把用于语音检测的子带加权算法应用到噪声环境下的语音识别中。论文的主要贡献如下:
1)论文提出了基于模糊聚类和贝叶斯信息准则的语音检测稳健门限估计算法。算法是在讨论和分析了现有的基于初始化无声段、基于能量直方图和基于一阶自回归的门限估计算法的优缺点的基础上提出的。实验结果表明,提出的算法具有很好的稳健性,不需要初始化的无声段,能够快速的跟踪背景噪声的变化,找到合适的介于背景噪声能量和语音能量之间的检测门限,同时取得比较高的语音检测率和背景噪声检测率。
2)论文提出了低信噪比环境下基于异方差区分分析的稳健语音检测特征HDA-TFEV。算法是在讨论和分析现有的时域能量特征,TF特征和ATF特征的优缺点的基础上提出的。HDA-TFEV特征对子带能量采用优化的加权系数获得更好的语音-噪声区分性。实验结果表明,提出的HDA-TFEV特征在噪声环境下能够取得比时域能量特征、TF特征和ATF特征更好的语音检测性能,尤其是在低信噪比环境下。
3)论文提出了基于韵律信息的突发性非语音检测算法。利用归一化短时自相关函数峰值幅度序列的平滑度来区分语音段和非语音段。实验结果表明,提出的算法有很好的突发性非语音检测性能,而且计算量小,不依赖训练数据。作者还把这种突发性非语音检测算法和基于模糊聚类和贝叶斯信息准则的门限估计算法结合应用,取得了很好的电话语音检测效果。
4)此外,论文把在语音检测HDA-TFEV特征中应用的子带加权算法应用到噪声环境下的语音识别中,提出了基于子带信噪比加权的SNR-WMFCC特征。实验结果表明,SNR-WMFCC是一种比MFCC更加稳健的语音识别特征。
本文提出的语音检测算法已经在实际系统中得到应用。提出的子带加权算法,对于后续稳健性研究有促进意义。