论文部分内容阅读
情感计算是对与情感相关、来源于情感或者影响情感方面的计算,其目的是赋予智能机器感知,理解和表达各种情感状态的能力。情感识别是情感计算的关键研究内容,是实现和谐人机交互的重要基础。目前,情感计算主要以表情、姿态、语音、文本和生理信号为基础进行情感识别,其中语音信号,是情感信息表达的主要载体,且获取方便,越来越受到研究人员的重视。寻找能够准确表征语音情绪状态的特征参数和有效的情绪状态识别模型是语音情绪识别的主要困难,一直是研究的热点之一。本文主要以语音信息的情感特征参数和情感模型对四种情绪(happy, angry, sad, fear)识别的有效性为研究内容。首先,提取语音信号的样本熵作为一个表征语音情绪状态的特征参数,分析其在语音情绪识别中的区分性,并与传统的声学参数进行特征融合,用于情绪识别;然后,在传统BP网络基础上,结合基于贡献分析的PCA算法,建立了一种基于PCA贡献分析的神经网络语音情感识别模型。对实验结果的分析表明,对样本熵与传统的声学参数进行特征融合可以改进分类器的性能;基于PCA与神经网络建立的语音情感识别模型提高了识别效率。具体研究内容如下:(1)信号获取。根据语音情感信号的产生机理和国际上对情感类型的划分方法,综合比较国内外典型情感语音数据库,最终确定本文的情感类型划分方法和采用的情感语音库。(2)前期处理。对原始数据进行采样、量化、预加重、分帧、加窗等预处理后,针对端点效应问题,本文提出基于样本熵改进的两级判别端点检测算法。采用模糊C均值聚类算法和贝叶斯信息判决算法确定双门限阈值,将其作为第一级判别,初步判断信号的起止点,然后将修正的过零率作为第二级判别,最终确定信号的起止点。(3)特征提取与特征选择。本研究将样本熵及目前比较成熟的声学参数(包括语速、能量特征、基音频率、MFCC)及其统计参数,进行特征融合应用于语音情绪识别。采用PCA贡献分析对原始特征向量集合进行降维,得到最简约向量集,降低网络模型的复杂性,降低训练时间。(4)语音情绪识别模型。本文在传统BP网络基础上,结合基于贡献分析的PCA算法,建立一种基于PCA的神经网络语音信号情感识别模型。基于上述融合的特征,利用该情感模型对800个样本的四种情绪状态进行识别。实验结果分析表明:(a)样本熵是一个能够表征语音信号情感变化的有效参数。样本熵和传统声学特征参数的融合可以显著提高分类器的识别率,改善情感识别模型的性能。(b)基于PCA贡献分析的神经网络语音情感识别模型解决了传统BP算法计算量大,运算速度慢的问题,有效的提高了系统的识别效率。综合考虑以上分析,利用样本熵与传统声学参数进行特征融合,结合基于PCA的神经网络情感识别模型,可以建立有效的语音情感识别系统。