论文部分内容阅读
最近研究表明局部模型是最精确的混沌时间序列预测方法之一。同时有研究表明汉语的元音和辅音具有不同程度的非线性。本文拟将局部线性模型引入到汉语语音建模和预测问题中。
传统的语音信号的生成模型可以看作是一个源-滤波器模型,通常滤波器是线性的或基于线性预测的。根据发音的不同,激励源可以认为是一个随机白噪声或一个简单脉冲串。虽然这种方法在过去的30年里取得了巨大的进步,但它忽视了语音中可能存在的非线性结构,在实际的应用中存在一些缺陷,例如,继续降低编码比特率难度增加,合成语音的自然度下降,区分不同语音的能力削弱等。
相空间重构是重要的非线性分析手段,它是通过一维的时间序列反向构造出原系统的相空间结构,从而可以通过重构的相空间研究未知系统的特性。本文对所有的汉语元音做了细致的相空间分析,结果表明,汉语元音的重构相空间有类似于混沌吸引子的结构。在足够高的采样频率下,是可以从重构相空间中将清辅音和随机时间序列区分开来的。
对语音信号建模的重要的意义在于可以利用建立的模型对信号进行预测,同时反过来可以根据预测的效果来判断模型的精确性。本文对所有的元音进行了局部线性预测分析,计算了误差-邻点数曲线,误差-嵌入维数曲线,误差-时间曲线。结果证实了汉语元音中含有非线性,这为语音信号非线性建模以及选择合适的模型参数提供依据。
作为局部线性预测的一个应用,提出了一种基于局部线性预测的编码方案。局部线性预测同时利用了时间邻近点和空间邻近点的相关信息,从而可以有效地消除浊音预测中的基音相关性,提高对连续语音的平均预测增益,从而提高整个编码器的性能。