论文部分内容阅读
如何能够在一个复杂的音频环境下检测音频事件并进行相关语义分析研究在多媒体检索、安全领域和移动机器人领域等都有广泛的应,成为基于内容的音频语义分析和检索的热点问题,然而这尚未得到很好解决,主要难点在于它针对的是复杂的音频环境,导致音频事件类内变化不一、背景噪声容易淹没目标音频事件,并且还有大量容易混淆的音频事件,关键音频事件在整个音频流里的比例很小,数据不平衡导致检测结果的精度较低,无法满足应用需求。在复杂音频环境下进行音频事件检测和语义分析研究需要解决的问题有:音频事件定义、特征的区分性、模型选择、检测策略等。本文主要针对电影、电视剧、新闻联播等复杂音频环境,探索音频事件检测和语义分析研究方法和技术。研究在复杂音频环境下单一音频事件检测、关键音频事件检测、基于无监督的音频事件提取和场景分割等理论和实际应用相关问题,重点研究音频事件建模、检测策略、无监督方法应用,并针对数据不平衡和高层语义分析—场景分割问题做初步探讨和研究。因此,文本的主要工作如下:1.单一音频事件检测技术研究基于预分割的单一音频事件检测技术研究是复杂音频环境下音频事件检测和研究的基础。文本利用单一音频事件检测方法,针对新闻联播中说话人场景识别这一实际问题,在前人研究基础上,利用SVM模型识别场内和场外这两种单一音频事件,并用有限状态机对识别结果进行平滑,在测试集上的精度和召回率分别达到了81.25%和82%。针对不平衡数据集分类问题进行了初步的研究。提出了欠采样改进的办法,在正确类样本正确分类率下降不多的前提条件下,使分类器对错误类样本的正确识别率提高了5.4%。2.关键音频事件检测研究关键音频事件检测在广告检测、安全监控等领域中有广泛应用,在理论和实际应用中都有重要的研究意义,也是本文研究的重要方面。本文以检测电影音频中的爆炸声为例,提供复杂音频环境中关键音频事件检测的一般方法,通过选择合适的特征,利用基于Adaboost的决策树分类器建模,采用多级检索策略并对检测结果平滑处理,爆炸声的检测平均精度和召回分别为78.4%、81.2%,实验表明本文提出的方法具有良好的爆炸声检测性能。3.基于无监督的音频事件提取和场景分割研究基于有监督的音频事件检测方法受训练语料的约束,是个领域相关问题,推广能力有限。本文尝试使用无监督的方法提取音频事件并探索高层语义—场景分割研究,提出领域无关的关键音频事件检测通用方法。本文迭代使用基于幅度因子的谱聚类提取音频事件、并利用文本分析中的TF/IDF准则计算音频事件权重,得到关键音频事件,在此基础上,加入利于规则方法进行场景分割,取得不错的效果。