论文部分内容阅读
随着媒体数字化技术和网络技术的发展,人们在日常生活中所接触到的数字视频越来越多。相应的,对数字视频进行分析和查找的需求也越来越迫切。因此,基于内容的视频处理和检索已成为近年来多媒体处理、信息检索以及数据管理研究领域的重要课题之一。
视频是由图像和音频组成的一个有机整体。经过近些年的研究,越来越多的研究者发现音频流所包含的语义信息通常要比图像流丰富,而且从音频流中提取语义信息也更加直观方便。语音是一种特殊类型的音频,它可以通过语音识别技术与文本互相转换,之后利用文本检索技术进行概念检索,获得更准确的检索结果。因此,基于语音识别技术的检索方法可以方便、高效地对用户所提交的语义需求进行视频检索。
结合视频本身的特点,本文在传统的音频处理技术的基础上,讨论了检索系统中提取、分析和利用语音信息的算法和框架。其中,主要涉及三种技术:语音特征分析与提取、语音分割和基于语音识别技术的视频标引与检索方法。
语音特征方面,本文分析了多种音频特征以及语音在不同音频特征上的特点。由于人尤其是说话人是最常见和最重要的检索目标之一,本文还对不同说话人的特征进行了进一步的讨论。对于特征的提取,本文重点介绍了基于音色的特征提取方法和基于说话人的特征提取方法。
从音频中分割语音数据是在视频中应用语音信息的基础。利用分析与提取得到的语音特征,在特征发生突变的地方进行切分,是语音分割的基本思想。本文就语音的分割算法,分别讨论了基于相关性分析的端点检测、基于熵和能量的语音端点检测算法和基于说话人特征的分割方法。
最后,本文针对视频标引与检索问题,提出了一种多媒体数据流的描述模型。把视频流看作是图像与音频数据以一种持续的密切结合的形式组成的数据流整体。并以此为基础研究多媒体数据流的分类、分割及同步描述,近而进行基于内容的分析与检索。
除此之外,利用本文提出的方法,通过搭建的检索系统平台,针对新闻节目进行了测试。实验结果表明其检索结果较为准确,而且检索时间令人满意。