基于语音识别技术的视频检索方法研究

来源 :长春工业大学 | 被引量 : 0次 | 上传用户:jizhidong2009
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
随着媒体数字化技术和网络技术的发展,人们在日常生活中所接触到的数字视频越来越多。相应的,对数字视频进行分析和查找的需求也越来越迫切。因此,基于内容的视频处理和检索已成为近年来多媒体处理、信息检索以及数据管理研究领域的重要课题之一。 视频是由图像和音频组成的一个有机整体。经过近些年的研究,越来越多的研究者发现音频流所包含的语义信息通常要比图像流丰富,而且从音频流中提取语义信息也更加直观方便。语音是一种特殊类型的音频,它可以通过语音识别技术与文本互相转换,之后利用文本检索技术进行概念检索,获得更准确的检索结果。因此,基于语音识别技术的检索方法可以方便、高效地对用户所提交的语义需求进行视频检索。 结合视频本身的特点,本文在传统的音频处理技术的基础上,讨论了检索系统中提取、分析和利用语音信息的算法和框架。其中,主要涉及三种技术:语音特征分析与提取、语音分割和基于语音识别技术的视频标引与检索方法。 语音特征方面,本文分析了多种音频特征以及语音在不同音频特征上的特点。由于人尤其是说话人是最常见和最重要的检索目标之一,本文还对不同说话人的特征进行了进一步的讨论。对于特征的提取,本文重点介绍了基于音色的特征提取方法和基于说话人的特征提取方法。 从音频中分割语音数据是在视频中应用语音信息的基础。利用分析与提取得到的语音特征,在特征发生突变的地方进行切分,是语音分割的基本思想。本文就语音的分割算法,分别讨论了基于相关性分析的端点检测、基于熵和能量的语音端点检测算法和基于说话人特征的分割方法。 最后,本文针对视频标引与检索问题,提出了一种多媒体数据流的描述模型。把视频流看作是图像与音频数据以一种持续的密切结合的形式组成的数据流整体。并以此为基础研究多媒体数据流的分类、分割及同步描述,近而进行基于内容的分析与检索。 除此之外,利用本文提出的方法,通过搭建的检索系统平台,针对新闻节目进行了测试。实验结果表明其检索结果较为准确,而且检索时间令人满意。
其他文献
框架和构件技术是现阶段软件工程的一个重要研究领域,随着软件系统规模的不断扩大,整个系统的结构显得愈发重要。另一方面随着系统复杂性的不断提高,设计模式技术应运而生,设计模
随着计算机和通信技术的发展,网络已经成为全球信息基础设施的主要组成部分,但随之而来的是不断暴露的网络安全问题。对目前绝大多数只采用防火墙进行安全保护的内部网络来说,仍
随着网络技术的发展,Internet已逐渐成为现代社会不可缺少的部分。同时网络安全问题也日益突出,层出不穷的网络病毒和黑客攻击越来越成为人们关注的焦点。目前对入侵防范主要
软件复用是解决软件危机的一条切实可行的途径。为此,不仅要有可复用软件资源库(以下简称复用库),还要使复用者能高效地找到合适的可复用软件资源。目前存在许多复用库按不同的
虚拟服装建模在服装工业、影视及游戏、电子商务等诸多领域都有着广泛应用,一直是计算机图形学领域的研究热点和难点,直到现在快速、逼真的布料模拟的实现仍然是一个挑战。本文
随着信息技术、多媒体技术和互联网技术的快速发展,人们可以更加方便地获取一幅数字图像。然而,人们在享受数字图像带来快乐的同时,也被一些无法识别的伪造图像的肆意传播所困扰
随着图像等多媒体资源的日益丰富,基于关键字和描述文本的传统检索方式已不能再满足检索需求,有效地管理海量数据资源的需求变得日益迫切。基于内容的图像检索技术于是应运而生
博客(Blog)作为一股正在迅速崛起的新的网络变革力量,它的出现丰富和改变了网络的内涵,影响了人们的信息传递方式,在最近几年的时间里迅猛发展,对人们的影响也越来越大。而随
当前,Web已经成为人们获取信息的主要渠道之一。然而,用于表达Web页面信息的HTML语言存在着与生俱来的缺点。HTML的“标记”只是告诉浏览器如何显示所定义的信息,却不包含任何语
随着计算机技术和网络应用的迅猛发展,人们的日常生活与工作越来越趋于数字化和网络化。大量数据在网络上的传播、网络交易的日益风行,使传统的版权保护手段和数据安全技术面