论文部分内容阅读
从九十年代初期开始,基于内容的多媒体检索一直是计算机领域的研究热点。认知心理学的研究表明人脑对外界事物的认知需要跨越不同感官传递的信息以作出综合的判断,类似地,人们对多媒体数据的检索需求是要能够灵活跨越不同类型的多媒体数据(如图像、音频等),以形成对多媒体语义的整体理解。这就需要有一种新的检索方式能够处理和查询不同类型的多媒体数据,本文的目的便是研究这种灵活跨越不同类型多媒体数据的检索方式——跨媒体检索。针对图像、音频等多媒体数据在底层内容特征上的异构性和不可比性使得难以计算跨媒体相关性的现状,本文以典型相关性分析为突破点,研究了图像和音频在内容特征上潜在的统计关系,并且在特征降维的同时最大程度地保持了相关性学习结果,从而通过自定义的距离函数实现了跨媒体的相关性度量;还进一步提出了基于增量学习的相关反馈机制,从用户交互过程中提取先验知识,以修正图像和音频数据集在同构子空间中的拓扑结构,从而有效缩小了底层内容与高层语义之间的鸿沟,提高了跨媒体检索效率。大量研究证明流形结构在多媒体数据表达方面可以发现非线性的数据关系,本文提出一个流形子空间讨算方法,用来模拟文本、图像和音频数据在语义空间上的分布关系。该方法通过计算多媒体数据的本征距离矩阵,在此基础上求取语义子空间的本征参数,从而得到内嵌的非线性的流形子空间作为语义子空间;同时给出了短期修正和长期修正两种策略用以结合相关反馈信息来更新流形结构。针对Web环境中多媒体数据集之间特有的跨媒体数据关系,提出以Web页面中的多媒体对象为最小数据单元,建立跨媒体关联图用以综合表达在内容特征、链接关系和用户交互三方面的数据关系;提出全局相关性推理算法充分利用跨媒体关联图中各种数据关系之间的互补性,从而准确找到跨媒体的相关对象;提出用隐性语义索引分析图像的视觉特征和音频的听觉特征之间的互索引关系,并通过交互式的相似度传递优化了图像和音频的聚类质量,设计了主动学习策略用以计算用户标注的反馈样本周围未标注样本的的条件概率,加速了图像和音频之间跨媒体检索的收敛过程,而且当查询例子不在数据库中时也能取得较好的检索性能。在数据管理方面,针对多媒体资源数据量大、存储分散等特征,本文从信息共享这个基本问题出发,尝试将数字图书馆中海量、分布的多媒体数据资源用网格技术进行管理,给出了初步的技术方案和体系设计,以及仿真实验结果。