论文部分内容阅读
【摘要】近年来,许多研究人员在文本信息、图形图像信息检索技术的基础上,对视频信息检索技术进行了大量的研究,研究内容涉及视频信息的存储组织、内容分析、特征抽取、索引方法、匹配算法、检索算法、检索结果的评估和视频信息的表现形式等诸多方面。本文在分析视频信息的隐含结构基础上,研究视频信息的索引对象、索引模型和索引结构。
【关键词】数字视频;信息索引;系统模型;结构
1. 视频信息的隐含结构与索引对象
对视频信息进行“结构化”,并针对不同的结构层次对象进行索引,是实现基于内容的视频信息检索的基础。
1.1视频信息的隐含结构。视频是内容随着时间变化的图像序列,其最小组成单位是帧(Frame),视频信息的这种隐含结构,可用如下的数学模型表述:
shot={frame[,i]│i>1}
1.2视频索引对象的分割与选取。视频信息蕴涵着帧、镜头、场景、故事单元和节目这样的层次型结构,为了满足不同的应用需求,视频信息的索引应在各个层次上分别展开,即对视频信息的索引,不仅要以节目为对象,而且需要在视频分割的基础上以帧、镜头、场景和故事单元为对象分别进行索引。节目和帧是视频信息固有的自然层次,而镜头、场景和故事单元则要通过对视频内容的分析、采用各种算法进行分割才能得到。
1.3视频索引对象的数据结构。
1.3.1数据模型是直接面向计算机系统(数据库)中数据的逻辑结构。在常见的数据库系统中,根据实体集之间的不同结构,通常把数据模型分为层次模型、网状模型、关系模型和面向对象模型四种。目前成熟的、主流的数据库管理系统绝大多数是采用关系模型,并在此基础上扩展了面向对象的程序设计功能。鉴于这种情况,可以考虑视频索引对象的数据结构采用如下的关系数据模式:
节目Program(节目号pNO,索引信息p)
故事单元Story Unit(节目号pNo,故事单元号uNO,索引信息u)
场景Scene(节目号pNo,故事单元号uNO,场景号eNO,索引信息e)
镜头Shot(节目号pNo,故事单元号uNO,场景号eNO,镜头号sNO,索引信息s)
代表帧KeyFrame(节目号pNo,故事单元号uNO,场景号eNO,镜头号sNO,帧号fNO,索引信息f)
1.3.2在实现时,节目号由分类号和编号两部分组成,其中分类号应采用类似于中图分类号的编码体系,分类方法可参考TV-Anytime论坛制定的分类策略(SP003v13[12]);故事单元号、场景号、镜头号和帧号可采用视频片段的起止时间码(SMPTE使用的时间码格式为:<小时:分钟:秒:帧>);各索引对象的索引信息可根据后续讨论的索引模型创建。
2. 视频信息的索引模型
2.1视频信息的内容模型。视频包含有丰富的信息内容,可分为三个层次:第一层(低层)为用户观看视频时首先感知的视觉信息,如颜色、纹理、形状、运动等;第二层(中间层)为通过逻辑推理而得的、基于对象(Object)的感知信息,如视频中包含(描述)的人物、地点、时间等;第三层(高层)为通过智能推理而得的、基于知识(Knowledge)的感知信息,它反映了视频本身的语义,以及由此而来的感受,如某视频片段为暴力镜头、欢庆场景、劫机事件等等。这种视频内容建模方式为基于内容的视频信息索引提供了有益的指导。
2.2视频信息的描述需求与索引模型。
2.2.1视频信息内涵的丰富性、用户检索需求的多样性,决定了在对视频信息进行索引时,应尽可能地从各个层次和侧面进行全方位的描述。根据MPEG-7的目标要求,对视频信息的描述至少应包括如下的信息:
(1)有关内容的产生和发展进程的描述信息(如导演/作者、标题、版本等)。
(2)与内容使用有关的信息(如版权、使用历程、宣传计划等)。
(3)有关内容存储特性的信息(如存储格式、编码等)。
(4)有关内容的低层特性的信息(如颜色、纹理、音质、音调描述等)。
(5)从内容捕捉到的实体的概念化信息(如对象和事件,对象间的交互作用等)。
(6)利于浏览视频内容的信息(如概要、变更、空间和频率等)。
(7)关于用户和内容交互作用的信息(如用户选择、使用历史等)。
2.2.2根据MPEG-7提出的描述要求及视频内容分类模型,可将视频信息的索引分为外部信息索引和基于内容的索引。
2.2.3外部信息索引是指基于视频文档外部的、不依赖于其内容的信息索引,用于视频文档的标识和检索,如标题、作者、时间、文档大小、存储格式与编码格式、使用信息(软硬件要求、使用要求、版权等)等等。
2.2.4基于内容的索引又可以分为结构索引、低层特征索引、中间层对象索引和高层语义索引。结构索引是指节目、场景、镜头、帧之间的层次结构与关系等;低层特征索引是基于视频信息的物理特征信息(如颜色、纹理、运动、音质、音调等)进行索引;中间层的索引是对视频中可识别对象(如时间、地点、人物等)的索引;高层语义索引用于描述视频中包含的事件及相关的感受。
2.3视频对象与索引类型的关系。
(1)不同(层次)的视频对象对应着不同的索引。帧的索引包含低层特征索引、中间层对象索引和高层语义索引。其中,低层特征可以自动地提取,中间层对象可以采用人工或半自动化(基于图像识别技术)的方式进行标引,高层语义可以采用人工输入方式进行标引。镜头的索引主要是中间层对象索引和高层语义索引。其中,镜头的中间层对象描述是在帧的中间层对象描述基础上进行扩充,高层语义可以采用人工输入与自动提取(主要是指利用语音识别与文字识别等技术直接从视频信息中提取)相结合的方式生成。 (2)场景和故事单元的索引主要有结构索引和高层语义索引。其结构索引用于描述镜头之间的关系,高层语义索引描述的是在镜头语义基础上形成的叙事(故事)情节。节目的索引包含外部信息索引、结构索引和高层语义索引。
2.4索引类型与检索方式的关系。视频信息的检索主要有三种类型,即结合在线相关反馈机制的基于示例的检索(Query-by-Example)、基于关键词检索(Query-by-Keyword)和基于导航机制的视频浏览(Video Browsing)。
3. 存在的问题及探讨
面对急剧增长的视频信息,如何高效且合理地对其进行索引是视频信息重用和消费的基础。虽然近年来的研究已取得不少的进展,但仍然存在许多有待解决的问题。有些问题是属于“技术”层面的,如视频分割、代表帧提取、图像理解、文字识别、语音识别等,有些问题是属于“非技术”层面的,如视频元数据标准、文本描述的规范性、视频作品的规范化等。下面就一些“非技术性”问题进行探讨。
3.1视频信息的元数据标准。
(1)信息的索引描述是信息的元数据,索引项的确立依赖于元数据标准的制定。针对不同的资源类型、不同的用途、不同的机构建立了多种不同的元数据标准。随着数字视频技术的发展,针对数字视频信息的元数据研究也在不断地深入,并已出现了一些基于不同目标的元数据模式或标准,如数字电视元数据标准(DVB-SI、TV-Anytime和SMPTE等)、视频软硬件厂商推出的元数据标准(Apple公司的QuickTime、Microsoft公司的Windows Media等)以及MPEG-7等。
(2)由于视频信息本身固有的复杂性,使得视频信息在创建、存储、传输和使用等过程中需要不同的管理信息(元数据)。笔者认为,根据视频元数据的发展现状,在研究和制定元数据标准时应注意三点:一是这些元数据标准应整合在统一的框架之内,在统一的视频元数据框架基础上形成面向不同应用的子集;二是视频元数据标准应适应MPEG制定的“多媒体描述框架”——MPEG-7标准;三是采用通用的XML语言语法。
3.2文本索引信息的规范性。
(1)虽然基于示例的视频检索是最简便的检索手段,但用户往往不会有现成的示例,且目前现有技术很难高效地为普通用户提供一个初始查询示例。目前来看,利用文本信息对视频信息进行索引(即基于关键字的视频检索),既符合一般用户的检索习惯,又可借助日趋成熟的文本检索技术。文献 较为深入地探讨了基于文本信息的视频索引及其相关技术,特别是文本信息获取的途径。
(2)在采用文本信息对视频信息进行索引(包含外部信息索引、中间层对象索引和语义索引)时,无论这些文本信息是人工输入的,还是自动提取或生成的,均需要考虑文本描述的规范性,即如何对视频信息的某种特征和属性(如视频节目的类型、流派等)进行表述。对此应从两个方面进行研究并制定相关的标准:一是对于一些可面向所有视频文档的通用属性, 应建立相关的分类标准和词汇表,目前TV-Anytime论坛在这方面已做出了开创性工作,在其已制定的元数据规范(SP003v13 )中已经定义了一个独特的文档结构来综合节目描述、用户描述、分类策略;二是对于特定类型的视频节目(如各种体育比赛),应建立相关的对象、事件描述标准和词汇表。
3.3视频文档的规范化。
(1)目前文本文档的论文格式规范和着录标准(例如章节、标题的格式,每一篇论文均需要给出标题、作者、摘要、关键词,等等),为文本文档的管理、索引、检索和浏览等带来了极大的便利。
(2)对于视频作品(文档)来说,也应该且急需制定出相应的视频文档规范,这包括两个方面:一是规定视频作品必须有着录标准,应能提供相应的视频摘要(文本的、图像的、视频的)、关键词(关键帧)等元数据,作者和相关的制作人员对作品的理解最深、主题把握最准,由这些人员给出的相关信息(元数据)显然是最为有效的视频索引信息;二是应制定视频文档的格式规范,也能像文本文档一样提供结构化的信息,包括视频的组织、结构层次等信息。要解决视频文档的规范化问题,需要从两个方面努力:一是各种规范和标准;二是开发相应的视频“写作”工具。
参考文献
[1]苏新宁.视频信息索引技术研究进展.情报学报,2004(4):410~416.
[2]严明,秦嘉杭.基于文本信息的数字视频检索研究.情报科学,2004(7):865~869.
[3]周洞汝等.视频数据库管理系统导论.北京:科学出版社,2000.
[4]樊昀,王润生.基于超图聚类的故事单元的抽取与分析.软件学报,14(4):857~863.
[5]严明,苏新宁.数字视频信息的元数据研究.情报学报,2004(5):605~610.
【关键词】数字视频;信息索引;系统模型;结构
1. 视频信息的隐含结构与索引对象
对视频信息进行“结构化”,并针对不同的结构层次对象进行索引,是实现基于内容的视频信息检索的基础。
1.1视频信息的隐含结构。视频是内容随着时间变化的图像序列,其最小组成单位是帧(Frame),视频信息的这种隐含结构,可用如下的数学模型表述:
shot={frame[,i]│i>1}
1.2视频索引对象的分割与选取。视频信息蕴涵着帧、镜头、场景、故事单元和节目这样的层次型结构,为了满足不同的应用需求,视频信息的索引应在各个层次上分别展开,即对视频信息的索引,不仅要以节目为对象,而且需要在视频分割的基础上以帧、镜头、场景和故事单元为对象分别进行索引。节目和帧是视频信息固有的自然层次,而镜头、场景和故事单元则要通过对视频内容的分析、采用各种算法进行分割才能得到。
1.3视频索引对象的数据结构。
1.3.1数据模型是直接面向计算机系统(数据库)中数据的逻辑结构。在常见的数据库系统中,根据实体集之间的不同结构,通常把数据模型分为层次模型、网状模型、关系模型和面向对象模型四种。目前成熟的、主流的数据库管理系统绝大多数是采用关系模型,并在此基础上扩展了面向对象的程序设计功能。鉴于这种情况,可以考虑视频索引对象的数据结构采用如下的关系数据模式:
节目Program(节目号pNO,索引信息p)
故事单元Story Unit(节目号pNo,故事单元号uNO,索引信息u)
场景Scene(节目号pNo,故事单元号uNO,场景号eNO,索引信息e)
镜头Shot(节目号pNo,故事单元号uNO,场景号eNO,镜头号sNO,索引信息s)
代表帧KeyFrame(节目号pNo,故事单元号uNO,场景号eNO,镜头号sNO,帧号fNO,索引信息f)
1.3.2在实现时,节目号由分类号和编号两部分组成,其中分类号应采用类似于中图分类号的编码体系,分类方法可参考TV-Anytime论坛制定的分类策略(SP003v13[12]);故事单元号、场景号、镜头号和帧号可采用视频片段的起止时间码(SMPTE使用的时间码格式为:<小时:分钟:秒:帧>);各索引对象的索引信息可根据后续讨论的索引模型创建。
2. 视频信息的索引模型
2.1视频信息的内容模型。视频包含有丰富的信息内容,可分为三个层次:第一层(低层)为用户观看视频时首先感知的视觉信息,如颜色、纹理、形状、运动等;第二层(中间层)为通过逻辑推理而得的、基于对象(Object)的感知信息,如视频中包含(描述)的人物、地点、时间等;第三层(高层)为通过智能推理而得的、基于知识(Knowledge)的感知信息,它反映了视频本身的语义,以及由此而来的感受,如某视频片段为暴力镜头、欢庆场景、劫机事件等等。这种视频内容建模方式为基于内容的视频信息索引提供了有益的指导。
2.2视频信息的描述需求与索引模型。
2.2.1视频信息内涵的丰富性、用户检索需求的多样性,决定了在对视频信息进行索引时,应尽可能地从各个层次和侧面进行全方位的描述。根据MPEG-7的目标要求,对视频信息的描述至少应包括如下的信息:
(1)有关内容的产生和发展进程的描述信息(如导演/作者、标题、版本等)。
(2)与内容使用有关的信息(如版权、使用历程、宣传计划等)。
(3)有关内容存储特性的信息(如存储格式、编码等)。
(4)有关内容的低层特性的信息(如颜色、纹理、音质、音调描述等)。
(5)从内容捕捉到的实体的概念化信息(如对象和事件,对象间的交互作用等)。
(6)利于浏览视频内容的信息(如概要、变更、空间和频率等)。
(7)关于用户和内容交互作用的信息(如用户选择、使用历史等)。
2.2.2根据MPEG-7提出的描述要求及视频内容分类模型,可将视频信息的索引分为外部信息索引和基于内容的索引。
2.2.3外部信息索引是指基于视频文档外部的、不依赖于其内容的信息索引,用于视频文档的标识和检索,如标题、作者、时间、文档大小、存储格式与编码格式、使用信息(软硬件要求、使用要求、版权等)等等。
2.2.4基于内容的索引又可以分为结构索引、低层特征索引、中间层对象索引和高层语义索引。结构索引是指节目、场景、镜头、帧之间的层次结构与关系等;低层特征索引是基于视频信息的物理特征信息(如颜色、纹理、运动、音质、音调等)进行索引;中间层的索引是对视频中可识别对象(如时间、地点、人物等)的索引;高层语义索引用于描述视频中包含的事件及相关的感受。
2.3视频对象与索引类型的关系。
(1)不同(层次)的视频对象对应着不同的索引。帧的索引包含低层特征索引、中间层对象索引和高层语义索引。其中,低层特征可以自动地提取,中间层对象可以采用人工或半自动化(基于图像识别技术)的方式进行标引,高层语义可以采用人工输入方式进行标引。镜头的索引主要是中间层对象索引和高层语义索引。其中,镜头的中间层对象描述是在帧的中间层对象描述基础上进行扩充,高层语义可以采用人工输入与自动提取(主要是指利用语音识别与文字识别等技术直接从视频信息中提取)相结合的方式生成。 (2)场景和故事单元的索引主要有结构索引和高层语义索引。其结构索引用于描述镜头之间的关系,高层语义索引描述的是在镜头语义基础上形成的叙事(故事)情节。节目的索引包含外部信息索引、结构索引和高层语义索引。
2.4索引类型与检索方式的关系。视频信息的检索主要有三种类型,即结合在线相关反馈机制的基于示例的检索(Query-by-Example)、基于关键词检索(Query-by-Keyword)和基于导航机制的视频浏览(Video Browsing)。
3. 存在的问题及探讨
面对急剧增长的视频信息,如何高效且合理地对其进行索引是视频信息重用和消费的基础。虽然近年来的研究已取得不少的进展,但仍然存在许多有待解决的问题。有些问题是属于“技术”层面的,如视频分割、代表帧提取、图像理解、文字识别、语音识别等,有些问题是属于“非技术”层面的,如视频元数据标准、文本描述的规范性、视频作品的规范化等。下面就一些“非技术性”问题进行探讨。
3.1视频信息的元数据标准。
(1)信息的索引描述是信息的元数据,索引项的确立依赖于元数据标准的制定。针对不同的资源类型、不同的用途、不同的机构建立了多种不同的元数据标准。随着数字视频技术的发展,针对数字视频信息的元数据研究也在不断地深入,并已出现了一些基于不同目标的元数据模式或标准,如数字电视元数据标准(DVB-SI、TV-Anytime和SMPTE等)、视频软硬件厂商推出的元数据标准(Apple公司的QuickTime、Microsoft公司的Windows Media等)以及MPEG-7等。
(2)由于视频信息本身固有的复杂性,使得视频信息在创建、存储、传输和使用等过程中需要不同的管理信息(元数据)。笔者认为,根据视频元数据的发展现状,在研究和制定元数据标准时应注意三点:一是这些元数据标准应整合在统一的框架之内,在统一的视频元数据框架基础上形成面向不同应用的子集;二是视频元数据标准应适应MPEG制定的“多媒体描述框架”——MPEG-7标准;三是采用通用的XML语言语法。
3.2文本索引信息的规范性。
(1)虽然基于示例的视频检索是最简便的检索手段,但用户往往不会有现成的示例,且目前现有技术很难高效地为普通用户提供一个初始查询示例。目前来看,利用文本信息对视频信息进行索引(即基于关键字的视频检索),既符合一般用户的检索习惯,又可借助日趋成熟的文本检索技术。文献 较为深入地探讨了基于文本信息的视频索引及其相关技术,特别是文本信息获取的途径。
(2)在采用文本信息对视频信息进行索引(包含外部信息索引、中间层对象索引和语义索引)时,无论这些文本信息是人工输入的,还是自动提取或生成的,均需要考虑文本描述的规范性,即如何对视频信息的某种特征和属性(如视频节目的类型、流派等)进行表述。对此应从两个方面进行研究并制定相关的标准:一是对于一些可面向所有视频文档的通用属性, 应建立相关的分类标准和词汇表,目前TV-Anytime论坛在这方面已做出了开创性工作,在其已制定的元数据规范(SP003v13 )中已经定义了一个独特的文档结构来综合节目描述、用户描述、分类策略;二是对于特定类型的视频节目(如各种体育比赛),应建立相关的对象、事件描述标准和词汇表。
3.3视频文档的规范化。
(1)目前文本文档的论文格式规范和着录标准(例如章节、标题的格式,每一篇论文均需要给出标题、作者、摘要、关键词,等等),为文本文档的管理、索引、检索和浏览等带来了极大的便利。
(2)对于视频作品(文档)来说,也应该且急需制定出相应的视频文档规范,这包括两个方面:一是规定视频作品必须有着录标准,应能提供相应的视频摘要(文本的、图像的、视频的)、关键词(关键帧)等元数据,作者和相关的制作人员对作品的理解最深、主题把握最准,由这些人员给出的相关信息(元数据)显然是最为有效的视频索引信息;二是应制定视频文档的格式规范,也能像文本文档一样提供结构化的信息,包括视频的组织、结构层次等信息。要解决视频文档的规范化问题,需要从两个方面努力:一是各种规范和标准;二是开发相应的视频“写作”工具。
参考文献
[1]苏新宁.视频信息索引技术研究进展.情报学报,2004(4):410~416.
[2]严明,秦嘉杭.基于文本信息的数字视频检索研究.情报科学,2004(7):865~869.
[3]周洞汝等.视频数据库管理系统导论.北京:科学出版社,2000.
[4]樊昀,王润生.基于超图聚类的故事单元的抽取与分析.软件学报,14(4):857~863.
[5]严明,苏新宁.数字视频信息的元数据研究.情报学报,2004(5):605~610.