文字检测的若干技术研究

来源 :中国科学院研究生院 中国科学院大学 | 被引量 : 0次 | 上传用户:mikelee
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
图像和视频中的文字包含有丰富的语义信息,是多媒体内容分析与检索的重要线索。从广义上来说,完整的文字检测识别过程包括文字检测、文字分割和文字识别三个部分,本文的研究重点在文字检测上,包括叠加文字检测和场景文字检测。在叠加文字检测中,包含了体育视频比分检测识别和字幕文字检测两个部分。最后,结合已有的文字分割研究成果,形成一个完整的视频文字检测分割系统。本文取得的研究成果主要如下:   1.提出了一种基于笔画特征,由粗到细的视频字幕文字检测方法。该方法首先采用快速笔画滤波器找到候选笔画像素,根据快速区域聚合算法定位文字区域,根据区域投影信息分割出候选文字行,在候选文字行上提取笔画特征,使用分类器进行分类,剔除错误的检测,最后使用文字行时间相关性信息对检测结果进一步优化。   2.提出了一种实时有效的体育视频比分检测识别算法。利用纹理和帧差信息,准确定位体育视频的比分牌位置;根据比分变化和启发式规则,定位比分区域;根据比分数字的结构特征、时间相关性信息和比分变化规则,实时有效地识别比分并跟踪比分变化情况。   3.尝试了一种多特征融合的场景文字检测方法。首先通过检测边缘信息找到候选区域,然后利用每个区域内的颜色分布特征将同一文字行的区域联合起来,最后根据文字分割结果、颜色分布特征和边缘特征,使用多规则加分类器的方法验证候选文字行。   4.综合上述研究成果,结合已有的文字分割技术,完成了一个简单的视频文字检测分割系统。
其他文献
目前IPv6网络协议的出现彻底解决了地址空间紧缺和路由表爆炸问题。IPv6实验网络已经遍布全球,IP网络协议从IPv4过渡到IPv6已经是历史的必然。随着网络技术的发展,特别是以IPv6
多核处理器以其高性能、低功耗、设计周期短等诸多优势成为未来高性能处理器的发展趋势。由于应用对计算能力的需求是无限的,随着芯片上晶体管数目的进一步增多,多核处理器将逐
客票系统运行在客票专网,旅客购票只能通过车站售票窗口和代售点,为克服客票系统这一局限性,有效延伸客票系统的售票渠道,方便旅客购票,提出建立基于Internet的售票系统。   介
随着软件产业的飞速发展,软件的规模变得越来越大,同时软件的复杂度也变得越来越高。软件测试作为软件质量保证体系中重要一环,其工作的重要性也逐渐被国内外软件企业所认可。软
流媒体应用需要消耗大量的网络带宽,并要求较低的网络传输时延。传统的C/S模式受限于服务器的性能,一般不能提供大规模的流媒体服务。随着P2P技术的发展,在P2P网络上实现流媒体
如何让机器理解视频内容,是利用海量视频数据的核心问题。视频内容分析是解决该问题的关键技术之一。随着应用范围的拓展,视频分析领域出现了如何提取有效特征以检索和搜索格式
互联网的飞速发展使人们可以很方便地从网络上获取多媒体数据,同时也给版权保护这一问题提出了新的挑战。数字水印技术作为一种新的有效的数字产品版权保护的技术手段,是信息
随着计算机技术、网络应用的发展,人们开始在虚拟世界中完成各种活动,如电子商务、政务、网络多媒体数字信息共享等。各种安全框架和软件为网络活动提供了良好的基础。在电子商
复杂工程系统的综合设计通常涉及众多的设计人员,海量的数据资源,不同领域的软件工具,复杂的设计流程,是一个需要经过多个设计阶段逐步细化反复的过程,是人员、资源、工具和
随着三维信息获取技术不断发展和三维模型构造手段的不断进步,越来越多的三维数据出现在我们面前。通过CAD造型软件,可以得到三维模型;借助三维扫描设备,可以得到三维点云数据;通