论文部分内容阅读
图像和视频中的文字包含有丰富的语义信息,是多媒体内容分析与检索的重要线索。从广义上来说,完整的文字检测识别过程包括文字检测、文字分割和文字识别三个部分,本文的研究重点在文字检测上,包括叠加文字检测和场景文字检测。在叠加文字检测中,包含了体育视频比分检测识别和字幕文字检测两个部分。最后,结合已有的文字分割研究成果,形成一个完整的视频文字检测分割系统。本文取得的研究成果主要如下:
1.提出了一种基于笔画特征,由粗到细的视频字幕文字检测方法。该方法首先采用快速笔画滤波器找到候选笔画像素,根据快速区域聚合算法定位文字区域,根据区域投影信息分割出候选文字行,在候选文字行上提取笔画特征,使用分类器进行分类,剔除错误的检测,最后使用文字行时间相关性信息对检测结果进一步优化。
2.提出了一种实时有效的体育视频比分检测识别算法。利用纹理和帧差信息,准确定位体育视频的比分牌位置;根据比分变化和启发式规则,定位比分区域;根据比分数字的结构特征、时间相关性信息和比分变化规则,实时有效地识别比分并跟踪比分变化情况。
3.尝试了一种多特征融合的场景文字检测方法。首先通过检测边缘信息找到候选区域,然后利用每个区域内的颜色分布特征将同一文字行的区域联合起来,最后根据文字分割结果、颜色分布特征和边缘特征,使用多规则加分类器的方法验证候选文字行。
4.综合上述研究成果,结合已有的文字分割技术,完成了一个简单的视频文字检测分割系统。