论文部分内容阅读
科技的发展使得人类的生活变得更加的舒适便捷,自然场景下的文本检测与识别技术就是一项改变人类生活的技术。比如码头上通过图像识别货柜上的货柜号码、票据上的圆形公章的识别等都是自然场景下的文本识别。但是自然场景下的文本检测与识别会受到拍摄的图片的质量、图片中的遮挡物、背景、文本排列方式等因素的影响。由于曲线文本字符特殊的排列方式,曲线文本的检测与识别比水平文本更难。因此如何从自然场景图片中定位出文本区域,识别图片中的文字仍然是一个具有挑战性的问题。
本文以经典的场景文本检测与识别方法为基础,结合现有的深度学习技术以及场景文本检测与识别的方法,针对自然场景下的曲线文本检测与识别等问题进行了研究。本文的主要工作如下。
(1)针对自然场景下的曲线文本检测,论文对用于目标检测的MaskR-CNN模型进行改进使其适合自然场景下的曲线文本检测。针对曲线文本背景复杂的问题,本文引入MaskIoU分支来修正Mask的分类置信度,从而在场景文本检测时抑制场景文本图片中背景的影响;针对字符文本的长宽比与普通目标不同的问题,本文修改了MaskR-CNN中RPN的网络结构,可以更好的检测文本区域;针对曲线文本中多尺度的问题,引入了FPN网络,在不同尺度的特征图上采用不同的anchor来提取文本区域。基于MaskR-CNN的自然场景曲线文本检测方法在数据集ICDAR2013、ICDAR2015以及曲线文本数据集TotalText上进行了实验,实验结果表明:本文方法的准确率比TextBoxes++、SegLink、MCN等方法都有提高。
(2)针对自然场景下的曲线文本识别,本文提出了将曲线文本矫正和基于编码解码结构的场景文本识别模型相结合的方法。针对曲线文本的特殊排列方式,采用了STN网络对输入的文本图片进行矫正;在进行编码时,采用深度BiGRU网络进行编码,这样可以获取上下文信息更利于文本的识别;在解码时,使用了基于注意力机制的解码方法,可以更好的根据当前解码器的状态进行建模。为了减少模型的耗时,本文采用GRU单元替换了长短期记忆网络中的LSTM单元。本文对上述自然场景曲线文本识别方法进行了仿真实验,实验结果表明:本文方法在数据集IIIT5K上的准确率为81.2%,在数据集SVT上的准确率为81.4%,在曲线文本数据集CUTE80上的识别准确率为55.3%,与另外两种方法相比较识别准确率有所提高。
本文以经典的场景文本检测与识别方法为基础,结合现有的深度学习技术以及场景文本检测与识别的方法,针对自然场景下的曲线文本检测与识别等问题进行了研究。本文的主要工作如下。
(1)针对自然场景下的曲线文本检测,论文对用于目标检测的MaskR-CNN模型进行改进使其适合自然场景下的曲线文本检测。针对曲线文本背景复杂的问题,本文引入MaskIoU分支来修正Mask的分类置信度,从而在场景文本检测时抑制场景文本图片中背景的影响;针对字符文本的长宽比与普通目标不同的问题,本文修改了MaskR-CNN中RPN的网络结构,可以更好的检测文本区域;针对曲线文本中多尺度的问题,引入了FPN网络,在不同尺度的特征图上采用不同的anchor来提取文本区域。基于MaskR-CNN的自然场景曲线文本检测方法在数据集ICDAR2013、ICDAR2015以及曲线文本数据集TotalText上进行了实验,实验结果表明:本文方法的准确率比TextBoxes++、SegLink、MCN等方法都有提高。
(2)针对自然场景下的曲线文本识别,本文提出了将曲线文本矫正和基于编码解码结构的场景文本识别模型相结合的方法。针对曲线文本的特殊排列方式,采用了STN网络对输入的文本图片进行矫正;在进行编码时,采用深度BiGRU网络进行编码,这样可以获取上下文信息更利于文本的识别;在解码时,使用了基于注意力机制的解码方法,可以更好的根据当前解码器的状态进行建模。为了减少模型的耗时,本文采用GRU单元替换了长短期记忆网络中的LSTM单元。本文对上述自然场景曲线文本识别方法进行了仿真实验,实验结果表明:本文方法在数据集IIIT5K上的准确率为81.2%,在数据集SVT上的准确率为81.4%,在曲线文本数据集CUTE80上的识别准确率为55.3%,与另外两种方法相比较识别准确率有所提高。