论文部分内容阅读
文本识别和文档切分在人机交互、教育医疗、翻译搜索和文化保护等相关领域有着广泛的需求,属于模式识别领域的热门研究方向。文本识别主要包括手写文本行识别和自然场景文本行识别。手写文本行识别是一个非常具有挑战的研究课题,它的主要难点在于庞大的字符集、字符粘连问题和文本输入长度的多变性。自然场景文本行识别的主要挑战在于背景复杂且噪声干扰多、文本形状各异且外观多变、字体色彩丰富且排布顺序多样等。而在文档切分方面,研究的主要困难来源于文档排布的多样性、文档字符的粘连问题和文档损坏、老化和污渍影响等。围绕文本识别和文档切分,本文摒弃了特征设计难度大且正确率低的传统方法,主要通过探索深度学习在文字处理领域的应用,研究了基于深度学习的文本识别和文档切分。具体来说,本文的工作内容和创新主要包括以下几方面:(1)针对手写文本行识别提出一个全新的解决方案,该方案包括基于path-signature的笔迹特征提取、多尺度空间建模的全卷积循环神经网络的设计和隐性语言模型的设计。其中,多尺度空间建模的全卷积循环神经网络通过借用一系列大小不同的接收域,可以灵活地捕捉多种尺度的空间背景信息提高识别性能。另外,本文提出的残差循环网络在不引入额外参数和计算量的情况下不仅可以加速收敛进程,而且可以提升最终的优化效果。最后,本文提出的隐性语言模型网络可以根据预测特征序列的全局文本语义信息对每个局部时间点的预测结果进行矫正。传统统计语言模型只能根据前面数个字符来预测下一个字符,而本文提出的隐性语言模型可以利用前向和反向任意长度的语义信息来辅助识别。(2)关于新型无约束手文本行识别问题,本文从一个新颖的角度来解析手写轨迹采样点信息——关注采样点坐标值的变化量而非它们的绝对值,这可以有效地降低不同书写风格的差异性。由于业界缺少多种书写风格的相关数据,本文提出一种新的数据合成方案来生成多种书写风格的无约束手写文本行,包括水平、竖直、倾斜、重叠、旋转和多行情况。为了更好地对新型无约束手写笔迹点进行建模,本文提出多层时域特征发掘的循环神经网络,它不仅继承循环神经网络的序列建模能力,而且可以加速收敛进程,保持甚至提高识别率。(3)关于场景文本识别问题和脱机中文文本行问题,本文提出一种新的集聚交叉熵损失函数,它可以达到和当前主流的序列识别函数(CTC和注意力机制)相当甚至更优的性能。由于其简便性,集聚交叉熵损失函数的部署过程非常快捷方便;而且它前向和后向过程的速度非常快,并行情况下几乎可以达到(1)的计算代价;另外,它只有非常少的内存需求,没有任何参数和运行时内存,并且它还非常容易使用,只需要替换原有的CTC损失函数即可。本文所提出的集聚交叉熵损失函数还可以扩展应用于二维预测问题,只需要直接把二维预测变换为一维预测作为输入即可。最后,本文所提出的集聚交叉熵损失函数不需要字符序列的顺序作为监督信息,只需要提供序列标签中出现的字符及其出现次数即可,这拓展了该损失函数的应用场景,比如日常场景的物体数量计数问题。(4)关于古籍文档切分问题,本文提出一个弱监督高精度的古籍文档切分系统,包括预处理、简单边界框切分算法、增量弱监督学习和识别辅助关键区域边界框切分算法。本文从贝叶斯理论的角度解释了字符切分问题,在给定文本图片的情况下,本文通过最大化标签序列的后验概率,推导得到三种新的搜索最优切分路径的算法。另外,本文还提出了判定门机制,借助这个机制,本文实现字符分类器的增量弱监督学习。借助训练得到的高性能字符分类器,本文提出的字符切分系统的性能可以获得稳定的提升。最后,本文提出的识别辅助关键区域边界框切分算法显著地降低了解码时间,因为算法只在关键区域引入置信度信息和文本行信息来辅助切分算法。