论文部分内容阅读
场景文字识别一直是一个极具挑战性的问题,理解场景文字的内容在交通,社交,定位等领域都有着巨大的应用价值,已然成为当前研究的热点。但是由于场景文字识别不同于传统意义上的文档文字识别,文字表现形式丰富,存在着遮挡、弯曲、艺术字等问题严重影响到模型对字符特征的准确提取,识别率始终不尽人意。为了得到字符识别率更高的深度学习模型,人们采用去改变模型的网络结构、损失函数,对图片中扭曲的字符进行修正等等方式。但不同于以往的工作,本文采用分类问题中取得显著成果的课程学习方法,改变原有随机从数据集中选取样本训练的方式,以难度提升的样本顺序训练模型,提升了当前主流场景文字识别算法的效果。与传统的训练方式相比,使用课程学习方法训练场景文字识别模型,可以使得模型在训练初期学习到更加精确的特征,加快了模型的收敛速度,并且最终在测试集上得到更高的字符识别准确率。使用课程学习方法,需要解决两个问题:如何定义数据集样本的难度,在得到数据集样本的难度后如何训练模型。围绕这两个关键问题,本文主要工作如下:(1)提出了使用预训练模型定义场景文字图片难度的办法,并对比使用不同数据集子集参数配置训练模型的结果。该方法首先对Synth Text80K、ICDAR2013、ICDAR2015数据集进行预处理统一图片的格式,其次使用这些处理好的数据预训练模型,然后使用这些预训练模型对COCO-Text训练集数据进行识别,根据模型识别得到的分数划分数据的难度,依据得到的样本难度分值把样本划分到不同的训练子集中,最后使用CRNN、ASTER这两个主流的场景文字识别算法根据难度增加的顺序在不同的训练子集上训练,使其字符识别准确率得到提升。分析实验结果可知,使用课程学习方法可以在模型训练初期有效的提高模型的收敛速度,以难度提升的样本顺序训练ASTER、CRNN算法在COCO-Text数据集上相比于基准值最高得到1.8%、1.13%的提升。以难度下降的顺序训练则不同程度上降低了模型的字符识别准确率以及训练初期模型的收敛速率。以改变训练集子集个数、训练集子集样本数这种方式继续增大简单困难样本权重的差别,在一定范围内可以使模型找到更好的局部最优点。(2)提出了使用人类视角中导致图片困难的关键特征定义场景文字图片难度的办法。使用低层特征如:图片大小、标签字符数量等作为条件判断COCO-Text训练集图片的难度。使用神经网络提取的中层特征信息如:图片中物体数量、边缘数量、分割数量链接V-SVR机器学习分类器,拟合人类标注的信息得到新的难度判别模型,预测COCO-Text训练集图片的难度。随后类同于之前步骤,使用课程学习算法,以难度提升的样本顺序训练模型。根据实验结果可知使用本章方法定义样本难度并进行课程学习训练可使CRNN模型在COCO-Text数据集上最高得到0.57%的提升。对于字符识别准确率的提升小于之前方法,但是时间损耗大幅度减少。