课程学习在场景文字识别任务中的应用研究

来源 :河南大学 | 被引量 : 0次 | 上传用户:oswaldhui
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
场景文字识别一直是一个极具挑战性的问题,理解场景文字的内容在交通,社交,定位等领域都有着巨大的应用价值,已然成为当前研究的热点。但是由于场景文字识别不同于传统意义上的文档文字识别,文字表现形式丰富,存在着遮挡、弯曲、艺术字等问题严重影响到模型对字符特征的准确提取,识别率始终不尽人意。为了得到字符识别率更高的深度学习模型,人们采用去改变模型的网络结构、损失函数,对图片中扭曲的字符进行修正等等方式。但不同于以往的工作,本文采用分类问题中取得显著成果的课程学习方法,改变原有随机从数据集中选取样本训练的方式,以难度提升的样本顺序训练模型,提升了当前主流场景文字识别算法的效果。与传统的训练方式相比,使用课程学习方法训练场景文字识别模型,可以使得模型在训练初期学习到更加精确的特征,加快了模型的收敛速度,并且最终在测试集上得到更高的字符识别准确率。使用课程学习方法,需要解决两个问题:如何定义数据集样本的难度,在得到数据集样本的难度后如何训练模型。围绕这两个关键问题,本文主要工作如下:(1)提出了使用预训练模型定义场景文字图片难度的办法,并对比使用不同数据集子集参数配置训练模型的结果。该方法首先对Synth Text80K、ICDAR2013、ICDAR2015数据集进行预处理统一图片的格式,其次使用这些处理好的数据预训练模型,然后使用这些预训练模型对COCO-Text训练集数据进行识别,根据模型识别得到的分数划分数据的难度,依据得到的样本难度分值把样本划分到不同的训练子集中,最后使用CRNN、ASTER这两个主流的场景文字识别算法根据难度增加的顺序在不同的训练子集上训练,使其字符识别准确率得到提升。分析实验结果可知,使用课程学习方法可以在模型训练初期有效的提高模型的收敛速度,以难度提升的样本顺序训练ASTER、CRNN算法在COCO-Text数据集上相比于基准值最高得到1.8%、1.13%的提升。以难度下降的顺序训练则不同程度上降低了模型的字符识别准确率以及训练初期模型的收敛速率。以改变训练集子集个数、训练集子集样本数这种方式继续增大简单困难样本权重的差别,在一定范围内可以使模型找到更好的局部最优点。(2)提出了使用人类视角中导致图片困难的关键特征定义场景文字图片难度的办法。使用低层特征如:图片大小、标签字符数量等作为条件判断COCO-Text训练集图片的难度。使用神经网络提取的中层特征信息如:图片中物体数量、边缘数量、分割数量链接V-SVR机器学习分类器,拟合人类标注的信息得到新的难度判别模型,预测COCO-Text训练集图片的难度。随后类同于之前步骤,使用课程学习算法,以难度提升的样本顺序训练模型。根据实验结果可知使用本章方法定义样本难度并进行课程学习训练可使CRNN模型在COCO-Text数据集上最高得到0.57%的提升。对于字符识别准确率的提升小于之前方法,但是时间损耗大幅度减少。
其他文献
一、基本情况概述段村镇位于平遥县西南部,地处平遥、沁源、介休三地"黄金三角区",坐落于太行山支脉千秋岭北麓,晋文公庙下之黄土塬上。全镇地形地貌属山地、半丘陵地形,南部
会议
含氟基团引入到药物分子中可以带来意想不到的效果,比如高效的分子脂溶性,更优的代谢稳定性[1-3]等。迄今为止,一些较为有效的氟烷基引入方法都已发展起来,但是将氟烷基引入
会议
研究背景随着现代围产医学危重症救治技术及新生儿护理水平的不断发展,具有极限生存活力的早产儿存活率有了明显提高。但由于早产儿脑形态及功能发育不成熟,且在围产期往往存
开发和利用清洁而又高效的新能源、新材料,是21世纪人类面临的重要课题。含氟熔盐因具有高温稳定性好、高热导率、高比热、高沸点、中子吸收截面小、低饱和蒸汽压和粘度等一
会议
通过二氟卡宾试剂对O-H键的插入OCF2H基团的方法应用最广,因此许多优秀的二氟卡宾试剂也相应地发展起来[1]。这些试剂产生二氟卡宾中间体的方式各有不同,多数需要加入强碱才
会议
会议
会议
由于联烯具有独特的结构和活泼的反应性质,简单高效地合成各种联烯化合物就成为了化学家们非常感兴趣的课题[1]。利用炔烃的官能团化可顺利制备联烯,但在已报道的工作中,反应
会议
过渡金属二氟卡宾化合物的研究已经有许多报道,但目前为止,大多数都只是这些化合物的合成方法以及对其性质的研究,过渡金属催化的二氟卡宾的转移反应仍然具有一定的挑战性。[
会议
老龄妇女和雌性动物生育力下降的原因和机制一直是许多研究及争议的主题。由减数分裂错误引起的卵母细胞质量下降被认为是与衰老相关生育力下降的主要原因之一。生发泡(GV)
会议