论文部分内容阅读
本文以自然场景文档图像为研究对象,针对多变的拍摄视点引起的文档形变、文档尺度多变和复杂场景造成的文档定位错误和精确度低的问题,提出了基于角点检测的两阶段自然场景文档定位算法,通过由粗定位到精确定位的两阶段角点定位方式,实现自然场景文档的精确定位目标。本文主要工作如下:
1)以CNN为算法特征提取框架,建立了粗定位-精确定位的两阶段定位算法框架。粗定位阶段以全局优化得到角点坐标近似最优解为目标,精确定位阶段采用轻量级网络框架基于粗定位结果进行局部细化,最终达到自然场景精确定位文档角点的目的。在公开数据集ICDARSmartDoc2015上的实验结果表明提出的算法在网络训练代价较小的情况下,达到自然场景精确定位文档的目标。
2)针对自然场景文档图像中复杂背景、多变的拍摄视点引起的文档形变和文档尺度多变因素导致的文档定位错误问题,提出了基于特征聚合和注意力机制的角点粗定位算法。使用预训练VGG16作为基本网络骨架学习文档图像特征,通过多尺度特征聚合获得不同尺度和形变文档的注意力区域,进而引导粗定位网络在全局对文档角点进行定位。在ICDARSmartDoc2015数据集上的实验结果表明粗定位算法能够有效改善复杂场景文档图像中不同形变和尺度文档的角点定位误差。
3)针对粗定位结果不精确问题,提出了块区域迭代检测的角点精确定位算法。在粗定位结果的基础上使用轻量级CNN作为特征提取器,设计了角点区域图像块预处理方法和迭代检测模块来构建能在自然场景中精确定位文档的算法。在ICDARSmartDoc2015数据集上的实验结果表明迭代检测算法能在架构简单的CNN上精确定位出文档的角点。
4)针对ICDARSmartDoc2015数据集文档图像背景过于简单,尺度过于单一的缺陷,对其进行扩充,验证了提出的两阶段算法在复杂自然场景下文档定位的有效性。本文收集了200张复杂场景文档图像,图像在不同视角、不同光照环境下采集,图像内文档具有不同的尺度和形变。数据按照ICDARSmartDoc2015数据集标签方式进行统一标注。在扩充的数据集上进行训练的实验结果表明,提出的两阶段算法可以更好的实现复杂场景、不同尺度和形变文档精确定位。
1)以CNN为算法特征提取框架,建立了粗定位-精确定位的两阶段定位算法框架。粗定位阶段以全局优化得到角点坐标近似最优解为目标,精确定位阶段采用轻量级网络框架基于粗定位结果进行局部细化,最终达到自然场景精确定位文档角点的目的。在公开数据集ICDARSmartDoc2015上的实验结果表明提出的算法在网络训练代价较小的情况下,达到自然场景精确定位文档的目标。
2)针对自然场景文档图像中复杂背景、多变的拍摄视点引起的文档形变和文档尺度多变因素导致的文档定位错误问题,提出了基于特征聚合和注意力机制的角点粗定位算法。使用预训练VGG16作为基本网络骨架学习文档图像特征,通过多尺度特征聚合获得不同尺度和形变文档的注意力区域,进而引导粗定位网络在全局对文档角点进行定位。在ICDARSmartDoc2015数据集上的实验结果表明粗定位算法能够有效改善复杂场景文档图像中不同形变和尺度文档的角点定位误差。
3)针对粗定位结果不精确问题,提出了块区域迭代检测的角点精确定位算法。在粗定位结果的基础上使用轻量级CNN作为特征提取器,设计了角点区域图像块预处理方法和迭代检测模块来构建能在自然场景中精确定位文档的算法。在ICDARSmartDoc2015数据集上的实验结果表明迭代检测算法能在架构简单的CNN上精确定位出文档的角点。
4)针对ICDARSmartDoc2015数据集文档图像背景过于简单,尺度过于单一的缺陷,对其进行扩充,验证了提出的两阶段算法在复杂自然场景下文档定位的有效性。本文收集了200张复杂场景文档图像,图像在不同视角、不同光照环境下采集,图像内文档具有不同的尺度和形变。数据按照ICDARSmartDoc2015数据集标签方式进行统一标注。在扩充的数据集上进行训练的实验结果表明,提出的两阶段算法可以更好的实现复杂场景、不同尺度和形变文档精确定位。