自然场景下的曲线文本检测与识别

来源 :武汉理工大学 | 被引量 : 0次 | 上传用户:yuanxu52051
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
科技的发展使得人类的生活变得更加的舒适便捷,自然场景下的文本检测与识别技术就是一项改变人类生活的技术。比如码头上通过图像识别货柜上的货柜号码、票据上的圆形公章的识别等都是自然场景下的文本识别。但是自然场景下的文本检测与识别会受到拍摄的图片的质量、图片中的遮挡物、背景、文本排列方式等因素的影响。由于曲线文本字符特殊的排列方式,曲线文本的检测与识别比水平文本更难。因此如何从自然场景图片中定位出文本区域,识别图片中的文字仍然是一个具有挑战性的问题。
  本文以经典的场景文本检测与识别方法为基础,结合现有的深度学习技术以及场景文本检测与识别的方法,针对自然场景下的曲线文本检测与识别等问题进行了研究。本文的主要工作如下。
  (1)针对自然场景下的曲线文本检测,论文对用于目标检测的MaskR-CNN模型进行改进使其适合自然场景下的曲线文本检测。针对曲线文本背景复杂的问题,本文引入MaskIoU分支来修正Mask的分类置信度,从而在场景文本检测时抑制场景文本图片中背景的影响;针对字符文本的长宽比与普通目标不同的问题,本文修改了MaskR-CNN中RPN的网络结构,可以更好的检测文本区域;针对曲线文本中多尺度的问题,引入了FPN网络,在不同尺度的特征图上采用不同的anchor来提取文本区域。基于MaskR-CNN的自然场景曲线文本检测方法在数据集ICDAR2013、ICDAR2015以及曲线文本数据集TotalText上进行了实验,实验结果表明:本文方法的准确率比TextBoxes++、SegLink、MCN等方法都有提高。
  (2)针对自然场景下的曲线文本识别,本文提出了将曲线文本矫正和基于编码解码结构的场景文本识别模型相结合的方法。针对曲线文本的特殊排列方式,采用了STN网络对输入的文本图片进行矫正;在进行编码时,采用深度BiGRU网络进行编码,这样可以获取上下文信息更利于文本的识别;在解码时,使用了基于注意力机制的解码方法,可以更好的根据当前解码器的状态进行建模。为了减少模型的耗时,本文采用GRU单元替换了长短期记忆网络中的LSTM单元。本文对上述自然场景曲线文本识别方法进行了仿真实验,实验结果表明:本文方法在数据集IIIT5K上的准确率为81.2%,在数据集SVT上的准确率为81.4%,在曲线文本数据集CUTE80上的识别准确率为55.3%,与另外两种方法相比较识别准确率有所提高。
其他文献
2016年,国务院安委会下发《金属非金属地下矿山采空区事故隐患治理工作方案》,明确指出地下矿山开采安全管理工作的重要性。通过物联网(IoT,Internet of Things)技术在矿山部署传感器,可以实现数据的识别、定位、监管等功能,因此,基于物联网技术进行矿山安全施工监测具有重要意义。鉴于矿井下应急救援的需求,在矿井塌陷的情况下,无法采用常规的供电方式,因此现有的技术方案大多数是基于IEEE
学位
当今,数据处理的应用飞速增长,数据管理技术尤其是关系型数据库管理系统(DataBase Management Systems)被广泛应用在各个行业,例如大到航天飞行器的数据系统,小到百姓日常的购物消费系统等都和数据库息息相关。随着日益快速发展的互联网技术,尤其是伴随着未来5G市场的爆发以及万物互联的设备持续增多,数据库管理系统必将持续成为当前以及未来的研究热点。最近十多年计算机硬件的性能发生了质的
学位
数据中心网络作为现代分布式计算的基础架构,决定了分布式应用的通信性能。随着大数据技术的快速发展和云计算基础设施的不断成熟,数据中心承载了越来越多的分布式计算任务,其底层网络的设计也面临着严峻的挑战。为了保证性能和可靠性,现代数据中心网络通常采用专用的结构化多径拓扑。具体地,以Fat-tree为代表的多径网络已成为大规模数据中心网络设计的首选方案。但是多路径网络由于其路由方式的不同,使得传统路由算法
在现实世界中,实体连同关联关系构成了一种网络关系结构即信息网络。这里的实体可以是商品、文章、会议、人、图片、电影或者导演等个体,关联关系可以是购买、发表、观看、出演或者指导等关联。链路预测是指通过已知的网络节点以及网络结构等信息来预测网络中尚未产生连边的两个节点之间产生链路或产生某种符号链路的可能性。这些被预测出的链路可以是实际存在但未被观察到的链路,也可以是未来可能会出现的链路。链路预测已经成为
学位
软件定义网络(software defined networks,SDNs)是一种由多种网络技术组成的新型网络结构,由底层的数据平面、中间层的控制平面以及最上层的应用平面组成,具有灵活敏捷的特点,能够自动优化网络资源的利用,尤其适用于网络中流量需求不断变化的应用。软件定义网络与传统网络不同之处在于SDN将网络设备的控制平面与数据平面相分离,因此根据实时动态的网络需求,用户可以通过简单的编程操作对整
网络上的图像数据规模愈发庞大,伴随而来的有关图像的需求如存储、传输、识别等,也面临着更大的挑战,对图像识别和图像表示的研究已经成为应对新挑战的亟需攻克的关键点。目前,图像识别中利用结构特征、纹理特征、子空间、机器学习等方法与图像表示中线性类方法如矩阵分解、稀疏编码、线性判别分析和非线性类方法如核学习、流形学习、机器学习等,都存在需要经过复杂的运算分析、过程抽象、优化困难、对训练数据要求较高的问题。
学位
云计算作为一种高效的计算模式受到了人们广泛的关注,使得云计算市场飞速发展。广阔的市场前景吸引了各大互联网巨头纷纷布局其云计算业务,希望在激烈的竞争环境中脱颖而出,从而形成了一个具有多方博弈的云计算市场。在这样一个云市场中,当不同云服务提供商提供相似的云服务时,云服务的价格则会对云用户选择不同云服务提供商的结果产生重要影响。现有云市场交易模式大致归为两类,分别是商品市场模式和拍卖市场模式,本文将分别
人脸识别系统容易受到恶意的欺骗攻击,例如打印的照片攻击或视频重播攻击。因此,为了保障人脸识别系统的安全性,研究能够抵抗欺骗攻击的人脸活体检测技术显得尤为重要。本文主要的研究对象是基于纹理的人脸活体检测方法。现有基于纹理的方法对光照变化和噪声等因素敏感,且使用的特征表达能力不足,导致泛化性能较低。除此之外,当源域和目标域数据分布差异较大时,学习的模型不能很好地泛化到目标域中,导致性能急剧下降。为了解
学位
近年来,随着我国经济发展进入新常态,经济发展的总量规模和复杂程度均空前增大,政府管理调控经济的要求越来越高,传统的管理理念、方法和工具难以适应新形势需要。因此,利用计算机科学技术充分考虑各行业之间的关联性,探求新常态下经济运行新规律,可以为推动政府治理精准化提供新的技术支撑。在以往的研究中,大多是通过统计学和计量经济学的方法作为宏观经济决策研究的理论基础,本研究立足于分析各宏观经济指标间的关联性,
学位
近年来,大数据催生的很多以数据为中心的技术和应用对计算机内存的容量、速度、能耗提出了更高的要求。传统的DRAM内存技术因其存储密度小,易失性和静态功耗大等问题难以满足新的技术对于大容量内存的需求。为解决传统计算机主存面临的瓶颈,由非易失存储器(Non-Volatile Memory,NVM)和DRAM共同组成计算机内存的混合内存技术的提出受到了学术界的广泛关注。这种新的内存结构的出现对整个系统结构