论文部分内容阅读
图像上色是一项耗时费力的工作,对于一副作品来说色彩搭配是决定其质量的重要因素,因此,图像自动上色是一项非常具备研究意义以及应用价值的课题。随着计算机硬件的发展,在自动上色领域当中,深度学习技术更是取得了令人满意的效果。本文按照颜色信息的来源可以将自动上色方法分为三种,分别是基于先验知识的图像上色、基于参考图片的图像上色及交互式上色。上述上色方法可以满足大部分的用户需求,但是存在着不足之处。用户不能对一张图片中的多个物体进行不同的参考图上色。针对这个问题,本文基于实例分割、图像上色及图像融合技术,提出了利用深度学习来实现多区域混合上色,该方法主要分为基于参考图片的前景上色及基于先验知识的背景上色,对于本文中的其中主要内容及贡献如下:1、为了识别图像中的多个目标及背景区域,并将最后上色结果融合在一起,本文研究了 Mask R-CNN及图像泊松融合。利用颜色转换对前景目标上色,给定一张灰度目标图,以及一张彩色参考图,分别利用Mask R-CNN提取各自的语义信息,根据语义信息将参考图指定区域颜色迁移到灰度图的指定区域(前景)。在转换时将结合语义信息的图片共同输入到VGG-19中得到灰度图的内容特征图和参考图的风格特征图。接着迭代一张随机噪声图,使噪声图整体上逼近内容特征图,特定的目标区域逼近风格特征图的指定区域。为了保证内容图的纹理不被丢失,在计算损失函数时添加图像写实惩罚项,使迭代的噪声图最后只迁移了参考图中的颜色信息。同时利用U-net对指定区域外的背景图上色。最后,使用泊松融合将前景和背景融合。2、基于VGG来优化噪声图进行颜色转换的方法存在迭代时间过长的缺陷,本文基于这个缺陷提出了一种改进的基于前向网络的快速区域上色方法,该方法可以提升区域上色的速度。主要工作在VGG网络之前添加一个前向网络。给定一张彩色参考图,采用灰度化的数据集来训练图像转换网络,使得图像转换网络可以记住参考图的颜色信息,实现对灰度目标图的快速上色。3、为了更有效率的完成上色的工作,本文设计了一种自动为目标图片匹配相似参考图片的方法。该方法主要分为三个步骤,首先利用VGG-19对进行分类,然后对图片进行特征提取,计算由VGG-19提取的图片特征的余弦相似性作为语义距离,由此筛选出与目标图片距离最近的M张参考图,第二步是分别计算这M张参考图的图像指纹特征,使用图像指纹特征的汉明距离来表示与目标图片的相似程度,并对其进行排序,最后选择排序靠前的作为参考图。