论文部分内容阅读
3D点云数据是一种非常重要的空间几何型数据,一般用来构建三维立体几何物体的表面形状,同时点云数据也是激光雷达、3D传感器以及深度摄像头等设备生成数据的最原始表现形式。近年来随着自动驾驶、VR、AR等技术的不断发展,点云数据的获取变得越来越便利,然而3D点云数据是一种不规则型数据,排列无序、分布不均且层次不分明,因此对点云数据的高效建模方法一直以来都是一个艰巨的挑战。深度学习方法近年来在众多应用领域大放异彩,尤其是在图像识别和自然语言处理等方面,深度学习算法表现出强大的特征表达能力。然而传统深度学习算法却在不规则的非欧几里得域数据建模方面表现出弊端,由于非欧几里得域数据无法简化为规则的网格型张量形式,因此传统深度学习算法独特的张量处理模式就无法直接在不规则的非欧几里得域数据上进行操作,从而对于3D点云这种典型的非欧几里得域数据的建模处理,传统深度学习方法就显得格外吃力。图卷积神经网络(Graph Convolutional Networks,GCN)是近年来深度学习方面又一新兴热点,由于图卷积神经网络独特的特征提取方式非常适合不规则数据的建模,因此将图卷积神经网络应用于3D点云数据的建模任务也是近来非常热门的尝试。本文提出了基于多尺度动态图卷积网络的3D点云分模型以及基于图卷积U-Net网络结构的3D点云分割模型,用于不规则3D点云的建模处理。1、多尺度动态图卷积3D点云分类模型:3D点云的分类任务相对来讲属于粗粒度图像识别任务,与传统深度学习图像分类算法的处理过程一样,3D点云分类模型一般借助一系列卷积操作提取数据局部细节特征,并通过一个全局池化层提取全局语义特征,达到最终点云分类的目标。本文我们提出基于图神经网络的多尺度动态图卷积网络模型用于3D点云的分类任务,模型首先使用最远点采样方法(Farthest Point Sampling,FPS)对点云数据整体进行降采样,然后分别利用不同规模的K最邻近聚合(k-NN Graph)算法对点云数据点进行局部划分,并利用不同深度的边卷积层(Edge Convolution)对局部特征进行提取和聚合,最后通过一个全局最大池化层总结和提取全局语义信息用于分类。实验表明,多尺度动态图卷积网络模型在3D点云数据的分类准确度和模型复杂度上都实现了非常良好的效果,在保证分类准确度达到较高水平的同时,还有效地降低了模型的计算复杂度。2、图卷积U-Net 3D点云分割模型:3D点云的分割任务相对于分类任务来讲,属于细粒度、像素级图像识别任务,即单一数据点分类,每一个数据点都需要划分出自己所属的类别。图像语义分割模型一般使用端到端的对称结构,模型前半部分首先利用卷积层和池化层提取和聚合不同感受野区域的局部信息,后半部分通过反卷积上采样还原图像特征到原始图像尺寸大小并最终输出像素级的分类结果。本文提出基于图卷积神经网络的图卷积U-Net(Graph Convolutional U-Net)模型应用于3D点云的分割任务,该模型借助经典的U-Net模型架构,模型整体采用左右对称结构,左侧部分通过边卷积操作不断地对原始数据进行降采样和局部特征聚合,对原始点云数据进行压缩编码;右侧部分通过使用k-NN插值对编码数据进行上采样提升数据点个数和特征维度,即对压缩的数据进行还原解码,并最终恢复到原始数据的维度大小,实现分割模型端到端输出。实验表明,Graph Conv U-Net模型在3D点云的分割任务上实现了非常成熟的表现,无论是数据集整体的分割平均交并比(mean Io U)还是数据集中各类物体的单类别分割Io U值,都达到了与当前主流3D点云分割模型相似或者更高的水准。