论文部分内容阅读
摘要:LAMOST(郭守敬望远镜)提供了大量的天文光谱数据,而天体分类是天文学中得到广泛关注的问题,由于天体数量大,数据维度高,如何使用机器学习的方法对光谱进行处理,成为近些年的热点。针对天体分类问题,提出了HSODM(High-dimensional Spectral with Outlier Data Mining),这是一种改进的高维离群数据识别方法,其采用无监督学習方式,基于随机距离将大量高维光谱数据中的极少数未知天体或离群数据识别出来,便于后续天体分类、离群数据挖掘等相关处理。项目中运用数据预处理、主成分分析降维、长短期记忆神经网络模型建立与训练、参数调优、结果预测与分析,最终通过评估方法和数据可视化等手段对模型进行评价与展示。研究中提出的改进方法和优化的神经网络可以缩短训练时间,提高模型预测准确度。经过实验发现,改进方法对ROC (receiver operating characteristic) 曲线面积、P-R曲线面积、F1分数和G-mean分数都有相应的提高。
关键词: 表示学习;高维光谱;离群点检测;数据挖掘; 分类
Abstract: LAMOST (Large Sky Area Multi-Object Fiber Spectroscopy Telescope) Telescope provides a large amount of astronomical spectral data, and astronomical classification is a problem that has received widespread attention in astronomy. Due to the large number of celestial bodies and the high dimensionality of data, how to use machine learning methods to process spectra has become a problem in recent years. Hot spot. Aiming at the problem of celestial body classification, HSODM (High-dimensional Spectral with Outlier Data Mining) is proposed, which is an improved method for identifying high-dimensional outlier data. It uses an unsupervised learning method and combines a large number of high-dimensional spectral data based on random distance. A very small number of unknown celestial bodies or outlier data can be identified to facilitate subsequent celestial body classification, outlier data mining and other related processing. In the project, data preprocessing, principal component analysis and dimensionality reduction, long and short-term memory neural network model establishment and training, parameter tuning, result prediction and analysis are used in the project, and the model is finally evaluated and displayed by means of evaluation methods and data visualization. The improved method and optimized neural network proposed in the research can shorten the training time and improve the accuracy of model prediction. After experimentation, it is found that the improved method has corresponding improvement on ROC curve area, P-R curve area, F1 score and G-mean score.
Key words: representation learning; high-dimensional spectral; outlier detection; data mining; classification
天文学随着科学技术的发展,先进的观测设备使我们能够望向宇宙更深处,同时也带来了天文数据爆炸式的增长[1]。郭守敬望远镜(LAMOST)作为世界上光谱获取率最高的望远镜,LAMOST每个观测夜晚能采集万余条光谱,这将为一些天文和天体物理学家在星系红移巡天、宇宙学模型、宇宙大尺度结构、星系形成和演化以及结合各类射线的光谱观测等研究工作[2]上提供大量素材,对天文学领域的发展起到推动和完善作用。LAMOST数据集中的每一条光谱提供了3690-9100埃的波长范围内的一系列辐射强度值。光谱分类就是要从上千维的光谱数据中选择和提取对分类识别最有效的特征来构建特征空间,例如选择特定波长或波段上的光谱流量值等作为特征,并运用算法对各种天体进行区分 。 在天文光谱分类问题中,LAMOST数据集存在一部分离群数据,因其特征与已知天体特征不相似,而被划分为未知类别。此现象可能是由于宇宙背景噪声、光线的衰弱和红移等因素对光谱数据形成污染,造成该数据无法识别;也有可能是以往从未观察过的未知天体的光谱数据。因为对于特殊的、未知的天体挖掘,是人类探索宇宙所追求的目标之一。因此,对天文光谱数据中离群数据的挖掘显得尤为必要。
1 研究现状
目前,国内外关于天文光谱离群数据挖掘的研究相对较少。特拉维夫大学物理与天文学院的Dalya Baron和Dovi Poznanski教授提出了一种基于无监督随机森林开发的离群检测算法[3],且在斯隆数字巡天的超过两百万个星系光谱上测试该算法,并检查具有最高异常值得分的400个星系。常见的大多解决方案是将高维数据集映射到低维表示,以便为后续的学习需求保存相关信息。许多无监督表示学习方法,如:基于光谱的方法,基于神经网络的方法和流形学习,已被运用解决此类问题。这些方法大多侧重于保存数据的正则性信息因此可能无法保存离群值所携带的信息。
对于天体光谱数据而言,学者们扩展了一般的离群数据挖掘方法,提出了许多新的解决途径。娄圣金等学者根据信息熵的思想,提出一种基于属性权值的离群数据挖掘方法[4]。蔡江辉和张继福等学者,从局部稀疏程度的角度,重新定义相关子空间[5]。光谱子空间进行离群光谱数据的挖掘。但是,上述方法的计算复杂度高于线性级别,且采用了一个相对固定的模式,缺乏通过学习模型对挖掘过程进行优化。
与传统方法相比,本文给出的HSODM(High-dimensional Spectral with Outlier Data Mining)算法有三个创新之处:(1)GELU激活函数GELU是一种较新的高性能神经网络激活函数,其非线性变化是一种符合预期的随机正则变换方式。ReLU缺乏数据的统计特性,GELU引入了随机正则的思想,在ReLU的基础上加入了统计的特性,性能更好。(2)三元组数据天文光谱数据由于各个天体的差异存在不同的噪声干扰,使用三元组损失函数,通过神经网络层构建新的数据嵌入空间,增大正常数据和离群数据的欧式距离,避免其他因素对基于随机距离的分类造成影响,提高准确率。(3)表示学习神经网络在构建高维光谱数据的嵌入空间时,首先对高维数据集进行PCA降维,使用降维后的数据构建三元组,缩短训练时间。表示学习层中在全连接层前加入一层BiLSTM层,更好地利用光谱数据降低噪声干扰。
2 基于表示学习的高维光谱离群数据分类检测算法
在本章节,我们首先介绍实验所使用的LAMOST天文光谱数据集,接着给出研究目标最后着重介绍了基于表示学习的利群数据分类检测算法的各个组成部步骤。
2.1 LAMOST天文光谱数据
中国科学院国家天文台提供了LAMOST DR4数据集中近100万个天体的光谱数据,由国家天文科学数据中心基于科学发布版本制作成机器学习数据集。将未知天体分成恒星(star)、星系(galaxy)和类星体(QSO)三类,以期用最新的人工智能技术来解决天文研究中的实际问题。
2.2 研究目标
对国家天文台提供的天文光谱信息进行数据处理归一化等基本数据处理操作,通过RAMODO框架下的REPEN[6]算法对数据进行离群数据分析,充分利用该种表示学习的数据降维与提取特征能力,精准快速地提取出离群数据天文光谱信息所反映出的离群天体信息,并对天体进行分类。分析REPEN算法对数据离群程度评价的精确性与时间复杂度,并对其进行优化。
2.3 算法实现
离群天体分类系统的主要算法框架如下:
高维天体数据预处理后,使用主成分分析法(PCA)降维。降维后的特征向量到达阈值层,通过设定明显离群点阈值将数据分为离群数据集和内部数据集。三元组层将数据分成确认离群,确认非离群,不确定三个层次的三元组。经过浅层表示学习网络,到达目标函数层。通过设置的损失函数对网络进行训练,获得新特征向量,并使用随机距离对新特征向量分类。
2.3.1 数据提取
在数据集中,由于数据量过大,必须从不同的文件中提取出数据以进行计算,提取出数据后,需要对不同维的数据进行标准化处理和主成分分析降维[7]。其中研究的数据集完整大小约为16G。
面对占用空间如此大的数据并且不同分布于不同文件中,直接读取文件将在I/O消耗大量时间,因此选择将原始数据根据天体id存入MySQL数据库中,实验中从存放id的表格中随机选取少部分数据存入后h5文件中作为训练集和测试集,提高实验效率。后期通过随机数获取表格id的方式来使用数据库查询天体的数据。随机数获取数据的方式有利于排除因序号造成的数据片面化等影响,能更好地使数据的特性得到发挥。
2.3.2 离群点检测
经过PCA降维后的数据点到天文光谱数据中随机子集距离的方法是,通过随机选取数据子集S,选取数据点x到数据子集S最近的三个点,求取平均值r,重复这样的操作m次,得到离群分数
关键词: 表示学习;高维光谱;离群点检测;数据挖掘; 分类
Abstract: LAMOST (Large Sky Area Multi-Object Fiber Spectroscopy Telescope) Telescope provides a large amount of astronomical spectral data, and astronomical classification is a problem that has received widespread attention in astronomy. Due to the large number of celestial bodies and the high dimensionality of data, how to use machine learning methods to process spectra has become a problem in recent years. Hot spot. Aiming at the problem of celestial body classification, HSODM (High-dimensional Spectral with Outlier Data Mining) is proposed, which is an improved method for identifying high-dimensional outlier data. It uses an unsupervised learning method and combines a large number of high-dimensional spectral data based on random distance. A very small number of unknown celestial bodies or outlier data can be identified to facilitate subsequent celestial body classification, outlier data mining and other related processing. In the project, data preprocessing, principal component analysis and dimensionality reduction, long and short-term memory neural network model establishment and training, parameter tuning, result prediction and analysis are used in the project, and the model is finally evaluated and displayed by means of evaluation methods and data visualization. The improved method and optimized neural network proposed in the research can shorten the training time and improve the accuracy of model prediction. After experimentation, it is found that the improved method has corresponding improvement on ROC curve area, P-R curve area, F1 score and G-mean score.
Key words: representation learning; high-dimensional spectral; outlier detection; data mining; classification
天文学随着科学技术的发展,先进的观测设备使我们能够望向宇宙更深处,同时也带来了天文数据爆炸式的增长[1]。郭守敬望远镜(LAMOST)作为世界上光谱获取率最高的望远镜,LAMOST每个观测夜晚能采集万余条光谱,这将为一些天文和天体物理学家在星系红移巡天、宇宙学模型、宇宙大尺度结构、星系形成和演化以及结合各类射线的光谱观测等研究工作[2]上提供大量素材,对天文学领域的发展起到推动和完善作用。LAMOST数据集中的每一条光谱提供了3690-9100埃的波长范围内的一系列辐射强度值。光谱分类就是要从上千维的光谱数据中选择和提取对分类识别最有效的特征来构建特征空间,例如选择特定波长或波段上的光谱流量值等作为特征,并运用算法对各种天体进行区分 。 在天文光谱分类问题中,LAMOST数据集存在一部分离群数据,因其特征与已知天体特征不相似,而被划分为未知类别。此现象可能是由于宇宙背景噪声、光线的衰弱和红移等因素对光谱数据形成污染,造成该数据无法识别;也有可能是以往从未观察过的未知天体的光谱数据。因为对于特殊的、未知的天体挖掘,是人类探索宇宙所追求的目标之一。因此,对天文光谱数据中离群数据的挖掘显得尤为必要。
1 研究现状
目前,国内外关于天文光谱离群数据挖掘的研究相对较少。特拉维夫大学物理与天文学院的Dalya Baron和Dovi Poznanski教授提出了一种基于无监督随机森林开发的离群检测算法[3],且在斯隆数字巡天的超过两百万个星系光谱上测试该算法,并检查具有最高异常值得分的400个星系。常见的大多解决方案是将高维数据集映射到低维表示,以便为后续的学习需求保存相关信息。许多无监督表示学习方法,如:基于光谱的方法,基于神经网络的方法和流形学习,已被运用解决此类问题。这些方法大多侧重于保存数据的正则性信息因此可能无法保存离群值所携带的信息。
对于天体光谱数据而言,学者们扩展了一般的离群数据挖掘方法,提出了许多新的解决途径。娄圣金等学者根据信息熵的思想,提出一种基于属性权值的离群数据挖掘方法[4]。蔡江辉和张继福等学者,从局部稀疏程度的角度,重新定义相关子空间[5]。光谱子空间进行离群光谱数据的挖掘。但是,上述方法的计算复杂度高于线性级别,且采用了一个相对固定的模式,缺乏通过学习模型对挖掘过程进行优化。
与传统方法相比,本文给出的HSODM(High-dimensional Spectral with Outlier Data Mining)算法有三个创新之处:(1)GELU激活函数GELU是一种较新的高性能神经网络激活函数,其非线性变化是一种符合预期的随机正则变换方式。ReLU缺乏数据的统计特性,GELU引入了随机正则的思想,在ReLU的基础上加入了统计的特性,性能更好。(2)三元组数据天文光谱数据由于各个天体的差异存在不同的噪声干扰,使用三元组损失函数,通过神经网络层构建新的数据嵌入空间,增大正常数据和离群数据的欧式距离,避免其他因素对基于随机距离的分类造成影响,提高准确率。(3)表示学习神经网络在构建高维光谱数据的嵌入空间时,首先对高维数据集进行PCA降维,使用降维后的数据构建三元组,缩短训练时间。表示学习层中在全连接层前加入一层BiLSTM层,更好地利用光谱数据降低噪声干扰。
2 基于表示学习的高维光谱离群数据分类检测算法
在本章节,我们首先介绍实验所使用的LAMOST天文光谱数据集,接着给出研究目标最后着重介绍了基于表示学习的利群数据分类检测算法的各个组成部步骤。
2.1 LAMOST天文光谱数据
中国科学院国家天文台提供了LAMOST DR4数据集中近100万个天体的光谱数据,由国家天文科学数据中心基于科学发布版本制作成机器学习数据集。将未知天体分成恒星(star)、星系(galaxy)和类星体(QSO)三类,以期用最新的人工智能技术来解决天文研究中的实际问题。
2.2 研究目标
对国家天文台提供的天文光谱信息进行数据处理归一化等基本数据处理操作,通过RAMODO框架下的REPEN[6]算法对数据进行离群数据分析,充分利用该种表示学习的数据降维与提取特征能力,精准快速地提取出离群数据天文光谱信息所反映出的离群天体信息,并对天体进行分类。分析REPEN算法对数据离群程度评价的精确性与时间复杂度,并对其进行优化。
2.3 算法实现
离群天体分类系统的主要算法框架如下:
高维天体数据预处理后,使用主成分分析法(PCA)降维。降维后的特征向量到达阈值层,通过设定明显离群点阈值将数据分为离群数据集和内部数据集。三元组层将数据分成确认离群,确认非离群,不确定三个层次的三元组。经过浅层表示学习网络,到达目标函数层。通过设置的损失函数对网络进行训练,获得新特征向量,并使用随机距离对新特征向量分类。
2.3.1 数据提取
在数据集中,由于数据量过大,必须从不同的文件中提取出数据以进行计算,提取出数据后,需要对不同维的数据进行标准化处理和主成分分析降维[7]。其中研究的数据集完整大小约为16G。
面对占用空间如此大的数据并且不同分布于不同文件中,直接读取文件将在I/O消耗大量时间,因此选择将原始数据根据天体id存入MySQL数据库中,实验中从存放id的表格中随机选取少部分数据存入后h5文件中作为训练集和测试集,提高实验效率。后期通过随机数获取表格id的方式来使用数据库查询天体的数据。随机数获取数据的方式有利于排除因序号造成的数据片面化等影响,能更好地使数据的特性得到发挥。
2.3.2 离群点检测
经过PCA降维后的数据点到天文光谱数据中随机子集距离的方法是,通过随机选取数据子集S,选取数据点x到数据子集S最近的三个点,求取平均值r,重复这样的操作m次,得到离群分数