基于表示学习的高维光谱离群数据挖掘

来源 :电脑知识与技术 | 被引量 : 0次 | 上传用户:laoye1111
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
  摘要:LAMOST(郭守敬望远镜)提供了大量的天文光谱数据,而天体分类是天文学中得到广泛关注的问题,由于天体数量大,数据维度高,如何使用机器学习的方法对光谱进行处理,成为近些年的热点。针对天体分类问题,提出了HSODM(High-dimensional Spectral with Outlier Data Mining),这是一种改进的高维离群数据识别方法,其采用无监督学習方式,基于随机距离将大量高维光谱数据中的极少数未知天体或离群数据识别出来,便于后续天体分类、离群数据挖掘等相关处理。项目中运用数据预处理、主成分分析降维、长短期记忆神经网络模型建立与训练、参数调优、结果预测与分析,最终通过评估方法和数据可视化等手段对模型进行评价与展示。研究中提出的改进方法和优化的神经网络可以缩短训练时间,提高模型预测准确度。经过实验发现,改进方法对ROC (receiver operating characteristic) 曲线面积、P-R曲线面积、F1分数和G-mean分数都有相应的提高。
  关键词: 表示学习;高维光谱;离群点检测;数据挖掘; 分类
  Abstract: LAMOST (Large Sky Area Multi-Object Fiber Spectroscopy Telescope) Telescope provides a large amount of astronomical spectral data, and astronomical classification is a problem that has received widespread attention in astronomy. Due to the large number of celestial bodies and the high dimensionality of data, how to use machine learning methods to process spectra has become a problem in recent years. Hot spot. Aiming at the problem of celestial body classification, HSODM (High-dimensional Spectral with Outlier Data Mining) is proposed, which is an improved method for identifying high-dimensional outlier data. It uses an unsupervised learning method and combines a large number of high-dimensional spectral data based on random distance. A very small number of unknown celestial bodies or outlier data can be identified to facilitate subsequent celestial body classification, outlier data mining and other related processing. In the project, data preprocessing, principal component analysis and dimensionality reduction, long and short-term memory neural network model establishment and training, parameter tuning, result prediction and analysis are used in the project, and the model is finally evaluated and displayed by means of evaluation methods and data visualization. The improved method and optimized neural network proposed in the research can shorten the training time and improve the accuracy of model prediction. After experimentation, it is found that the improved method has corresponding improvement on ROC curve area, P-R curve area, F1 score and G-mean score.
  Key words: representation learning; high-dimensional spectral; outlier detection; data mining; classification
  天文学随着科学技术的发展,先进的观测设备使我们能够望向宇宙更深处,同时也带来了天文数据爆炸式的增长[1]。郭守敬望远镜(LAMOST)作为世界上光谱获取率最高的望远镜,LAMOST每个观测夜晚能采集万余条光谱,这将为一些天文和天体物理学家在星系红移巡天、宇宙学模型、宇宙大尺度结构、星系形成和演化以及结合各类射线的光谱观测等研究工作[2]上提供大量素材,对天文学领域的发展起到推动和完善作用。LAMOST数据集中的每一条光谱提供了3690-9100埃的波长范围内的一系列辐射强度值。光谱分类就是要从上千维的光谱数据中选择和提取对分类识别最有效的特征来构建特征空间,例如选择特定波长或波段上的光谱流量值等作为特征,并运用算法对各种天体进行区分 。   在天文光谱分类问题中,LAMOST数据集存在一部分离群数据,因其特征与已知天体特征不相似,而被划分为未知类别。此现象可能是由于宇宙背景噪声、光线的衰弱和红移等因素对光谱数据形成污染,造成该数据无法识别;也有可能是以往从未观察过的未知天体的光谱数据。因为对于特殊的、未知的天体挖掘,是人类探索宇宙所追求的目标之一。因此,对天文光谱数据中离群数据的挖掘显得尤为必要。
  1 研究现状
  目前,国内外关于天文光谱离群数据挖掘的研究相对较少。特拉维夫大学物理与天文学院的Dalya Baron和Dovi Poznanski教授提出了一种基于无监督随机森林开发的离群检测算法[3],且在斯隆数字巡天的超过两百万个星系光谱上测试该算法,并检查具有最高异常值得分的400个星系。常见的大多解决方案是将高维数据集映射到低维表示,以便为后续的学习需求保存相关信息。许多无监督表示学习方法,如:基于光谱的方法,基于神经网络的方法和流形学习,已被运用解决此类问题。这些方法大多侧重于保存数据的正则性信息因此可能无法保存离群值所携带的信息。
  对于天体光谱数据而言,学者们扩展了一般的离群数据挖掘方法,提出了许多新的解决途径。娄圣金等学者根据信息熵的思想,提出一种基于属性权值的离群数据挖掘方法[4]。蔡江辉和张继福等学者,从局部稀疏程度的角度,重新定义相关子空间[5]。光谱子空间进行离群光谱数据的挖掘。但是,上述方法的计算复杂度高于线性级别,且采用了一个相对固定的模式,缺乏通过学习模型对挖掘过程进行优化。
  与传统方法相比,本文给出的HSODM(High-dimensional Spectral with Outlier Data Mining)算法有三个创新之处:(1)GELU激活函数GELU是一种较新的高性能神经网络激活函数,其非线性变化是一种符合预期的随机正则变换方式。ReLU缺乏数据的统计特性,GELU引入了随机正则的思想,在ReLU的基础上加入了统计的特性,性能更好。(2)三元组数据天文光谱数据由于各个天体的差异存在不同的噪声干扰,使用三元组损失函数,通过神经网络层构建新的数据嵌入空间,增大正常数据和离群数据的欧式距离,避免其他因素对基于随机距离的分类造成影响,提高准确率。(3)表示学习神经网络在构建高维光谱数据的嵌入空间时,首先对高维数据集进行PCA降维,使用降维后的数据构建三元组,缩短训练时间。表示学习层中在全连接层前加入一层BiLSTM层,更好地利用光谱数据降低噪声干扰。
  2 基于表示学习的高维光谱离群数据分类检测算法
  在本章节,我们首先介绍实验所使用的LAMOST天文光谱数据集,接着给出研究目标最后着重介绍了基于表示学习的利群数据分类检测算法的各个组成部步骤。
  2.1 LAMOST天文光谱数据
  中国科学院国家天文台提供了LAMOST DR4数据集中近100万个天体的光谱数据,由国家天文科学数据中心基于科学发布版本制作成机器学习数据集。将未知天体分成恒星(star)、星系(galaxy)和类星体(QSO)三类,以期用最新的人工智能技术来解决天文研究中的实际问题。
  2.2 研究目标
  对国家天文台提供的天文光谱信息进行数据处理归一化等基本数据处理操作,通过RAMODO框架下的REPEN[6]算法对数据进行离群数据分析,充分利用该种表示学习的数据降维与提取特征能力,精准快速地提取出离群数据天文光谱信息所反映出的离群天体信息,并对天体进行分类。分析REPEN算法对数据离群程度评价的精确性与时间复杂度,并对其进行优化。
  2.3 算法实现
  离群天体分类系统的主要算法框架如下:
  高维天体数据预处理后,使用主成分分析法(PCA)降维。降维后的特征向量到达阈值层,通过设定明显离群点阈值将数据分为离群数据集和内部数据集。三元组层将数据分成确认离群,确认非离群,不确定三个层次的三元组。经过浅层表示学习网络,到达目标函数层。通过设置的损失函数对网络进行训练,获得新特征向量,并使用随机距离对新特征向量分类。
  2.3.1 数据提取
  在数据集中,由于数据量过大,必须从不同的文件中提取出数据以进行计算,提取出数据后,需要对不同维的数据进行标准化处理和主成分分析降维[7]。其中研究的数据集完整大小约为16G。
  面对占用空间如此大的数据并且不同分布于不同文件中,直接读取文件将在I/O消耗大量时间,因此选择将原始数据根据天体id存入MySQL数据库中,实验中从存放id的表格中随机选取少部分数据存入后h5文件中作为训练集和测试集,提高实验效率。后期通过随机数获取表格id的方式来使用数据库查询天体的数据。随机数获取数据的方式有利于排除因序号造成的数据片面化等影响,能更好地使数据的特性得到发挥。
  2.3.2 离群点检测
  经过PCA降维后的数据点到天文光谱数据中随机子集距离的方法是,通过随机选取数据子集S,选取数据点x到数据子集S最近的三个点,求取平均值r,重复这样的操作m次,得到离群分数
其他文献
摘要:在21世纪,计算机技术正在朝着集成和网络发展。信息技术推动信息社会的飞速发展,另外,伴随着微电子技术的飞速发展,对传统的效率低下的办公方式发起了冲击。随着大学教育的普及,越来越多的学生可以接受高等教育,另外由于近几年的教学改革,学生自由选课,修学分成为主流高校的培养模式。利用互联网技术开发学生选课管理系统,符合目前的发展状况。学生选课变得尤为重要,学生选课系统的设计与开发时间紧迫。该系统以J
摘要:Java程序设计语言由于采用面向对象和程序设计思想,并且与C、C 程序设计语言有着很多的相似之处,由于其简单、易学、跨平台、安全性等优势,因此受到了广大程序设计人员的喜爱,也成为目前Web开发、Android软件开发的主要语言,在计算机软件开发中得到了广泛的应用。该文在对Java程序设计语言的特点与应用分析的基础之上,对目前软件开发的现状与需求进行了分析,最后提出了Java在软件开发中应用
摘要:随着社会的不断发展,人们的空闲时间越来越多。然而,这些空闲时间都有一个共同点,就是太过于分散了,随着这一问题的出现,渐渐引发了一种新的学习方式——碎片式学习。该文根据碎片化的学习方式,提出一款基于Android的英语学习App,可以帮助人们碎片化学习,满足大多数人的英语学习需要。日趋成熟的网络技术,价格低廉的移动设备,加上广阔的社会需求为移动英语学习的发展奠定了好的基础。  本设计针对现在学
摘要:随着Internet商用化所带动的视频、音频及数字通信的发展,人们对光纤通信寄予了更高的希望,渴望能发现一种无论是在速率方面还是在容量方面都优于传统无线网络的技术,OFDM技术所具备的各项优点让其在光通信领域中脱颖而出,被视作光通信领域的未来之光。但OFDM技术并不局限于此,而是一直向新领域扩展并尝试与各个领域结合。光正交频分复用技术(Optical orthogonal Frequency
摘要:在当前的汽车生产制造行业中,汽车软件开发制造属于十分重要的一个环节,也是保证企业有效生产的重要基础,也就需要合理进行汽车软件开发。在目前的汽车软件开发中,相关技术人员需要结合Aspice实行具体软件开发,全面把握汽车软件开发流程,在此基础上才能够使汽车软件的开发取得比较理想的成果,进而制造出高质量的汽车软件,满足汽车的应用需求及制造要求,最终实现有效的汽车生产制造。  关键词:Aspice;
在互联网飞速发展的今天,图书教育也在由传统的图书向互联网和移动互联网化过渡,而图书教育二维码管理系统正是互联网在图书教育方面的应用体现。通过在图书上部署相应的二维码,当图书用户扫描二维码后,可以在原有图书实体文字的基础上通过移动设备为读者带来文本、音频、视频等多媒体扩展资源,让图书教育不拘泥于单纯的书本本体阅读,而是多元化扩展阅读。图书教育二维码系统是利用移动设备App扫码并且基于SaaS模式,使
摘要:个人出行逐渐成为人们出游的首选,但是市场上缺少可以为用户深度定制旅行路线的软件。该文介绍了一种基于SpringBoot后端和Android客户端的个性化旅游路线推荐系统,实现了北京区域内景点的推荐功能。经过测试,可以实现用户登录注册以及路线规划功能。  关键词:Android;SpringBoot;Mybatis;個性化旅游;TSP  1 背景  随着移动互联网的发展和人们生活水平的提高,旅
摘要:路径规划技术已经成为各大领域研究的话题,在生活中被广泛使用,具有很高的研究价值。而路径规划技术的主要核心在于路径规划算法。首先,对路径规划技术进行概述。其次,对常用的路径规划相关算法进行分析和总结,提出其所存在的缺点及问题。再着重对目前各种改进算法、混合算法的使用等方面进行分析,对其改进方向、使用场景等方面进行总结。最后,对路径规划算法所存在的问题进行提出,对下一步的改进与研究趋势进行展望。
腺体病变引起的疾病如结肠腺癌、乳腺癌等的发病率逐年增高,病理检查是临床诊断的"金标准",从病理图像中准确分割病灶范围对疾病的诊疗至关重要,然而这是一项费时费力的工作,同时与病理医生的水平与经验有关。近年来,计算机辅助诊断系统和深度学习(Deep learning)在医学图像处理领域快速发展并得到广泛应用,为进一步减轻医生的工作负担,采用经典神经网络对腺体病理图像进行区域分割,并使其能够适用于更加广
摘 要: 在多项式神经网络训练算法中,当采用智能优化算法进行学习优化时,智能优化算法的控制参数对学习效果有很大影响,针对这一问题,本文提出了一种多项式神经网络的智能优化方法,其的控制参数是通过对单形领域的完全随机搜索来使用的,且粒子的多样性是通过种群的多特征状态来维持的,以避免算法陷入局部最优解,试验结果表明,该算法训练的神经网络不仅能有效提高识别率,而且能减小控制参数对学习性能的影响,提高算法的