论文部分内容阅读
聚类算法是数据挖掘中用来发现数据分布和隐含模式的一种重要算法,它把大量数据点的集合分成若干类,使得每个类中的数据最大程度地相似,而不同类中的数据最大程度地不同。线指数是代表光谱中的某些特征的数值,一般为光谱中某一段的积分星等、某条谱线的等值宽度(EW)、或者半高全宽(FWHM)、也可以是光谱中几个线指数的组合。本课题总结了数据挖掘方法在巡天数据处理与分析中的应用,针对巡天数据的特点提出了一种新的方法:使用线指数作为巡天数据的特征,对恒星光谱巡天数据进行聚类以及离群分析。本课题以Lick线指数作为巡天光谱数据的特征值,使用k均值聚类算法完成了巡天光谱数据的聚类分析,并利用聚类结果进行了离群分析。实验结果证明该方法能够快速有效的将具有相似物理特征的数据聚集到一起,在发现稀有星体上有很好的效果,可以应用到巡天数据的研究中。具体工作如下:(1)总结聚类分析、离群分析以及特征提取在巡天数据中的相关应用。综述了数据挖掘中聚类算法、离群分析的分类和原理以及常用的算法在天文学中的具体应用;总结了光谱数据的特征提取中PCA和线指数两种不同方法及其应用。(2)研究以线指数为特征的恒星巡天数据的聚类。对恒星巡天数据计算Lick线指数,以Lick线指数作为光谱特征,利用k均值算法对恒星巡天数据进行聚类。实验结果表明,该方法能够快速有效的将物理相关性很强的数据聚集在一起,簇与簇之间有明显的相异性。(3)研究基于线指数的恒星巡天数据离群分析。对聚类结果中的容量较小的簇以及均值谱比较特殊的簇进行离群分析,发现了发射线恒星、晚M型恒星以及贫金属星等稀少星体,证明了以线指数为特征的光谱数据聚类能够很好的将稀少的星体分离出来。总的来说,以线指数为特征的巡天数据的聚类以及离群分析具有很好的效果,能够快速有效的将相似数据聚集在一起,分离特殊的数据。对该方法的算法模型有待进一步的研究,使其能够达到一个更好的效果,从而将该算法更好的应用到LAMOST巡天项目中。