论文部分内容阅读
本文介绍了一套自动分类系统,该系统以一批MARC(MachineReadableCatalog,机读编目格式)数据为训练和测试集合,以DDC(DeweyDecimalClassification,杜威十进制分类法)为目标分类体系。之所以做这样的研究基于以下的考虑: 1.当前,编目仍然是图书馆的重要工作之一,为此图书馆需要投入大量的资源。如何将自动分类应用于图书馆以减轻编目人员的负担,是一个很有实际意义的研究方向。 2.随着OPAC(OnlinePublicAccessCatalogue)系统的广泛应用,图书馆积累了许多高质量的书目数据。书目数据是一种宝贵的人类知识,但目前对其利用还仅限于图书检索,如何进一步开发利用是一个相当有意义的研究方向。 3.DDC是在图书馆界应用广泛的分类法,具有体系全面、发展稳定、历史悠久的特点。如何在自动分类中应用像DDC这样的图书分类法也是一个有研究价值的方向。 文中的主要工作和价值可以概括为以下几点: 1.考察将MARC数据和DDC分类法用于自动分类的可行性。MARC数据存在类目样本分布不均匀的问题,而且可以用于分类的信息比较少(只有标题,主题词等);DDC分类法存在并非完全依照主题进行类目划分的问题。针对这些问题本文以适当的策略对数据集合进行了简化处理,以使实验的可行性更高。 2.实现并对比分析了五种特征提取方法,分别是:词汇频率(TF)、反文献频率(TFIDF)、文献频率(DF)、CHI-SQUARE统计量、互信息(MI)。实验表明,在本文的数据集合上,DF方法优势比较明显,不仅有效提高了分类效果,而且原理简单,计算量小。 3.实现并对比分析了四种自动分类方法,分别是:Rocchio方法、朴素贝叶斯方法(NaiveBayes)、k最近邻方法(kNN)、支持向量机方法(SVM)(SVM方法采用了libsvm[26]系统中的部分源代码)。对于大数据集合来说,分类方法中Rocchio方法具有优势,主要体现在时间和空间效率高,分类效果相对不错。对于小数据集合来说,SVM方法的优势比较明显,开放测试是可以达到76%的微观平均F1,封闭测试时可以达到98%的微观平均F1。其次是Roeehio方法。再次是NB方法,它虽然整体分类效果不太突出,但是算法简单,时间空间效率很高,适合各种测试情况。kNN效果相对较差。上面的结果都是在相对苛刻的条件下获得的,如果放宽测试条件,评价指标还可以提高。 4.结合DDC分类法的特点提出并实现了一种分类结果优化思路。由于DDC分类法是十进制的等级分类法,它的类号本身可以提供不少信息,通过分析多标目分类结果的类号分布,可以修正分类结果,从而达到优化的目的。 5.结合实验数据的分布特点对Rocehio方法提出并实现了一种优化思路。由于实验数据集合分布不均匀,实验中借鉴了朴素贝叶斯方法的思想,为每个类提供了一个先验概率参数,即每个类中的文献数量与总文献数量的比,用这个参数可以修正分类结果,提高了分准率。 6.根据DDC的特点,调整了评价过程,使评价指标相对普通的评价方法有约10%的提高,更好地反映了分类算法的能力。