论文部分内容阅读
文本分类是文本信息处理研究的一个重要方向,是组织和处理海量文本信息的核心技术。近年来将其他领域的方法运用到文本分类领域的研究不断涌现,本文研究使用粒子群优化算法(particle swarm optimization,PSO)优化文本分类。 首先,本文研究面向文本分类的粒子群算法改进,通过分析粒子群算法的收敛原理,构造新的函数式收缩因子,并通过实验验证其合理性;同时还将惯性权重与改进的函数式收缩因子结合,构建前期使用惯性权重后期使用改进收缩因子的速度变化方案,实现对粒子群算法中速度更新方式的改进;并将改进后的粒子群算法运用于文本特征选择中,实验结果表明改进后的粒子群算法能搜索得到更好的文本特征集合,从而得到更好的文本分类准确率。其次,在改进的粒子群算法的基础上构建基于粒子群优化的文本分类模型,模型中包括基于改进粒子群优化的文本特征选择和基于粒子群优化的文本分类规则挖掘,并将基于改进粒子群优化的文本特征选择与基于粒子群优化的文本分类规则挖掘结合起来。模型中还研究了文本特征选择规则的编码设计、文本分类规则的编码设计、适应度函数的设计以及具体的算法设计。模型中设计了两个粒子群,即特征选择粒子群和规则挖掘粒子群,特征选择粒子群搜索得到文本特征集合,而规则挖掘粒子群则在该文本特征集合的基础上挖掘文本分类规则,并将文本分类规则集和在小测试集上的分类准确率反馈给特征选择粒子群,从而指导特征选择粒子群搜索得到更优的文本特征集合,规则挖掘粒子群则会该文本特征集合上构建更优的文本分类规则集。最后,通过在中文新闻分类语料库、英文新闻分类语料库和情感挖掘语料库三个语料库上的实验,验证本文模型的优越性,并通过对实验结果的分析验证本文提出的理论假设的合理性;通过实验还研究了不同特征加权方式和不同分词工具对本文模型分类准确率的影响,实验结果表明不同的特征加权方式和分词工具均会对本文模型的分类准确率产生影响,在不同的分类情形中应该选用不同的分词工具以使本文模型达到更好的分类效果。