论文部分内容阅读
文本分类作为处理和组织海量文本信息的关键技术,该技术能够有效提高信息的管理和利用的效率,现已成为数据挖掘领域中一个重要的研究方向。
本文在分析和总结中文文本分类的中文分词、文本表示、特征降维、分类算法和分类结果评价的基础上,对特征降维、分类方法进行了深入研究。本文的研究内容主要包括以下几个方面:
(1)将支持向量机算法(SVM)和K最近邻算法(KNN)分别应用于文本分类实践中,并对两种算法分类性能存在差异的原因进行分析,重点对支持向量机在文本分类应用中的优势和不足进行了探讨。
(2)分析多项式核函数和径向基核函数两种核函数与支持向量机分类性能之间的关系,通过调整核函数参数,优化文本分类性能,为文本分类中核函数参数的选择和改进提供指导。
(3)本文将潜在语义分析(LSA)引入到文本分类实践当中,将使用潜在语义分析进行特征降维并结合支持向量机进行文本分类的方法称之为LSASVM方法。实验结果表明采用本文提出的LSASVM方法进行文本分类能取得较高的准确性,且分类性能稳定。
(4)研究数据样本类别大小均衡性对文本分类性能的影响,通过实验比较了长文本和短文本在分类性能上的差异,并分析了长文本和短文本在分类性能方面存在差异的原因。
本文在分析和总结中文文本分类的中文分词、文本表示、特征降维、分类算法和分类结果评价的基础上,对特征降维、分类方法进行了深入研究。本文的研究内容主要包括以下几个方面:
(1)将支持向量机算法(SVM)和K最近邻算法(KNN)分别应用于文本分类实践中,并对两种算法分类性能存在差异的原因进行分析,重点对支持向量机在文本分类应用中的优势和不足进行了探讨。
(2)分析多项式核函数和径向基核函数两种核函数与支持向量机分类性能之间的关系,通过调整核函数参数,优化文本分类性能,为文本分类中核函数参数的选择和改进提供指导。
(3)本文将潜在语义分析(LSA)引入到文本分类实践当中,将使用潜在语义分析进行特征降维并结合支持向量机进行文本分类的方法称之为LSASVM方法。实验结果表明采用本文提出的LSASVM方法进行文本分类能取得较高的准确性,且分类性能稳定。
(4)研究数据样本类别大小均衡性对文本分类性能的影响,通过实验比较了长文本和短文本在分类性能上的差异,并分析了长文本和短文本在分类性能方面存在差异的原因。