【摘 要】
:
随着网络技术和数字图书馆的迅猛发展,文本分类已成为处理和组织大量文档数据的关键技术。文本分类方法主要包括两大类:非监督的自动聚类算法和监督的文本分类方法。同时,随
论文部分内容阅读
随着网络技术和数字图书馆的迅猛发展,文本分类已成为处理和组织大量文档数据的关键技术。文本分类方法主要包括两大类:非监督的自动聚类算法和监督的文本分类方法。同时,随着数据量的大量增加,现有的文本分类方法在效率和精度两个方面都面临着新的考验。快速、精确地进行文本分类,变得越来越重要。
本文通过比较文本分类与图像分类的相似性,提出了把大规模文本集合转化为图像的分类算法思想。本算法能快速、精确地进行文本分类,且占用较小的内存空间,对大规模文本分类特别适用,并为拓展文本分类算法提供了一种新的思路。同时,该算法把文本分类过程分为预处理和分类两个独立的过程,有利于实验室算法的研究。最后,根据两大类文本分类算法:监督分类和非监督分类的各自优点,结合非监督分类的无人工干预的自动化和监督分类的精度高的特点,提出了一种监督分类和非监督分类相结合的分类方法:K-KNN算法,本算法以K-均值非监督聚类算法和KNN监督分类算法为基础,充分利用K-均值聚类的自动性,和KNN分类算法的高精度性,实现了大规模文本的自动化监督分类。
在分类质量评价方面,本文在引入图像的概念以后,也引入了图像分类中常用的混淆矩阵的分类结果评价方法,与传统的评价准则(准确率和召回率)相比,各类之间的错分情况一目了然,对指导改进文本分类算法,特别是关键词选取等方面,有着非常重要的实际意义。
其他文献
山东省胶南市委历来重视党员干部的学习,做了大量工作,取得了显著成效,也积累了宝贵经验。但由于一些单位集体学习时多数采取“你念我听”的方式,使一些党员干部逐渐产生了厌
基于数据的机器学习是现代智能技术中的重要方面,研究从观测数据(样本)出发寻找规律.利用这些规律对未来数据或无法观测的数据进行预测.包括模式识别、神经网络等在内,现有机器
传统的通信网络传送数据的方式是存储转发。在这种传输模式下,数据的发送节点和接收节点以外的节点只负责路由,不对数据内容做任何处理。R.Ahlswede等人于2000年提出的网络编
本文讨论了带热源的选举模型,与普通选举模型不同,其中热源并不更新意见。该模型的设定主要是用于解释共识的破裂,从而为共识形成的研究提供更深入的理解。
在本文中,作者主
小波构造一直是小波分析研究中的核心问题之一.到目前为止,一维2-进制小波与小波标架的研究已取得丰硕的成果,高维小波分析的成果远不如一维情况丰富.这是由于一般伸缩矩阵对应
GI/M/1型马氏链是一类重要的随机模型,常被用于排队理论的研究,有着广泛的应用.偏差矩阵是马氏链研究的重要内容,因为它与马氏链的遍历性收敛速度、泊松方程、扰动分析和渐近方
本文基于经典Bogdanov-Takens最简规范形的研究经验,利用首次积分和新次数函数相结合的方法由特殊到一般地研究了一类三维幂零向量场的最简规范形。
研究内容和取得成果
影响我国农村稳定的文化因素分析农村的经济改革使传统性的农村文化、价值规范发生急剧裂变,从文化层面反映了农村社会走向现代化的变迁进程,为现阶段农村政治稳定与发展提供
紧空间是拓扑空间中最重要的空间类之一,紧空间具有很好的性质,因此人们希望所讨论的空间是紧空间或者是紧空间的子空间,由此出现了紧化与紧化剩余的概念.1958年,M.Henriksen
请下载后查看,本文暂不支持在线获取查看简介。
Please download to view, this article does not support online access to view profile.