论文部分内容阅读
数据库中的知识发现(KDD)是当前涉及统计学、人工智能、数据库等学科的热门研究领域。数据挖掘(DM)是从数据中提取人们感兴趣的、潜在的、可用的知识,并表示成用户可理解的形式。分类是数据挖掘的一个重要分支,分类能找出描述数据类或概念的模型(或函数),以便能使用模型预测类标记未知的对象类。 粗糙集合是波兰数学家Pawlak提出的一种对不确定性知识的表示方法,粗糙集合理论凭借其独特的优势而在KDD领域中具有越来越重要的地位。信息熵是信息论的一个概念,目前被广泛用于数据分析领域。 本文提出了一种基于粗糙集合和信息熵的RSE算法模型,该算法模型包括两个组成部分一分类模型和预测模型。分类模型是以经典的粗糙集合理论和信息熵理论为基础,依据信息熵理论对属性进行筛选,依据不可区分关系确定等价类,从而提取决策规则。预测模型是以粗糙集合的扩展模型—容差粗糙集合模型为基础,依据对象与决策规则容差的定义,给出待测对象的预测类别。 此外,我们设计了基于RSE算法模型和ID3算法模型的原型系统—R-DM,该系统实现了RSE算法和ID3算法的分类模型和预测模型,在此统一的平台上,我们通过对UCI提供的多个标准测试数据集进行测试,对RSE算法和ID3算法进行了分析比较。实验证明,RSE算法确实优于ID3算法。