论文部分内容阅读
随着互联网与数据库技术的飞速发展,很多企业和政府组织都建立了管理信息系统,积累的数据也越来越多。人们对信息技术的需求从单纯的事务处理逐渐转向更为宽广的领域。以知识发现为目的的数据仓库和数据挖掘技术成为了当前研究的热点。然而想要从数据中挖掘出我们感兴趣的知识,首先就要确保数据集的质量。为此,研究人员提出了很多数据清洗的方法,缺失值处理就是其中的重要组成部分。
学术界广为接受的观点认为:目前并没有唯一正确的缺失值处理的方法。缺失值处理的方式和结果在很大程度上受到具体应用环境和领域知识的影响。本文结合实际项目中的情况,从数据来源、信息化程度等方面提出了社区综合决策支持系统中缺失值处理子系统的特点和需求。在广泛调研国外研究成果的基础上,设计实现了缺失值处理子系统的核心算法以及原型系统,取得了良好的效果。
具体的来讲,本文主要的研究内容和成果如下:
■根据社区数据的特点,提出以分析为导向的缺失值处理策略。并且以此为纲设计实现了缺失值填充算法,很好的解决了多概念层上的缺失值填充问题。
■对连续型属性的填充,本文在采用局部填充方式的基础上,结合概念分层提出了最小局部集算法GroupBy及其改进的算法Minl Set Impute,使得填充的结果更加符合分析的需要。
■在离散型属性的填充方面,本文采用决策树算法来预测待填充的类标号。详细分析了决策树的剪枝算法。同时结合概念分层提出算法Left pruning tree和Right pruning tree,以改进决策树填充的结果,提高了填充的准确性。
■本文提出以机器学习的方式来自动删除数据集中过分缺失的记录。设计并实现了基于频繁属性集的缺失记录自动删除方法,减少了用户的工作量。
■本文采用最新的数据清洗工具的设计思想,设计并实现了缺失值处理的原型系统。使用XML定义了缺失值处理模型,实现了逻辑层和物理层的分离,增强了系统的可扩展性。