论文部分内容阅读
随着银行界数据仓库技术的不断发展成熟,人们积累的数据越来越多,人们希望从这些海量的数据里面获取出一些以前不知道的,隐含在其内部的知识和规律,用来指导决策。这个时候,数据挖掘技术应运而生,正好可以满足人们的这个需要。
数据挖掘是数据库中的知识发现,也就是从数据中发现知识和寻找规律,并用它们指导生产或管理,提高效益。数据挖掘是一个有着广阔应用前景的新型领域,目前,许多行业都可以用数据挖掘来为其解决问题,提供决策。
在数据挖掘的流程中,比较重要的一步就是数据的预处理,包括数据理解和数据准备。数据理解就是对企业现有数据的理解,在此基础上进行数据质量问题的鉴定;数据准备又可以分为数据抽样、数据清理、数据离散化和数据转换等等步骤。本论文就是研究整个数据预处理的过程。
现阶段,由于银行大量数据都是存储于各地分行中,即数据是分布式存储的,而总行要进行数据挖掘时,把各分行数据全部汇总到一起显然不可能,一个是数据量实在太大,会浪费很多时间,另外一个原因是,目前数据挖掘算法所能处理的数据量毕竟有限,不可能同时处理这么多的数据。
本文提出了一种解决方案,就是利用整群抽样方法与其他如分层随机抽样和分层等距抽样等方法结合,先利用分布式抽样来抽取出一部分分行数据样本,再对这些样本进行预处理及数据挖掘,这样就大大节省了时间,提高了效率。
另外,在预处理中,分析表建成后,根据不同的任务可能会再抽取出一部分数据进行挖掘,通过对分析表里的数据进行分析,本文提出了另外一种数据抽样方法,即分层二次等距抽样,实验证明,分层二次等距抽样的效果比其他几种抽样的效果都要好得多。
目前,本系统已经调试成功,并在某银行数据仓库上运行通过,正在进行加入新的模块等升级工作。