论文部分内容阅读
我们正处在信息化的社会,大量信息在给人们带来方便的同时也带来了一大堆问题:第一是信息过量,难以消化;第二是信息真假难以辨识;第三是信息安全难以保证;第四是信息形式不一致,难以统一处理。人们开始提出一个新的口号:“要学会抛弃信息”。人们开始考虑:“如何才能不被信息淹没,而是从中及时发现有用的知识、提高信息利用率?”面对这一挑战,数据挖掘和知识发现技术就应运而生,并显示出强大的生命力。数据挖掘是将隐含的、尚不为人知的,同时又是潜在有用的信息从数据中提取出来,建立计算机程序,自动在数据库中细察,以发现规律或者模式。
演化算法是一类模拟生物进化过程与机制求解问题的自组织、自适应、自学习的人工智能技术,具有稳健性、通用性、思想简单、易于实现、应用效果明显等优点,基于种群的搜索机制使其适合大规模并行。演化算法的三大分支之一是遗传算法(genetic algorithm,简称GA)。20世纪90年代初,在遗传算法的基础上又发展了一个分支:遗传程序设计(genetic programming,简称GP)。遗传算法和遗传程序设计这两个算法虽然都遵循自然界优胜劣汰的基本原理,但是它们最初在工程应用领域具有不同的功能:遗传算法主要用于函数优化,而遗传程序设计则主要用于建模。以遗传算法和遗传程序设计为代表的演化计算在工程应用等优化问题中与传统的数学方法相比,表现出非常明显的优势。而且近年来演化计算在数据挖掘,特别是分类规则挖掘中的应用研究已经取得了相当大的发展。虽然很多学者认为演化计算只是优化和搜索算法,但是它在数据挖掘领域的良好效果已经使其成为数据挖掘中不可或缺的一个重要工具。基因表达式编程(Gene Expression Programming.GEP)是C.Ferreira发明的一种新的遗传算法。基因表达式编程结合了遗传算法和遗传程序设计的优点,克服了它们的缺点,在数学建模方面取得了非常好的效果。正因为其优点和良好的效果,使得基因表达式编程在并不漫长的时间里引起了演化计算领域的广泛关注甚至争议。
模糊分类规则是将模糊系统和分类规则相结合的产物,是一种特殊的模糊系统。模糊分类规则被认为是分类知识较好的表示,模糊规则具有可读性和解析性,而且模糊规则的使用是相当直观的。分类(Classifier)是从训练数据找出一个类别的概念描述,它描述了这类数据的整体信息,依据概念描述来建立分类器,并用该模型来预测新的数据所属类,它是数据挖掘的主要分支之一。分类系统在生活与工程领域一直扮演着相当重要的角色,自模糊理论提出以来,加入了模糊概念的分类系统,更适合实际分类问题的应用。
本文主要在基因表达式编程的基础上发现模糊分类规则,研究改进的基因表达式编程在模糊分类中的重要应用。本文的主要章节安排如下:第一章介绍了论文的选题及其研究意义、选题的国内外研究现状、主要的研究内容。第二章中概述了演化算法,内容包括演化计算的起源、基本分类,基因表达式编程的起源和基本算法、关键技术以及发展方向。第三章是分类规则挖掘的介绍,主要介绍了几种比较常用的分类算法。第四章是模糊分类规则挖掘研究现状介绍部分,首先对数据挖掘技术和模糊分类规则技术作了一个简单的介绍,然后给出现有模糊分类规则挖掘技术的基本方法,模糊分类规则挖掘中的基本问题和需要解决的问题。第五章是用基冈表达式编程技术挖掘模糊分类规则,提出了一种用改进的基因表达式编程技术挖掘模糊分类规则的方法。并通过试验结果说明了该方法与现有数据挖掘方法相比的优势和缺点。第六章,总结了论文的主要工作和后续工作。