基于X*树的反k近邻流数据离群点挖掘算法研究

来源 :燕山大学 | 被引量 : 0次 | 上传用户:nvli2010
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
数据流数据挖掘技术是信息科学领域的前沿研究课题之一,被公认为是数据挖掘研究中一个极富应用前景的领域。在众多的数据流数据挖掘算法中,挖掘离群点是其中一个重要的研究内容,构建支持k近邻查询的高效索引结构又是挖掘流数据离群点的关键问题之一。迫切需要在有限运行空间上,通过对数据流进行一次或较少次数的扫描有效地进行流数据离群点挖掘。在这种情况下,本文对国内外关于数据流离群点研究现状进行了综合分析比较,主要在以下几个方面研究了基于X*树的反k近邻流数据离群点挖掘算法。首先,研究了支持k近邻查询的X*树索引结构。针对X树数据索引结构在进行k近邻查询时所需要的时间和空间开销存在着严重的效率问题,提出了适合进行k近邻查询的新的数据索引结构结点分裂算法,提出了X*树索引结构,它比X树需要更少的存储空间,不需要额外存储结点分裂的历史信息。其次,研究了流数据离群点的挖掘算法,通过对已有相关算法进行的全面深入地分析,发现它们不能及时地捕捉流数据的概念漂移信息,而且需要对数据集进行多遍扫描才能给出挖掘结果。因此,提出基于反k近邻的流数据离群点挖掘算法,该算法只需对当前窗口扫描一次。最后,选用真实数据和仿真数据进行实验,通过实验结果验证了本文所提出的支持k近邻查询的X*树索引结构和基于反k近邻的流数据离群点挖掘算法的可行性和有效性。
其他文献
本文首先简单介绍了北京大学网格协作平台Harmonia,随后主要介绍了它的底层部分H-执行环境的设计和实现,H-执行环境把遗产程序的运行和监控抽象为运行、状态监测、数据传输、安
计算机技术在医疗领域的应用方兴未艾。医疗行业需要实用性强,易于普及,成本低廉,作用范围广,功能全面的医院信息管理系统。本文在分析了现有的医院信息管理系统的基础上,根据医院
企业级软件配置管理信息系统现有设计有4个主要技术问题:可用性、大量的并发客户机支撑、不断增长的存储空间和客户机多种配置。 本文采用了基于LVS集群的高可用性、高伸缩
本论文的研究目的是搭建一个telnet终端仿真并相应实行Web扩展功能的校园BBS系统;采用Firebird代码为基础,用C语言对Firebird进行二次开发,完成一个符合中国地质大学(北京)校园
本论文共分为八章。论文第一章是引言,主要介绍了论文研究背景及意义、国内外研究动向和论文各部分的内容安排。第二章是数据挖掘和数据预处理,简要介绍了数据挖掘的相关知识,并
本文通过对计算机网络、网络管理技术、网络管理需求以及各种新技术(Web技术、移动计算技术、分布式计算技术、Java技术等)的研究,提出了一个新型的基于Web服务和Java平台的网
IEEE802.16e是下一代移动无线宽带城域网的最新标准,支持用户节点以车辆速度移动。为了提高移动终端的能量效率,IEEE802.16e提出三种休眠模式,其中,节能类型I用于尽力而为BE
身份认证/鉴别和密钥建立协议(在本文中简称为认证协议)作为网络安全的基础部分,直接影响着各种网络应用的安全。研究者们发现,虽然协议的参与主体和消息数目都很少,但设计一个
学位
随着三维扫描技术的成熟和可扫描物体复杂度的提高,三维网格模型日益成为三维物体的一种通用表示方式,其中又以三角网格模型最为常见。作为众多网格模型处理技术的前序步骤,三角