论文部分内容阅读
Internet的蓬勃发展,网络已经在人们的日常生活中扮演着越来越重要的角色。但是,随之而来的网络攻击手段也愈来愈复杂化、多元化、智能化。如何保证网络不受网络攻击入侵破坏受到人们的重视。入侵检测作为一种能够主动发现攻击行为的技术,有效地弥补了防火墙技术等传统安全防护技术的缺陷。随着不断增大的网络规模和网络流量,传统的入侵检测系统结构暴露出越来越多的局限性和缺陷,如工作量大、响应速度慢、处理能力不足问题和单点失效问题。本文设计了一个基于Hadoop集群的分布式入侵检测系统。采用分布式的三层体系结构:检测代理为第一层,负责检测入侵行为产生安全事件;数据收集器为第二层,处理第一层的数据;基于Hadoop集群构建的监控中心位于第三层。首先,本文介绍了入侵检测的定义、重要性和方法。分析了高速网络环境下的入侵检测系统所面临的主要问题和影响因素。随后,重点介绍了常见的三种分布式入侵检测系统的架构:集中分布式、层次分布式和对等协作式,并且研究比较了它们三者之间的优势和缺点。再后,本文研究分析了Hadoop集群技术,对它的两大核心技术HDFS分布式文件系统和MapReduce并行编程模型进行了细致的研究。然后,文章讨论了本系统的整体架构设计。并分析了系统组件的功能设计以及架构设计中的关键技术。再后,讨论了本系统的几个关键组件设计与实现。最后,论文提出了一种基于MapReduce编程模型的FP-Growth算法,用于解决在传统的关联规则算法无法处理海量入侵记录的问题。该算法的核心思想是:将无法基于内存构建的FP-树分解为多棵FP-子树,通过对子树的挖掘,得到全局的频度模式。根据实验结果,该算法在处理规模较大的数据时,随着计算节点的增加,算法性能也呈线性比例提升。