论文部分内容阅读
互联网的高速发展使得网络安全问题日益凸显,而目前的安全产品缺乏对网络传输负载进行快速而有效的分析手段。在这种情况下,黄色信息、反动信息造成的危害是巨大的。为了能够迅速而准确的识别非法信息,本文通过使用改进的模式匹配算法和粗糙集理论构建了一个网络安全监控系统。网络数据的获取、预处理和分析是网络内容监控系统的三个核心部分。本文将围绕这三个部分所涉及的关键技术展开研究与讨论。论文的主要工作如下:首先,本文对常见的协议类型进行分析,目的是还原数据,获得负载内容。由于数据包的流速往往大于协议还原的速度,这就会造成丢包现象的发生。为此,本文提出了6种措施减少该现象发生的频率,即高性能的网络适配器,增加缓冲区的容量,多线程技术,轻量级的负载均衡策略,快速的模式匹配算法,优化协议还原算法。其中,轻量级的负载均衡策略是我们根据传统的均衡技术和网络数据获取的特点提出的一种简单而又有效的方法。其次,为了使得到的数据适用于以往的分类算法,系统对它们进行了预处理。这包括两部分:一是去除结构标记,二是进行特征提取。前者是为后者做准备,因为通过协议还原获得的数据通常含有与文本内容不相关的标记,该部分如果不去掉,会给特征提取带来额外的负担。为了加快数据预处理阶段的速度,本文提出了一种基于Wu_Manber的改进算法,该算法在对于考虑切分词的多模式匹配情况下,在模式数为50时,时间较WM算法节省了33%,较AC算法节省了60%。第三,传统的特征选择算法都会遇到阈值选取问题。在网络数据的分析阶段,本文利用粗糙集理论自身的特点,在特征选取的同时解决了阈值选择问题。通过实验发现使用粗糙集特征选择算法后,当特征维数是1000-5000时,其在贝叶斯、KNN、SVM上的分类效果较词频方法具有一定的优势。最后,通过对数据的分类,系统能判断出网络中传输的异常信息。由于网络监控系统需要对传输数据进行全面而细致的描述,而本文只是还原和分析了几个常见协议,如HTTP、TELNET、POP3、MSN、FTP等等。但是本文对研究过程中所遇到的问题给出了相应的解决方案,并用大量的实验证明了它们的可行性,所以本系统是一种有益的尝试,具有一定的指导意义。本文应用的所有解决方案,都给予了实验验证。实验表明,在加快了系统各个部分的处理速度后,系统性能得到了明显的提升,且分类精度不受影响。