论文部分内容阅读
随着现代计算机网络技术和图像存获取技术的快速发展,互联网上的图像数据急剧增加,出现了图像数据极为丰富但有用图像信息与知识贫乏的现象,这就迫切需要一种用于挖掘图像数据中有用信息的技术,由此,图像挖掘技术应运而生。图像挖掘技术的目的是挖掘图像数据中潜在的大量有用信息和知识,并为图像信息的决策起指导作用。目前,图像挖掘已经成为各界研究的热点,但其还处于初期阶段,仍然需要进行不断地深入研究。文本图像是一种具有文本信息含义的特殊图像,在现实生活中具有重要的地位,某些文本图像也就成为了图像挖掘技术研究的对象。为了更好的理解文本图像中的文本信息,有必要对文本图像进行分类研究。本文首先全面介绍了图像挖掘中的分类算法,然后对决策树分类算法和文本图像的特征进行了深入研究,最后重点研究文本图像的分类方法。主要研究内容和成果如下:(1)提出了一种基于新的属性选择标准的ID3改进算法。原ID3算法的属性选择标准为信息增益,但此标准存在算法执行时间长和属性选择标准偏向取值多的属性的缺点,针对这些缺点,分别采用了等价无穷小的简化方法和引入属性重要度的方法,最终得到了种新的属性选择标准。(2)深入研究了三类不同文本图像的特征,通过图像的灰度直方图和灰度共生矩阵寻找此三类文本图像的特征向量,分别从文本图像的均值、方差、偏度、对比性、同质性、能量和相关性七个角度进行对比分析,最终得到区分文本图像的特征向量。(3)设计了一种基于底层图像特征组合的文本图像分类方法。该方法依据文本图像特征提取过程中所得到的分类特征向量,并分别采用ID3算法、C4.5算法和改进ID3算法对文本图像进行分类。实验表明该文本图像分类方法具有较好的分类效果。本文针对决策树ID3算法的不足进行了改进,并将决策树分类技术应用于文本图像分类中,依据提取文本图像的分类特征向量,并采用决策树分类器对文本图像进行分类,最终实现了三类文本图像的有效分类,这就有利于用户又快且又准确的搜索文本图像,具有一定的实用价值。