论文部分内容阅读
在以向手机上网的用户进行移动业务精准营销的需求为背景下,本文研究并设计实现了一种适应分类体系变化的海量网页快速分类系统。海量网页快速分类是以精准营销为目标的各种用户行为分析的基础,与传统的分类系统相比它具有数据规模海量,分类体系容易变化和任务实时性的特点。
系统不仅要解决海量网页爬取、WAP网页正文提取,还需要解决现有分类方法训练和预测比较慢的问题;由于分析用户的偏好很难去定义,意味着分类体系很难确定,适应分类体系的变化也是本文需要解决的问题。
为此,本文的研究内容和工作包括:(1)研究和实现针对手机上网网页的海量网页爬取程序,这是网页分类的基础;(2)提出了一种能适应不同的网页类型的正文提取算法,它能够去除网页文本中的大量噪声数据;(3)提出了一种基于主题的分类方法,它使用PLSA算法把文本的特征词向量转换成在多个主题上的概率分布,可以大幅度的降低文本向量的维度,在低维度上可以快速的分类训练和预测以及适应分类体系的变化。
实验表明,本文实现的海量网页爬取程序能有效地爬取移动上网的“死链接”问题,提高爬取的成功率,并且爬取效率的提高达31%;由于考虑了语义的相似度,本文的正文提取算法可以提高正文抽取的准确率;基于主题的分类在准确率方面也比朴素贝叶斯分类提高了21%,在效率方面提高了33%,而且较容易适应分类体系的变化。