论文部分内容阅读
简单贝叶斯算法在邮件过滤领域得到广泛的应用,但它的两个缺点限制了它的使用,首先它不能进行连续的自学习,当邮件内容发生较大变化时,准确性急剧下降。其次是没有考虑字,词,短语之间的联系,以及词语的表现能力,不能准确反映邮件本身的内容性质。因此提出一种自学习的贝叶斯邮件过滤模型:它能够不断地进行自学习,使模型内部参数能够随着邮件内容的变化而改变,而且它将邮件特征(词语)之间的关系以及它们的表达能力引入,作为模型计算的基础之一,并且对用户发送的邮件进行学习。