论文部分内容阅读
在高度信息化的今天,产生的海量数据和新型数据集都对传统的数据分析技术形成挑战。数据挖掘不断突破这些挑战带来的种种局限性,为当今信息技术的发展奠定了基础。作为数据挖掘的一项重要任务,关联规则用于发现隐藏在大型数据库中令人感兴趣的频繁模式和强关联规则,研究者对其进行了广泛的研究。
传统的关联规则挖掘Apriori算法多次扫描事务数据库,由于事务数据库在短时期内很少变化或者根本不改变,所做的是重复的扫描工作,这就需要很大的Ⅰ/0负载,而且可能产生庞大的侯选集。研究者提出不同的优化方法,主要有分区技术、散列技术、抽样技术、并行挖掘等。
利用数据预处理方法,剔除无关属性、获得相应的特征子集,这些不同的特征子集中的样本往往具有相似的模式,在不同的特征子集上进行规则挖掘可大大提高关联规则挖掘的效率和有效性。本文分析基于关系代数的关联规则挖掘算法,把得到的特征子集利用关系矩阵及相关运算挖掘出频繁项集,该算法只需扫描数据库一次,减少了时间开销。挖掘出频繁项集后,生成得到最大频繁项集和频繁闭项集,解决了产生大量冗余规则的问题。通过对算法性能分析比较,基于关系代数的关联规则挖掘算法优于经典的Apriori算法,并在机器学习公用数据集上进行验证,在不同的数据样本量、不同的支持度下,通过仿真实验比较了这两个算法的执行时间,验证了基于关系代数的关联规则挖掘算法的优化效果。在教学评价数据集上挖掘最大频繁项集和频繁闭项集,实验结果也证明基于关系代数的关联规则挖掘算法优于Apriori算法,使用频繁闭项集产生关联规则解决了冗余规则问题。