基于关联规则的数据挖掘方法研究—加权关联规则挖掘的研究

来源 :江南大学 | 被引量 : 0次 | 上传用户:Daemonman
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
数据挖掘是人工智能和数据库技术等领域的研究热点,正在现实应用中发挥着强大的作用。关联规则挖掘是数据挖掘中一个最活跃、最重要的研究课题,主要目的是从给定的数据集中发现项目之间有趣的关联和相关关系。传统关联规则挖掘算法认为数据集中每个项目和交易记录具有相同的重要性,而实际上,用户往往对每个项目和记录的重要性加以区分,以便发现更感兴趣和更有价值的规则。加权关联规则挖掘解决了上述问题,并正受到越来越多的国内外研究者的重视。   本文概述了数据挖掘和关联规则的相关知识,并系统地介绍了垂直、水平、混合加权关联规则挖掘,讨论和分析了常见加权关联规则挖掘算法模型。在对加权关联规则进行了深入研究的同时,提出了相关改进算法和应用。   首先,说明了New Aprior的缺陷,详细地分析了其改进算法-MWFI(MiningWeighted Frequent Itemsets)算法的不足,根据项目的不同重要性,提出了一种改进的加权关联规则挖掘算法。改进算法通过按属性的权值对事务进行分类,使挖掘每个类别内频繁项集的过程满足Apriori性质,可以利用Apriori算法或其它改进算法进行挖掘,提高了挖掘加权关联规则的效率,并且很容易扩展到混合加权关联规则挖掘中。   另外,数据库中的项目分布往往是不均匀的,需要为项目设置不同的最小支持度。本文在考虑了记录的不同重要性的同时允许为不同项目设置不同的支持度,给出了一种多最小支持度加权关联规则挖掘算法。该算法挖掘频繁项集的过程克服了多最小支持度情况下不满足Apriori性质的缺陷,且不需多次重复扫描数据库,剔除了冗余项目并对相同项集累加计数,实验证明了算法的效率。   最后,将加权关联规则应用到时态数据库挖掘中,提出了一种加权时态关联规则的挖掘方法。算法给出了有效的剪枝方法,克服了现有以项目生命周期为时间特征的关联规则算法中直接用频繁(k-l)-项集连接生成候选k-项集的不合理之处,并通过实例分析和实验对比验证了算法的有效性。挖掘出的规则既突出了项目的权重,又体现了现实数据中的时态语义,更具有实际应用价值。  
其他文献
随着VoIP业务的发展,SIP协议得到广泛的应用,并在下一代互联网中发挥巨大的作用。由于工作在开放的网络环境中,SIP协议容易成为攻击者的攻击目标,SIPDDoS攻击由于易于实现,难以防
数据校正技术利用过程测量数据的冗余性进行网络冗余性分析,显著误差校正和数据协调,减小误差数据对过程数据的影响,以获得更加精确的测量数据。但是传统的数据校正算法都有
学位
近年来,随着无线传感器网络的不断发展,其信息安全问题也越来越受到人们的重视。数据融合技术作为无线传感器网络中的一项支撑技术,其安全问题一直备受瞩目。在融合网络中,融
个性化推荐系统是要解决“合适的时间向合适的人推荐合适的物品”的问题。早期的基于内容的个性化推荐系统需要预先得到物品的内容信息和用户的个人信息,而这些信息在很多推荐
随着ERP的广泛应用和企业规模的扩大,ERP很难满足企业多样化的运转经营方式。在ERP的基础上,研发EP(EnterprisePortal)系统,实现EP系统与ERP系统的数据交互,完成ERP的功能扩展,从
SaaS作为一种新兴的软件应用模式,已经受到了各界越来越多的关注,它的运营模式很好的帮助中小企业实现信息化建设,并且还可以在很大程度上降低企业的成本,是这种企业实现信息
软件生产线是一种有效的、系统化的软件复用方法,是解决“软件危机”的重要途径。生产线体系结构作为软件生产线的核心资源之一,定义了生产线中所有产品的共性和可变性,是软件生
在信息化日益发达的今天,如何让能让信息和数据安全可靠快速的传递,如何能让不同的终端系统接受不同格式的数据变得很重要。因此我们的数据交换技术显的非常的重要,数据交换平台
Assements presented to the different users of a wireless network system and social users network systems, in a certain level of performance to a data flow of d