一种高效的基于滑动窗口的数据流频繁元素挖掘算法

来源 :2007中国计算机大会 | 被引量 : 0次 | 上传用户:wzllh
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
挖掘频繁元素是数据流研究领域的一个重要问题。由于数据流具有高速流动、规模无限等特点,因此在数据流上挖掘频繁元素很具挑战性,主要有:动态的维护概要数据结构;使用远小于数据规模的内存空间;快速的响应用户查询。本文提出了一种新的确定的基于滑动窗口的数据流频繁元素挖掘算法。该算法将固定元素个数的滑动窗口划分为若干基本窗口,在每个基本窗口上用较小的空间维护较高精度的概要数据结构。算法既能够以基本窗口为单位定期返回满足ε-近似要求的结果,也可以对任意时刻的即席查询请求返回近似结果。实验表明,该算法在zipf数据分布下性能较好,处理即席查询的误差也比较小。
其他文献
传统的查询扩展技术不能很好地满足不同兴趣、不同背景和不同时期用户的检索请求。 依据用户浏览行为建立用户兴趣模型,并根据用户兴趣主题进行查询扩展,通过提高扩展词的
为解决企业信息化建设中的“信息孤岛”问题、治理混乱的数据环境,需要通过梳理业务流程,建立主题数据库,使采购、生产、销售、设计等各部门的数据流畅通,实现信息共享。本丈提出
会议
去重处理是数据挖掘预处理中非常重要的一个环节。当前主流的数据清洗工具中对于重复数据的去除都是基于关系数据库,不适用于在加载过程中进行去重操作。本文针对海量短文本的
越来越多的XML应用以XPath来查询XML文档中的数据,如何有效的处理XPath查询成为这些应用的关键。本文充分考虑XML和XPath数据模型的特点,设计并实现了一个高效查询引擎OnceXPat
会议