论文部分内容阅读
近几十年来,随着现代经济的发展和计算机技术的进步,数据生成的速度越来越快,数据具有的主观色彩也越来越浓,数据的存储量也越来越大,如何从这些海量的信息中挖掘出用户最感兴趣的,最优的信息,为用户的决策提供指导意见,成为一个热门的研究课题。轮廓查询是一种多标准的决策策略,其从目标数据集中查找不能被其他任何数据支配的数据集合,得到的查询结果集能够反映目标数据集的整体轮廓,这样有利于用户从很小的范围中查询到自己感兴趣的数据。 轮廓查询算法的研究主要分为两类:第一,确定数据集上的轮廓查询算法;第二,不确定数据集上的轮廓查询算法。本文研究工作是不确定数据集上的偏好属性的轮廓查询。论文的主要工作如下: (1)把确定数据上偏好属性的轮廓查询扩展到不确定数据集上,提出了不确定数据上的基于偏好属性的轮廓查询概念。 (2)针对单偏好属性的不确定数据轮廓查询问题,给出了基于多维网格的不确定数据预处理算法(UDP)和基于单偏好属性的轮廓查询算法(UPSQ)。在预处理阶段,利用UDP算法求出在固定属性上为轮廓的第一类对象和所有基本偏好次序的轮廓对象集;在查询阶段,UPSQ算法先根据用户给定的偏好次序中优先级最高的属性值得到该值的基本偏好次序的轮廓集合,再通过判断对象的attribute-skyline是否小于阈值来删除对象,最后如果对象的instance-skyline大于阈值,则为轮廓对象。 (3)提出了基于多偏好属性的不确定数据轮廓查询算法(MUPSQ)。在预处理阶段利用单偏好属性中的UDP算法构造索引树(BPT),其存储着所有的基本偏好次序集以及部分以后求得的偏好次序集;查询阶段利用MUPSQ查询算法先把用户给定的偏好次序集按不同属性拆成多个基本偏好次序集,再用UPSQ算法合并偏好次序集中同偏好属性的不同属性值,最后,通过MergePre算法对两个不同偏好属性的偏好次序集的轮廓集求交集,再判断交集中对象的instance-skyline是否大于阈值,以求得两个不同偏好属性上的轮廓集,重复该过程直到合并到用户给定的偏好次序集。