数据收集中的隐私保护与真值发现协议

来源 :桂林电子科技大学 | 被引量 : 0次 | 上传用户:wtuye262626
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
随着物联网的快速发展,越来越多的物联网设备接入网络,使得传感设备能够更方便的收集数据。数据采集是数据分析的前提。数据收集工作的缺乏将导致数据分析工作流于形式。因此,数据收集工作是实现大数据分析的关键步骤。然而,很多数据涉及到用户(数据提供者)的个人隐私,用户并不想提供这一部分的数据。例如,用户的身体指标数据(血压、心率等),这部分作为用户隐私被用户保护。这将导致数据收集工作的质量大打折扣。所以,隐私保护工作是数据收集与发布工作里的重要一环。另外,我们收集到的数据很多是有冲突的,如何解决数据间的冲突,确定最可靠的数据也是一个重要的研究问题。真值发现是解决数据冲突的一个重要手段。如何鲁棒高效的实现真值发现也是我们关注的重要问题之一。本文从解决数据收集中的隐私保护问题和解决数据收集中的数据冲突问题的角度出发,分别提出了轻量级具有隐私保护性质的原始数据收集方案(IRDC)和具有鲁棒性的真相发现方案(RTDS)。具体研究如下:(1)具有隐私保护性质的轻量级原始数据收集协议(IRDC)。数据收集是物联网中分析网络环境、提高服务质量的重要组成部分。为了给数据提供者(即物联网终端用户)提供激励,隐私保护是一项必要的要求。传统的隐私保护技术,如k-匿名技术、数据聚合技术和差分隐私技术,这些传统的隐私保护技术对数据进行泛化、聚合或添加噪声,影响了数据的效用和价值。具有隐私保护性质的原始数据收集方案是一种可行的解决方案,而基于n-源匿名的原始数据收集是最有前途的,因为它将原始数据与其来源切断联系,保证了数据的不可链接性,同时,保持了数据的原始性。本文提出了一种基于Shamir秘密共享的轻量级原始数据收集协议。采用shuffle算法保证采集数据的不可链接性,采用Shamir秘密共享保证原始性。同时,我们的方案降低了物联网设备的存储负担。(2)基于均值漂移聚类算法的真值发现协议(RTDS)。由于现实世界的限制,数据冲突是数据收集中不可避免的问题。如何在众多采集的数据中确定最可靠的数据是一个值得研究的问题。真值发现是一种广泛使用的整合异构数据的解决方案。现有的真值发现方案主要是对所有来源的数据进行汇总,以获得真相。然而,在聚合之前,应该排除特殊数据。如何识别特殊数据也是一个难题。针对这个问题,我们采用均值漂移聚类算法来去除特殊数据,获得真值。性能评估表明,我们的方案在各种条件下表现良好。
其他文献
在现代军事和民事通信领域中,VHF/UHF频段车载天线应用愈加广泛,而传统的窄带天线已无法更好地适应日益复杂的电磁环境和通信需求。因此,车载天线的主要研究方向就是宽带与小型化。本文根据实际工程需要,利用多工器,设计一副单端口VHF/UHF频段宽带小型化天线。主要研究内容如下:1、VHF频段宽带天线的设计。为满足车载架设环境,该天线类型为鞭状天线。本文利用天线辐射体共用思想,设计一种单、偶极子辐射体
HDR(High Dynamic Range,HDR)图像从出现到走进大众的日常生活中,一直是显示领域的关注焦点。由于普通成像设备中光学采集模组进行实景拍摄时捕获到的动态范围远低于实景动态范围,在成像时难以将实景的光影轮廓完整显示出来。基于多曝光的高动态范围成像技术能够有效克服成像设备硬件的局限性,通过在实景中连续拍摄一组图像,利用加权融合的方式,使得图像能够记录下更高的动态范围。因此,本文对高动
图像分类技术在生产生活中有着广泛的应用。然而,在许多应用场景中,需要对外观十分相似的类别进行分类,传统的图像分类技术难以满足这一需求,因此细粒度图像分类就成了图像分类领域一个重要的研究方向。细粒度图像分类也有广泛的应用场景,比如自然保护区的生物识别、无人超市的商品识别、交通路口的车辆识别等,但是由于“类内差异大,类间差异小”等问题,细粒度图像分类仍然是一个具有挑战性的任务,尚无法满足实际应用的需求
黑客或恶意攻击者通过各种方法入侵网络,导致网络环境面临着大量具有针对性、隐蔽性和渗透性的潜在威胁,网络安全面临着严峻的挑战。入侵检测系统(Intrusion Detection System,IDS)作为安全防御系统被用来检测网络环境是否存在入侵行为,并针对各种入侵行为产生相应的报警数据,便于安全管理人员采取相应的防御措施,然而IDS在实际应用中会产生大量冗余、错误的报警,使得管理人员难以从中找到
视频中人体行为的自动识别是指从原始视频数据中自动识别出对应的人类动作。人体行为识别是进行视频语义理解、视频结构化描述的关键技术。相较于视频中的车辆的识别,人体行为由于其行为种类多,就需要更准确地识别。而且,在获取的视频中,由于存在着各种客观因素,如视频的画面抖动、复杂背景、视角变化等。对此,现有的人体视频行为识别算法对于以上这些问题的处理仍然受限。本文通过利用时空信息融合,分析视频中的关键人体行为
随着移动互联网的普及,以及在线教育的人数突破新高,越来越多的问题文本数据被上传至互联网中。网络中存在大量的未标注问题数据,对于用户的选择造成了困扰,用户很难从中分辨出问题的难度。为了使得用户能够更好地选择自己适合的问题难度,节省用户筛选问题的时间,帮助用户进行个性化学习,对于问题难度的预测变成一个亟待解决的问题。问题难度预测是教育数据挖掘领域中重要的问题之一。现有的问题难度预测模型基于专业人员对问
随着云计算与容器技术的高速发展和深度结合,给互联网行业带来了重要的技术革新,同时“智慧旅游”概念的提出,推动着传统旅游行业的进步与革新,随之诞生了大量的以“互联网+旅游”为背景的互联网产品和应用。本文研究基于模糊多属性决策,面向智慧旅游系统,主要的研究工作如下:(1)提出了一组基于q阶正交模糊数的Dombi幂分区Heronian平均算子。首先,介绍了基于Dombi T-范数和S-范数(DTT)的q
分组密码作为一种主流的加密手段,有着易于商业标准化、适用性强、密钥信息不需要同步、扩散性良好等优点,在各种安全设备中得到了广泛的应用。未受保护的密码算法在密码设备中运行时很容易遭受到侧信道的攻击,从而威胁到密码设备的安全性。如何提高现有侧信道攻击的效率和针对攻击做出相应的防护是目前国内外研究的热点和难点。本文基于国际主流密码算法AES和国密算法SM4的算法结构,研究相关功耗分析的优化方法;并研究了
深度学习算法在图像分类等许多应用场景中取得令人瞩目的成绩。但是,研究表明含有恶意扰动的对抗样本可以欺骗甚至操纵这些复杂神经网络模型,从而使得它们输出错误的预测结果。为了应对这种威胁,本文重点研究对抗训练和预处理防御这两种提高神经网络模型鲁棒性的方法。对抗训练,即使用对抗样本训练神经网络模型,是一种有效的防御措施。经过对抗训练的神经网络模型往往具有很强的抵御对抗样本攻击的能力,但是在训练过程中生成对
文字作为体现一个国家和民族文化的载体,其重要性不言而喻。通过使用计算机识别真实场景中的文字已经成为计算机视觉领域最重要的研究内容之一。然而现有的场景文字检测与识别算法大都针对于英文、中文等使用人数广泛的语言文字。越南文字作为一种声调语言表音文字,使用人数相对较少但具有代表性。与常见的拉丁文字不同,越南文字的书写中存在6种声调符号标记,使用不同的声调符号表达不同的语义信息,现有算法在检测与识别越南场