论文部分内容阅读
摘 要:随着移动技术的发展,越来越多的程序和数据运行在移动环境中,由于移动环境的不稳定、安全度低等特性,使得用户的一些敏感信息很容易被泄露。本文针对移动数据库隐私保护问题进行研究,综合考虑了移动数据库在移动计算的特殊环境下其运行特点,提出了一种基于数据服务的视图组合模式,同时,对数据库管理中创建的多个视图进行组合研究,力求在减少数据传输同时保证对隐私数据的安全访问,以用户权限结合隐私阀值作为最终限定,以保证组合后的多个视图屏蔽掉涉及到的隐私数据项。
关键词:移动数据库;组合视图;安全访问;隐私
中图分类号:TP311
随着便携式移动设备的普及,人们开始在移动设备上利用移动数据库接入某些应用系统,从中获得自己所需的信息。这种工作方式极大地方便人们的工作、学习方式,目前的移动数据库应用主要集中在大规模的数据收集,但是,移动终端由于便携、方便,用户在其中保存了一些很敏感的信息,如隐私。关于隐私的保护被国际机构公认为基本的权利,隐私也被定义为“一种与公共利益无关、群体利益无关,当事人不愿意他人知道或他人不便干涉的个人私事”的权力。在本文中,我们分析了当前移动数据库中用户的隐私保护需求,提出了一种基于视图组合方式下的隐私保护模型,以求能够高效、可靠的访问用户数据。
1 相关技术
1.1 移动数据库
移动数据库技术是一种边缘学科,它综合考虑到传统数据库技术、分布式环境下各部分的位置与之间的关系以及无线网络数据传输等多种技术应用方面。考虑到具体应用环境下,移动数据库中的“移动”主要是指下面两种情况:客户端的数据库可以随着用户的移动而移动;用户在位置移动中通过各种无线网络访问服务器端上的数据库[1]。
由于位置的移动和设备的普遍性,使得移动数据库的用户分布在各行各业,与传统的计算机用户不同,新的使用移动终端设备的用户,他们掌握信息技术的水平比较低,系统在应用层面应屏蔽掉传统数据库系统的中的一些管理语言,采用一种简单、易于理解的管理方式。
1.2 视图
在数据库中使用视图主要出于以下两种原因:一是可使一些复杂的查询易于用户的理解和直接使用;另一原因是安全原因:视图可以隐藏一些数据,如用户医疗信息表,可以用视图只显示姓名、所挂号科室,而不显示所患病症和家庭住址等信息。
从使用者的视角来看,每一个视图都是按某种方式对数据库中数据观察所得到的或是按某种方式组织和查看数据集得到的结果。
1.3 隐私问题
移动数据库中用户隐私在不同的系统和环境中具有不同的个人需求,如医院信息管理系统(电子病例),病人的身份证号、家庭住址、疾病信息、医疗服务与药品购买记录这些字段就属于用户的个人隐私;在人口管理系统(市民卡),其中的市民家庭住址、收入状况、个人爱好、犯罪记录等就属于他的个人隐私;至于手机银行、掌上购物,其中客户的私有信息及其交易行为就属于用户的隐私字段。一般数据库中身份标识属性ID就记录了可以唯一识别一个人的取值,比如身份证号、电话号码、姓名等信息。除以上单字段外,还可以通过字段组合来得到用户的个人信息,我们称为准标识属性[4],其中的属性值单独不构成隐私属性,但通过连接推理后可得到ID字段同样的效果:如研究表明,87%的美国人口信息可以通过性别、出生日期、5位邮政编码进行个人重建,我国的国家自然科学基金项目“面向隐私保护的数据挖掘方法研究”在研究了宁波城区中的居民数据,得到了类似的结论:78%的人口可以通过出生日期和6位邮政编码唯一确定;58%的人口可以通过出生日期和5位邮政编码唯一确定”,此时数据库中的出生日期和邮编字段就成为了隐私数据;另外一些敏感字段记录了个人不愿为人所知的取值信息,比如个人收入、所患病症等[5]。对这些字段我们不能简单的屏蔽了之,如何保护这些隐私数据是我们的主要研究内容。
2 主要研究内容
2.1 隐私保护评价体系
设数据集的模式:T={ID1…IDr,QI1…,QIs,ST1…,STt},其中IDi(i=1,2…r)为身份标识属性,QIj(j=1,2…,s)为准标识属性,STk(k=1,2…t)为敏感属性。为了保护个人隐私,发布数据集需要设定一个隐私保护,需求ψ为了达到隐私保护需求ψ,需要对数据集T中的元组t进行转化得到t’,设转化函数为f,对转化函数f设t=(d1,dr,q1,,qs,s1,st),f把t转化为tˊ=(d1ˊ,drˊ,q1ˊ,qsˊ,s1ˊ,stˊ),即tˊ=f(t)。通常在微数据发布处理方法中,f并不修改敏感属性的取值,即sk=skˊ(k=1,2…,t),对于需要处理的数据集T,转化函数f把T转化为发布数据集PT,其中PT={f(t)|t∈T}。转化后(q1ˊ…,qsˊ)取值相同的那些元组形成一个QI分组。为了尽量准确地评价发布数据,需要建立评价指标,设为σ。隐私保护的数据发布问题可以表示为一个四元组PPDP=(T,ψ,f,σ),其中T是需要发布的数据集,发布的数据集为PT={f(t)|t∈T},ψ是隐私保护需求,f是转化函数,σ是对发布数据集的评价结果,隐私保护的数据发布问题就是在满足隐私保护需求ψ的前提下,以最大化数据有效性指标σ实现隐私信息的合理保护和获得数据信息的最大效用[6,7]。
2.2 移动用户表
用户表中主要的信息包括:就诊卡号、病案号、姓名、性别、年龄、医保费用类别、病史资料、主诉、现病史、既往史等。其中各字段隐私关联级别取值为1-3级,3级代表直接关联隐私,2代表组合关联隐私,1代表隐私影响度较低[8]。如下表所示:
2.3 查询视图组合设置
输入:视图隐私度信息表(其中视图隐私度由相关字段的隐私度值确定)[9]
输出:隐私值组合最小的视图组合方案。 procedure一视图组合隐私保护()
{输入视图组合隐私度信息表;
根据位串k度(视图个数)确定种群规模;
For(i:=0;i<视图个数;i++)
{以随机值初始化相应地视图位串;
从而找到一个最初的原始个体A;
将A加入到视图的初始种群Q(1)中;
利用遗传算法中的目标函数方法计算得到个体的适应值;}
dai= 1;//当前从第一代开始
while(视图1中涉及字段∩视图2涉及字段的关联级别<当前用户权限下隐私保护阀值)
{String GetFile Value(int index 1)//取出运行得到的数据集中的某个字段
Value(index,gidNo,binrenbingqing+art);//取出查询数据集中需要字段的值
insert(value string())//增加一条结果值来保存上一步中取出的值;
按选择策略和个体适应值大小从Q(dai)中选择下一代再生个体;
设定交叉概率值q1和变异概率q2,对本代中的再生个体进行遗传交叉、数据变异等操作,生成最新一代的族群Q(dai+1);
重新按照目标函数来计算新一代族群Q(dai+1)中的个体适应值;
dai:=dai+1;//重复以上步骤直到满足退出条件或迭代次数为止
}
用最接近目标适应值Q(dai)中的最小个体组作为最终系统中的视图组合选择方案。
2.4 隐私保护结果
采用组合视图隐私保护模型后,其中的姓名(ID字段)因为在敏感集中,所以该字段被屏蔽,而邮编、年龄等视图组合后的相关敏感属性(QI字段)匿名后显示。
从最终的显示表上,可以对用户的个人隐私信息进行有效的保护,在不影响数据统计,如对当前流行性或多发性疾病的判断基础上,可以防止用户的个人信息的泄露。
3 总结
本文以一个病人就诊的EDBMS进行了功能的分析并给出了移动数据库的构建的说明,提出了在该系统下,隐私字段的设置,并结合视图的优化组合模式,对该系统对隐私字段的处理过程进行了研究,结合用户权限的管理与赋值,希望能够通过模型架构的方法验证组合视图保护隐私的实际运行效果,为移动数据库管理系统中,隐私的建立和保护提供设计依据。
参考文献:
[1]刘晓娜.组合视图在移动数据库中隐私保护的应用[J].计算机光盘与软件,2013,6:112-114.
[2]丛慧刚.元数据驱动的大型数据库数据迁移工具实现[J].科学技术与工程,2011,10:92-96
[3]韩建民.面向数值型敏感属性的分级L多样性模型[J].计算机研究与发展,2O11,48:147-158.
[4]童云海.隐私保护数据发布中身份保持的匿名方法[J].软件学报,2010,4:50-56.
[5]刘晓娜.物化视图在移动数据库查询优化中的应用[J].吉林通化师范学院学报,2013,2:46-48.
[6]曾凯.隐私保护模型研究[D].重庆大学,2012.
[7]徐勇.一种考虑属性权重的隐私保护数据发布方法[J].计算机研究与发展,2012,5:913-924.
[8]童云海.面向隐私保护的数据挖掘和数据发布方法研究[J].计算机学报,2012,3:158-165.
作者简介:刘晓娜(1980-),女,甘肃庆阳人,讲师,硕士,兰州文理学院计算机系,研究方向:移动数据库、分布式系统;杜永文(1974-),男,甘肃兰州人,副教授,博士,兰州交通大学电信学院,研究方向:嵌入式系统、分布式系统;蔺国梁(1972-),男,甘肃兰州人,副教授,兰州文理学院计算机系,研究方向:数据库应用、多媒体技术。
作者单位:兰州文理学院计算机系,兰州 730010;兰州交通大学电信学院,兰州 730070
关键词:移动数据库;组合视图;安全访问;隐私
中图分类号:TP311
随着便携式移动设备的普及,人们开始在移动设备上利用移动数据库接入某些应用系统,从中获得自己所需的信息。这种工作方式极大地方便人们的工作、学习方式,目前的移动数据库应用主要集中在大规模的数据收集,但是,移动终端由于便携、方便,用户在其中保存了一些很敏感的信息,如隐私。关于隐私的保护被国际机构公认为基本的权利,隐私也被定义为“一种与公共利益无关、群体利益无关,当事人不愿意他人知道或他人不便干涉的个人私事”的权力。在本文中,我们分析了当前移动数据库中用户的隐私保护需求,提出了一种基于视图组合方式下的隐私保护模型,以求能够高效、可靠的访问用户数据。
1 相关技术
1.1 移动数据库
移动数据库技术是一种边缘学科,它综合考虑到传统数据库技术、分布式环境下各部分的位置与之间的关系以及无线网络数据传输等多种技术应用方面。考虑到具体应用环境下,移动数据库中的“移动”主要是指下面两种情况:客户端的数据库可以随着用户的移动而移动;用户在位置移动中通过各种无线网络访问服务器端上的数据库[1]。
由于位置的移动和设备的普遍性,使得移动数据库的用户分布在各行各业,与传统的计算机用户不同,新的使用移动终端设备的用户,他们掌握信息技术的水平比较低,系统在应用层面应屏蔽掉传统数据库系统的中的一些管理语言,采用一种简单、易于理解的管理方式。
1.2 视图
在数据库中使用视图主要出于以下两种原因:一是可使一些复杂的查询易于用户的理解和直接使用;另一原因是安全原因:视图可以隐藏一些数据,如用户医疗信息表,可以用视图只显示姓名、所挂号科室,而不显示所患病症和家庭住址等信息。
从使用者的视角来看,每一个视图都是按某种方式对数据库中数据观察所得到的或是按某种方式组织和查看数据集得到的结果。
1.3 隐私问题
移动数据库中用户隐私在不同的系统和环境中具有不同的个人需求,如医院信息管理系统(电子病例),病人的身份证号、家庭住址、疾病信息、医疗服务与药品购买记录这些字段就属于用户的个人隐私;在人口管理系统(市民卡),其中的市民家庭住址、收入状况、个人爱好、犯罪记录等就属于他的个人隐私;至于手机银行、掌上购物,其中客户的私有信息及其交易行为就属于用户的隐私字段。一般数据库中身份标识属性ID就记录了可以唯一识别一个人的取值,比如身份证号、电话号码、姓名等信息。除以上单字段外,还可以通过字段组合来得到用户的个人信息,我们称为准标识属性[4],其中的属性值单独不构成隐私属性,但通过连接推理后可得到ID字段同样的效果:如研究表明,87%的美国人口信息可以通过性别、出生日期、5位邮政编码进行个人重建,我国的国家自然科学基金项目“面向隐私保护的数据挖掘方法研究”在研究了宁波城区中的居民数据,得到了类似的结论:78%的人口可以通过出生日期和6位邮政编码唯一确定;58%的人口可以通过出生日期和5位邮政编码唯一确定”,此时数据库中的出生日期和邮编字段就成为了隐私数据;另外一些敏感字段记录了个人不愿为人所知的取值信息,比如个人收入、所患病症等[5]。对这些字段我们不能简单的屏蔽了之,如何保护这些隐私数据是我们的主要研究内容。
2 主要研究内容
2.1 隐私保护评价体系
设数据集的模式:T={ID1…IDr,QI1…,QIs,ST1…,STt},其中IDi(i=1,2…r)为身份标识属性,QIj(j=1,2…,s)为准标识属性,STk(k=1,2…t)为敏感属性。为了保护个人隐私,发布数据集需要设定一个隐私保护,需求ψ为了达到隐私保护需求ψ,需要对数据集T中的元组t进行转化得到t’,设转化函数为f,对转化函数f设t=(d1,dr,q1,,qs,s1,st),f把t转化为tˊ=(d1ˊ,drˊ,q1ˊ,qsˊ,s1ˊ,stˊ),即tˊ=f(t)。通常在微数据发布处理方法中,f并不修改敏感属性的取值,即sk=skˊ(k=1,2…,t),对于需要处理的数据集T,转化函数f把T转化为发布数据集PT,其中PT={f(t)|t∈T}。转化后(q1ˊ…,qsˊ)取值相同的那些元组形成一个QI分组。为了尽量准确地评价发布数据,需要建立评价指标,设为σ。隐私保护的数据发布问题可以表示为一个四元组PPDP=(T,ψ,f,σ),其中T是需要发布的数据集,发布的数据集为PT={f(t)|t∈T},ψ是隐私保护需求,f是转化函数,σ是对发布数据集的评价结果,隐私保护的数据发布问题就是在满足隐私保护需求ψ的前提下,以最大化数据有效性指标σ实现隐私信息的合理保护和获得数据信息的最大效用[6,7]。
2.2 移动用户表
用户表中主要的信息包括:就诊卡号、病案号、姓名、性别、年龄、医保费用类别、病史资料、主诉、现病史、既往史等。其中各字段隐私关联级别取值为1-3级,3级代表直接关联隐私,2代表组合关联隐私,1代表隐私影响度较低[8]。如下表所示:
2.3 查询视图组合设置
输入:视图隐私度信息表(其中视图隐私度由相关字段的隐私度值确定)[9]
输出:隐私值组合最小的视图组合方案。 procedure一视图组合隐私保护()
{输入视图组合隐私度信息表;
根据位串k度(视图个数)确定种群规模;
For(i:=0;i<视图个数;i++)
{以随机值初始化相应地视图位串;
从而找到一个最初的原始个体A;
将A加入到视图的初始种群Q(1)中;
利用遗传算法中的目标函数方法计算得到个体的适应值;}
dai= 1;//当前从第一代开始
while(视图1中涉及字段∩视图2涉及字段的关联级别<当前用户权限下隐私保护阀值)
{String GetFile Value(int index 1)//取出运行得到的数据集中的某个字段
Value(index,gidNo,binrenbingqing+art);//取出查询数据集中需要字段的值
insert(value string())//增加一条结果值来保存上一步中取出的值;
按选择策略和个体适应值大小从Q(dai)中选择下一代再生个体;
设定交叉概率值q1和变异概率q2,对本代中的再生个体进行遗传交叉、数据变异等操作,生成最新一代的族群Q(dai+1);
重新按照目标函数来计算新一代族群Q(dai+1)中的个体适应值;
dai:=dai+1;//重复以上步骤直到满足退出条件或迭代次数为止
}
用最接近目标适应值Q(dai)中的最小个体组作为最终系统中的视图组合选择方案。
2.4 隐私保护结果
采用组合视图隐私保护模型后,其中的姓名(ID字段)因为在敏感集中,所以该字段被屏蔽,而邮编、年龄等视图组合后的相关敏感属性(QI字段)匿名后显示。
从最终的显示表上,可以对用户的个人隐私信息进行有效的保护,在不影响数据统计,如对当前流行性或多发性疾病的判断基础上,可以防止用户的个人信息的泄露。
3 总结
本文以一个病人就诊的EDBMS进行了功能的分析并给出了移动数据库的构建的说明,提出了在该系统下,隐私字段的设置,并结合视图的优化组合模式,对该系统对隐私字段的处理过程进行了研究,结合用户权限的管理与赋值,希望能够通过模型架构的方法验证组合视图保护隐私的实际运行效果,为移动数据库管理系统中,隐私的建立和保护提供设计依据。
参考文献:
[1]刘晓娜.组合视图在移动数据库中隐私保护的应用[J].计算机光盘与软件,2013,6:112-114.
[2]丛慧刚.元数据驱动的大型数据库数据迁移工具实现[J].科学技术与工程,2011,10:92-96
[3]韩建民.面向数值型敏感属性的分级L多样性模型[J].计算机研究与发展,2O11,48:147-158.
[4]童云海.隐私保护数据发布中身份保持的匿名方法[J].软件学报,2010,4:50-56.
[5]刘晓娜.物化视图在移动数据库查询优化中的应用[J].吉林通化师范学院学报,2013,2:46-48.
[6]曾凯.隐私保护模型研究[D].重庆大学,2012.
[7]徐勇.一种考虑属性权重的隐私保护数据发布方法[J].计算机研究与发展,2012,5:913-924.
[8]童云海.面向隐私保护的数据挖掘和数据发布方法研究[J].计算机学报,2012,3:158-165.
作者简介:刘晓娜(1980-),女,甘肃庆阳人,讲师,硕士,兰州文理学院计算机系,研究方向:移动数据库、分布式系统;杜永文(1974-),男,甘肃兰州人,副教授,博士,兰州交通大学电信学院,研究方向:嵌入式系统、分布式系统;蔺国梁(1972-),男,甘肃兰州人,副教授,兰州文理学院计算机系,研究方向:数据库应用、多媒体技术。
作者单位:兰州文理学院计算机系,兰州 730010;兰州交通大学电信学院,兰州 730070