论文部分内容阅读
本文主要基于农业经济数据仓库的建设,提出一个面向网络数据获取、数据多格式存储的方案。农业经济分析问题的确定对应着分析主题的确定,而分析框架对应着数据仓库的建立,分析的过程对应着多维分析与数据挖掘。而处于中间部分的对信息的获取与加工,本身包含对信息结构的处理、语义的赋予、内容的清洗这一系列过程。
为了实现这些目标,本文将从HTML中获取的农产品价格信息的以三种方式存储,分别是关系数据库、XML统一数据存储格式、以及RDF语义存储。
通过三种存储方式的比较,以及结合分析系统信息获取处理的过程,可以发现,关系数据库是对于数据的结构化存储,XML进一步的赋予层次及信息自描述,而RDF对于信息赋予了语义。
关系数据库存储优点是效率高,技术成熟,缺点是与由于与数据库管理系统(DBMS)绑定,造成数据存储格式无法统一,无法进行数据交换,也无法对信息赋予语义。
XML存储的优点是其已经是Web数据交换的标准,使用范围广,并赋予数据层次语义,可以与数据仓库中的维度信息很好的结合。但是由于其语义功能不完整,造成数据查询时必须了解其完整的结构,并且造成语义不统一现象的产生。
RDF存储的优点是其描述了信息的语义关系,使得可以与数据仓库中的语义相结合,通过语义查询直接为数据仓库中的事实表、维度表提供满足语义的数据,而不用考虑具体的存储结构。但是相对于XML,RDF对于人类而言的可读性较差。
为了进一步说明三种层次模式的特点,假设需要实现下面的分析目标分别从关系数据库、XML、RDF中获取数据以实现分析。
(1)关系数据库
三种存储模式中,关系数据库是最为基本也是目前使用最多的方式,其优点是直接可以与后期的数据仓库(同样是建立在关系数据库基础上)相连接,甚至于直接写入数据仓库中,而不经过数据缓冲。
(2) XML存储
在XML中为了获取例中需要的信息,可以利用XQuery对分析所需的信息进行查询,但是在查询前必须了解XML的层次结构。
XML存储的数据关键特性之一,是它赋予了数据层次性结构,例如根据保存地理数据XML所生成的树状图,与我们在数据仓库设计中对于地理维度的层次设计表达相同,实际上,很多的数据仓库系统对于层次的表达直接建立在XML的基础上,而利用XML的特性,可以实现数据仓库中维度表对于XML文件的直接利用。
(3)RDF语义存储
XML所存在的问题是因为XML不具备语义描述能力。为了解决这一点,信息可以用RDF进行保存。“资源描述框架(Resource Description Framework,缩写RDF)是万维网联盟(W3C)提出的一组标记语言的技术标准,以便更为丰富地描述和表达网络资源的内容与结构。RDF标准最初设计的目的是描述Web上的资源、内容和关系。但是RDF现在变成了用于描述一般信息、资源和关系的标准。语义Web和网格技术都需要定义资源及其之间的关系,使应用程序能够使用不同的信息,并且可以把数据捆绑在一起。”
一旦分析所需信息的对应语义模式确定,通过SPARQL从RDF存储中查询所需的数据就很简单。
PREFIX agri:SELECT?pri-ceFROM http://tomisacat.com/agri/agri20110123.rdfWHERE{agri:都匀毛尖agri:location agri:毕节桂花市场.?location agri:price?price.}
由于将分析语句转换为对应的三元组关系,对RDF中存储信息的查询比较关系数据库与XML要直观的多,更有利于数据存储与分析程序进行直接的结合。
通过各种数据存储方式的优缺点分析,可以根据实际的情况在中间存储层中结合使用。例如,当数据源的信息语义关系简单,分析系统未来面向的数据库关系系统不会改变时,可以采用关系数据库作为中间存储层的存储方式。当分析系统面向不同厂商的数据仓库系统,或者面向不同的应用,那么XML是最好的选择。当希望实现数据仓库对于信息的语义查询,并且信息语义复杂,并且分析系统需要一个统一的语义信息源时,应该考虑RDF。
为了实现这些目标,本文将从HTML中获取的农产品价格信息的以三种方式存储,分别是关系数据库、XML统一数据存储格式、以及RDF语义存储。
通过三种存储方式的比较,以及结合分析系统信息获取处理的过程,可以发现,关系数据库是对于数据的结构化存储,XML进一步的赋予层次及信息自描述,而RDF对于信息赋予了语义。
关系数据库存储优点是效率高,技术成熟,缺点是与由于与数据库管理系统(DBMS)绑定,造成数据存储格式无法统一,无法进行数据交换,也无法对信息赋予语义。
XML存储的优点是其已经是Web数据交换的标准,使用范围广,并赋予数据层次语义,可以与数据仓库中的维度信息很好的结合。但是由于其语义功能不完整,造成数据查询时必须了解其完整的结构,并且造成语义不统一现象的产生。
RDF存储的优点是其描述了信息的语义关系,使得可以与数据仓库中的语义相结合,通过语义查询直接为数据仓库中的事实表、维度表提供满足语义的数据,而不用考虑具体的存储结构。但是相对于XML,RDF对于人类而言的可读性较差。
为了进一步说明三种层次模式的特点,假设需要实现下面的分析目标分别从关系数据库、XML、RDF中获取数据以实现分析。
(1)关系数据库
三种存储模式中,关系数据库是最为基本也是目前使用最多的方式,其优点是直接可以与后期的数据仓库(同样是建立在关系数据库基础上)相连接,甚至于直接写入数据仓库中,而不经过数据缓冲。
(2) XML存储
在XML中为了获取例中需要的信息,可以利用XQuery对分析所需的信息进行查询,但是在查询前必须了解XML的层次结构。
XML存储的数据关键特性之一,是它赋予了数据层次性结构,例如根据保存地理数据XML所生成的树状图,与我们在数据仓库设计中对于地理维度的层次设计表达相同,实际上,很多的数据仓库系统对于层次的表达直接建立在XML的基础上,而利用XML的特性,可以实现数据仓库中维度表对于XML文件的直接利用。
(3)RDF语义存储
XML所存在的问题是因为XML不具备语义描述能力。为了解决这一点,信息可以用RDF进行保存。“资源描述框架(Resource Description Framework,缩写RDF)是万维网联盟(W3C)提出的一组标记语言的技术标准,以便更为丰富地描述和表达网络资源的内容与结构。RDF标准最初设计的目的是描述Web上的资源、内容和关系。但是RDF现在变成了用于描述一般信息、资源和关系的标准。语义Web和网格技术都需要定义资源及其之间的关系,使应用程序能够使用不同的信息,并且可以把数据捆绑在一起。”
一旦分析所需信息的对应语义模式确定,通过SPARQL从RDF存储中查询所需的数据就很简单。
PREFIX agri:
由于将分析语句转换为对应的三元组关系,对RDF中存储信息的查询比较关系数据库与XML要直观的多,更有利于数据存储与分析程序进行直接的结合。
通过各种数据存储方式的优缺点分析,可以根据实际的情况在中间存储层中结合使用。例如,当数据源的信息语义关系简单,分析系统未来面向的数据库关系系统不会改变时,可以采用关系数据库作为中间存储层的存储方式。当分析系统面向不同厂商的数据仓库系统,或者面向不同的应用,那么XML是最好的选择。当希望实现数据仓库对于信息的语义查询,并且信息语义复杂,并且分析系统需要一个统一的语义信息源时,应该考虑RDF。