论文部分内容阅读
摘要:图书馆数据仓库设计的初衷就是保持数据的一致性,而且随着数据仓库从开始、发展到成熟必然伴随着数据表的扩大和数据量的增长。基于数据仓库中数据的面向主题性、集成性以及不可更新性等特点,在实现图书馆数据仓库过程中对数据的处理就显的尤为重要。
关键词:图书馆数据仓库;数据选取;数据转换
中图分类号:G250 文献标识码:A 文章编号:1009-0118(2010)-08-0023-02
随着信息技术和网络技术的飞速发展,高校图书馆在走过了传统图书馆阶段、自动化阶段之后,已经步入数字化建设阶段。数据仓库以传统的数据库技术作为存储数据和管理资源的基本手段,是诸多学科相互结合、综合应用的学科,更是一种解决问题的技术方案。如果可以将数据仓库技术很好地应用到图书馆的建设当中,必然可以缩短我国与国外发达国家数字图书馆建设的差距,提高满足读者需求的程度,而在实现数据仓库的过程中对相关数据的操作可以说是重中之重。
一、高校图书馆的馆藏数据特点
公共图书馆的读者层次比较丰富,因此各类藏书量较为平均。而高校图书馆的藏书结构与其有着明显的区别,主要体现在以下几个方面:
(一)资源海量性
随着高校的不断发展壮大,图书馆的馆藏资源范围也更加广泛、全面,而伴随读者数量的不断增加图书馆的借阅数据、馆藏数据也以惊人的速度增长。
(二)数据关联性
高校图书馆的读者层次相对稳定,馆藏资源与读者的需要更加紧密。从图书馆系统一扣所积累的大量借阅记录中可以看出,不同的读者同时借阅多种图书或者同种图书在不同时间被不同的读者借阅都存在某种程度的相关性。
(三)信息潜在性
高校图书馆不仅藏有最近的图书资料,同时也拥有非常丰富的历史资料。从大量的数据信息中可以挖掘出读者曾经的借阅行为,从而分析出读者现在及未来的借阅需求。
二、数据仓库中的数据选取及整体结构
(一)数据的选取
从数据源中抽取出合适的数据,了解数据的形式,才能更好地处理问题。高校图书馆建设数据仓库时选取数据的具体信息应该包括以下几个方面:
1、读者基本信息。包括读者条码号、证件号、姓名、身份证号、读者类型、单位、借阅等级、年级组、系别。
2、读者借阅信息。
3、馆藏资源数据。
4、文献借阅统计数据。
(二)数据的整体结构
相对于公共图书馆读者信息的易变性而言高校图书馆的读者群相对比较稳定,通过主题确定的过程可以知道本文用到的数据从宏观上分为两种即读者的自然信息和读者的行为信息,因此可以通过静态获取和动态获取两种方式得到需要的信息。
1、静态信息
读者的个人基本信息是不发生变化的,由后台数据库系统提供。这里的静态是相对动态而言的,因为高校图书馆的读者在整体上每年都会随着毕业生离校和新生入学二产生变化。
2、动态信息
所说的动态信息包括读者的行为信息和馆藏资源的变化。读者的行为信息包括读者的借阅情况、超期行为等;馆藏资源的变化包括资源的访问情况、书籍的利用率等。
三、数据仓库中数据的组织与存储
(一)数据的组织
数据仓库中的数据通常采用分级的方式进行组织。数据一般包含早期细节数据、当前细节数据、轻度综合数据、高度综合数据。
1、早期细节数据:主要用于数据对比、回归、汇总、预测等,供决策分析、建模之用。这类数据随时间增加,数据量大,使用频度低;
2、当前细节数据:当前细节数据该层存储当前最新的细节数据,在一定时刻这些数据会转移到历史数据层去。由于这里存储的是当前最新数据,所以它对了解当前情况具有重要作用;
3、轻度综合数据:轻度综合层数据来源于底层,它综合、总结不同阶段、不同层次的底层数据。但这些信息只是一些简单的汇总,尚不能形成高级的决策信息;
4、高度综合数据:高度综合数据层内容为高度有序化的信息,而非简单的数据。这一层的数据高度聚合,是一种准决策数据。
(二)数据的存储结构
图书馆数据仓库设计的初衷就是保持数据的一致性,而且随着数据仓库从开始、发展到成熟必然伴随着数据表的扩大和数据量的增长,因此在数据的存储结构设计之初应首先重视数据库对象命名标准和物理文件的命名和位置标准。例如确定同一对象在其物理表达中使用相同的名称、尽量使用逻辑名称和物理名称相同的字段、在设计时假定認为对数据库大小写敏感等。
四、图书馆实现数据仓库时对数据的处理
ETL即数据抽取、转换和加载是数据仓库实现过程中将源数据系统向数据仓库加载的主要过程。ETL过程关系到应用数据质量的好坏,是数据仓库应用的基石。
(一)数据的清洗
1、读者信息数据的清理
读者的信息主要是从读者基本信息库中提取数据,包括读者证件号、读者类型、单位等。如果这几个字段出现数据的不完整则选择删除记录。
2、馆藏文献数据的清理
有关文献的数据出现的错误往往都是人为输入时出现的失误,数据中出现的主要错误多为小数点错点或忘点,也可能出现非数字的符号。对于这些错误可以进行人工修改,也可以进行标记然后删除不完整的记录。
(二)数据的抽取
在数据抽取时,需要重点考虑数据抽取的效率,以及对现有业务系统性能及安全的影响。数据的抽取必须既能够充分满足决策支持系统的需要,又要保证不影响业务系统的性能,所以,进行数据抽取时应制定相应的策略,包括抽取方式、抽取时机、抽取周期等。在制定抽取策略时需要综合考虑各项因素,根据图书馆的特点,采取相应的抽取方式。流水型增长-目,数据量大的数据适合采取增量抽取的方式,像文献借阅信息,此外,对于抽取周期要考虑实际的需求和抽取进行的系统代价,在可能的情况下,尽量缩短抽取周期。
(三)数据的转换
数据的转换是指对从业务系统抽取的源数据根据数据仓库系统模型的要求,进行数据的转换、清洗、拆分、汇总等处理,保证米白不同系统、不同格式的数据的一致性和完整性,并按要求装入数据仓库。在建立图书馆数据仓库过程进行数据转换有两个方面需要注意:
1、文献索书号的转换
图书馆图书的索书号不仅分类细致且数值分散,因此在处理数据时取第一大类和第二级分类就可以了,例如F840/85。也就是说对于小数点后面的细微分类可以忽略,只取前两位进行分析。
2、借阅时间的转换
图书馆的图书管理系统中的时间格式为年月日小时分钟秒,而其它相关系统中的时间可能为年月日,为了符合下一步的挖掘工作,应当将借阅时间的属性做相同处理例如统一划分为年月日。
由于建立数据仓库时的主要数据都是由完整的数据库中转出来的数据,例如读者基本信息库、文献借阅数据库,并不需要重新处理。但是在数据转换的关系或是人工输入的失误使得数据的格式错误,因此对于数据的正确性和数据的格式需求进行处理。另外经过转换或运算可以从有些本身没有太大意义的数据获得某系概念结构,便于找出更多数据特性与概念层之间的关系。
参考文献:
[1]张俊,张忠能.实时数据仓库架构的研究[J]计算机工程,2004,1000-342.
[2]王云峰.数据仓库与OLAP技术研究及应用,中南大学硕士学位论文,2005.
[3]杨艳,数字图书馆个性化服务技术的研究[D]哈尔滨工业大学博士学位论文,2005,2
[4]许春艳.面向实时数据仓库的ETL研究.南京航空航天大学硕士学位论文,2007.
[5]钱力,数字图书馆个性化信息服务系统的研究与设计,首都师范大学硕士学位论文,2008,4.
关键词:图书馆数据仓库;数据选取;数据转换
中图分类号:G250 文献标识码:A 文章编号:1009-0118(2010)-08-0023-02
随着信息技术和网络技术的飞速发展,高校图书馆在走过了传统图书馆阶段、自动化阶段之后,已经步入数字化建设阶段。数据仓库以传统的数据库技术作为存储数据和管理资源的基本手段,是诸多学科相互结合、综合应用的学科,更是一种解决问题的技术方案。如果可以将数据仓库技术很好地应用到图书馆的建设当中,必然可以缩短我国与国外发达国家数字图书馆建设的差距,提高满足读者需求的程度,而在实现数据仓库的过程中对相关数据的操作可以说是重中之重。
一、高校图书馆的馆藏数据特点
公共图书馆的读者层次比较丰富,因此各类藏书量较为平均。而高校图书馆的藏书结构与其有着明显的区别,主要体现在以下几个方面:
(一)资源海量性
随着高校的不断发展壮大,图书馆的馆藏资源范围也更加广泛、全面,而伴随读者数量的不断增加图书馆的借阅数据、馆藏数据也以惊人的速度增长。
(二)数据关联性
高校图书馆的读者层次相对稳定,馆藏资源与读者的需要更加紧密。从图书馆系统一扣所积累的大量借阅记录中可以看出,不同的读者同时借阅多种图书或者同种图书在不同时间被不同的读者借阅都存在某种程度的相关性。
(三)信息潜在性
高校图书馆不仅藏有最近的图书资料,同时也拥有非常丰富的历史资料。从大量的数据信息中可以挖掘出读者曾经的借阅行为,从而分析出读者现在及未来的借阅需求。
二、数据仓库中的数据选取及整体结构
(一)数据的选取
从数据源中抽取出合适的数据,了解数据的形式,才能更好地处理问题。高校图书馆建设数据仓库时选取数据的具体信息应该包括以下几个方面:
1、读者基本信息。包括读者条码号、证件号、姓名、身份证号、读者类型、单位、借阅等级、年级组、系别。
2、读者借阅信息。
3、馆藏资源数据。
4、文献借阅统计数据。
(二)数据的整体结构
相对于公共图书馆读者信息的易变性而言高校图书馆的读者群相对比较稳定,通过主题确定的过程可以知道本文用到的数据从宏观上分为两种即读者的自然信息和读者的行为信息,因此可以通过静态获取和动态获取两种方式得到需要的信息。
1、静态信息
读者的个人基本信息是不发生变化的,由后台数据库系统提供。这里的静态是相对动态而言的,因为高校图书馆的读者在整体上每年都会随着毕业生离校和新生入学二产生变化。
2、动态信息
所说的动态信息包括读者的行为信息和馆藏资源的变化。读者的行为信息包括读者的借阅情况、超期行为等;馆藏资源的变化包括资源的访问情况、书籍的利用率等。
三、数据仓库中数据的组织与存储
(一)数据的组织
数据仓库中的数据通常采用分级的方式进行组织。数据一般包含早期细节数据、当前细节数据、轻度综合数据、高度综合数据。
1、早期细节数据:主要用于数据对比、回归、汇总、预测等,供决策分析、建模之用。这类数据随时间增加,数据量大,使用频度低;
2、当前细节数据:当前细节数据该层存储当前最新的细节数据,在一定时刻这些数据会转移到历史数据层去。由于这里存储的是当前最新数据,所以它对了解当前情况具有重要作用;
3、轻度综合数据:轻度综合层数据来源于底层,它综合、总结不同阶段、不同层次的底层数据。但这些信息只是一些简单的汇总,尚不能形成高级的决策信息;
4、高度综合数据:高度综合数据层内容为高度有序化的信息,而非简单的数据。这一层的数据高度聚合,是一种准决策数据。
(二)数据的存储结构
图书馆数据仓库设计的初衷就是保持数据的一致性,而且随着数据仓库从开始、发展到成熟必然伴随着数据表的扩大和数据量的增长,因此在数据的存储结构设计之初应首先重视数据库对象命名标准和物理文件的命名和位置标准。例如确定同一对象在其物理表达中使用相同的名称、尽量使用逻辑名称和物理名称相同的字段、在设计时假定認为对数据库大小写敏感等。
四、图书馆实现数据仓库时对数据的处理
ETL即数据抽取、转换和加载是数据仓库实现过程中将源数据系统向数据仓库加载的主要过程。ETL过程关系到应用数据质量的好坏,是数据仓库应用的基石。
(一)数据的清洗
1、读者信息数据的清理
读者的信息主要是从读者基本信息库中提取数据,包括读者证件号、读者类型、单位等。如果这几个字段出现数据的不完整则选择删除记录。
2、馆藏文献数据的清理
有关文献的数据出现的错误往往都是人为输入时出现的失误,数据中出现的主要错误多为小数点错点或忘点,也可能出现非数字的符号。对于这些错误可以进行人工修改,也可以进行标记然后删除不完整的记录。
(二)数据的抽取
在数据抽取时,需要重点考虑数据抽取的效率,以及对现有业务系统性能及安全的影响。数据的抽取必须既能够充分满足决策支持系统的需要,又要保证不影响业务系统的性能,所以,进行数据抽取时应制定相应的策略,包括抽取方式、抽取时机、抽取周期等。在制定抽取策略时需要综合考虑各项因素,根据图书馆的特点,采取相应的抽取方式。流水型增长-目,数据量大的数据适合采取增量抽取的方式,像文献借阅信息,此外,对于抽取周期要考虑实际的需求和抽取进行的系统代价,在可能的情况下,尽量缩短抽取周期。
(三)数据的转换
数据的转换是指对从业务系统抽取的源数据根据数据仓库系统模型的要求,进行数据的转换、清洗、拆分、汇总等处理,保证米白不同系统、不同格式的数据的一致性和完整性,并按要求装入数据仓库。在建立图书馆数据仓库过程进行数据转换有两个方面需要注意:
1、文献索书号的转换
图书馆图书的索书号不仅分类细致且数值分散,因此在处理数据时取第一大类和第二级分类就可以了,例如F840/85。也就是说对于小数点后面的细微分类可以忽略,只取前两位进行分析。
2、借阅时间的转换
图书馆的图书管理系统中的时间格式为年月日小时分钟秒,而其它相关系统中的时间可能为年月日,为了符合下一步的挖掘工作,应当将借阅时间的属性做相同处理例如统一划分为年月日。
由于建立数据仓库时的主要数据都是由完整的数据库中转出来的数据,例如读者基本信息库、文献借阅数据库,并不需要重新处理。但是在数据转换的关系或是人工输入的失误使得数据的格式错误,因此对于数据的正确性和数据的格式需求进行处理。另外经过转换或运算可以从有些本身没有太大意义的数据获得某系概念结构,便于找出更多数据特性与概念层之间的关系。
参考文献:
[1]张俊,张忠能.实时数据仓库架构的研究[J]计算机工程,2004,1000-342.
[2]王云峰.数据仓库与OLAP技术研究及应用,中南大学硕士学位论文,2005.
[3]杨艳,数字图书馆个性化服务技术的研究[D]哈尔滨工业大学博士学位论文,2005,2
[4]许春艳.面向实时数据仓库的ETL研究.南京航空航天大学硕士学位论文,2007.
[5]钱力,数字图书馆个性化信息服务系统的研究与设计,首都师范大学硕士学位论文,2008,4.