MarcEdit在元数据组织与管理中的应用

来源 :现代情报 | 被引量 : 0次 | 上传用户:zhwenh_0421
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
  〔摘 要〕在分析了元数据组织和管理的现状后,本文探讨了如何使用MarcEdit工具,来提高图书馆工作人员获取元数据和转换元数据格式的能力,为读者提供更好的在线服务。
  〔关键词〕MarcEdit;元数据;MARC编辑;元数据获取;格式转换
  〔中图分类号〕G350.7 〔文献标识码〕B 〔文章编号〕1008-0821(2009)09-0151-04
  
  Application of the Metadata Orga nization and Management of MarcEditYao Xiaofeng
  (Library,Jiaxing University,Jiaxing 314001,China)
  〔Abstract〕In the analysis of the status of the metadata organization and management,this paper discussed how to improve the library staff’s ability to harvest metadata and metadata format conversion with MarcEdit tool,and to provide the better online services for users.
  〔Key words〕MarcEdit;metadata;Edit MARC;harvest metadata;format conversion
  
  随着Internet的发展以及网络资源的广泛应用,数字图书馆的数量也在不断增多。图书馆中的纸质收藏(如图书、期刊)需要编目,数字图书馆的数字收藏(digital collection)也同样需要著录和标引,以便用户能够准确快速地找到自己所需的信息。元数据是建设数字图书馆过程中的关键性基础问题,但是由于数字图书馆中的资源类型多种多样,单一元数据标准不能满足描述各种数字资源的需要,从而出现适用于不同资源或适用于不同组织的元数据标准。比如说,DC(Dublin Core)元数据是当前国际上最有影响力的元数据格式,其基本内容是由15个元素构成的元数据元素集合,称为“都柏林核心元数据元素集”(Dublin Core Metadata Element Set:DCMES),已成为多个国际标准组织和许多国家的正式标准[1]。
  
  1 元数据组织和管理的现状
  
  近十年的电子图书馆、电子商务和电子政务等应用的结果显示,都柏林核心集(DC)等元数据及元数据的互操作方案并未有效简化因特网的知识组织和信息发现。与之相反,Google等搜索引擎已成为大众获取最新信息的入口,连OCLC(Online Computer Library Center,联机计算机图书馆中心)都将经营多年的WorldCat(世界上最大的书目数据库)数据贡献给搜索引擎。后者的成功源于专注用户的需求并及时调整检索结果的次序,即依据用户的点击(链接)而不是信息本身的“元数据”来判断信息的价值[5]。元数据作为一种描述数据的数据,虽说历年来颇受重视,但在实际应用中失败的案例屡见不鲜,有时候甚至受到排斥。可见,在元数据的组织和管理上的确还存在着一些问题。
  对此,相关专家也已经做了很多的研究和尝试,如DC曾针对网页搜索的查询效率和准确性不能令人满意的状况,试图引入图书馆员馆藏编目的方法对网页进行“书目控制”,以元数据的再组织方式实现对元数据的有效管理[1]。然而由于没有适当的工具对网页进行高效率而低成本的处理,更由于“作者”(网页创建者)自己对网页进行标注极易造成元数据的“滥用”,使得元数据的“书目控制”问题一再搁浅。
  
  2 MarcEdit简介
  
  MarcEdit最初的构思是在2000年夏,主要是针对俄勒冈州立大学图书馆电子目录数据库的清理项目。这个项目的主要问题在于,系统中有到底多少要清除的无效记录。经过细心统计后发现,竟然有45 000条记录必须予以纠正。面对如此庞大的清理任务,使用国会图书馆(Library of Congress,LC)现有的MARCBreakr或者MARCMakr工具显然已无法胜任。要完成这个清理计划,必须要有一个功能更强大的工具。于是,一个新型的MARC工具——MarcEdit诞生了,它能够轻松快捷的完成数量庞大的清理任务(仅用了短短几个小时),同时也使图书馆工作人员能有充足的时间去验证这些已修正过的错误数据。这个项目获得了极大的成功,MarcEdit在其中发挥了极大的作用[4]。
  
  3 MarcEdit的功能介绍
  
  随着元数据格式和需求的不断改变,MarcEdit也在不断的变化着。在今天来看,MarcEdit这个名字似乎已经不太恰当了,因为它已不再是一个单纯的MARC批量编辑工具,它的功能已经扩展了,包括对MARC记录的编辑、元数据的转换以及元数据的获取等等。
  3.1 MARC记录的编辑
  MarcEdit内置有一个MarcEditor,它是一个专门为编辑MARC记录而设计的文字编辑器,适用于各种MARC格式。使用MarcEditor可以实现大批量的MARC编辑任务,最大容量可以定义成2GB。MARC编辑器的目标,就是要使用户用最简单的方法,轻松快捷的实现对大批量MARC数据的修改。其功能主要有修改字段(Edit Fields)、修改子字段(Edit Subfields)、修改指示符(Edit Indicators)等等,见图1:
  在图1这个例子中,用户将把所有300字段(载体形态字段)中描述为“MIN.”的D|Sa子字段(篇幅)内容替换成“min.”。对于图书馆工作人员来说,MARC修改是一个非常繁重的任务,特别是大批量MARC修改时,一条一条地修改记录,将是一个非常耗时耗力的工作。而MarcEditor操作简单,支持批量修改,可以让工作人员非常轻松的完成MARC修改任务。并且针对“作者”自己对网页进行标注极易造成元数据的“滥用”问题,MarcEditor也可以对它进行恰当的修改,使元数据能够更加精确地描述数据。
  3.2 元数据的转换
  在可扩展语言转换样式表(the Extensible Stylesheet Language Transformations,XSLT,专门用于转换XML文件)的基础上,MarcEdit可以轻易地将各种元数据格式转换成MARC格式。其主要功能有:将MARC文件转换成文本文件(MarcBreaker),将文本文件转换成MARC文件(MarcMaker),元数据格式和MARC格式的相互转换(MARC→MARCXML,MARCXML→MARC,XML Functions)等等,见图2。
  MarcEdit格式转换的第一步,就是将各种元数据格式先转换成MARC21 XML格式。为什么要转换成MARC21 XML格式呢?这是因为MarcEdit使用的是一种轮辐性(Wheel-and-Spoke)转换模式,而MARC21 XML处在一个最中心的位置。一旦发生转换请求,就可以实现轮辐之间的相互转换。也就是说,通过MARC21 XML,不仅可以实
  现各种元数据格式向MARC格式转换,也可以实现MARC格式向各种元数据格式的转换。比如说可以将EAD(Encoded Archival Description,档案描述编码)转换成MARC,也可以将MARC转换成MODs(Metadata Object Description Schema,元数据对象描述框架),见图3:
  举个例子来说,我们可以将一条从OCLC WorldCat下载下来的MARC21记录转换成MARC记录的文本格式,使之成为更加容易识别的记录,其原始记录格式如下:
  01191nam 2200253Ka 45
  0001001300000003000600013005001700019008004100036040 00130007709200150009004900090010510000210011424501250013
  52600061002605380036003215000081003575380073004385000128
  00511650004700639610004100686711007900727856011900806994
  001200925-ocm67705864 -OCoLC-20060426101930.0-060426s2006stks100 0 eng d- aCX@cCX@-0 a025.04222- aCX@A-1 aDunsire,Gordon.-14aThe Centre for Digital Library Research and the common information environmenth[electronic resource]/cGordon Dunsire.- aGlasgow:bCentre for Digital Library Research,c[2006].- aMode of access:World Wide Web.- aTitle from title screen.Description based on contents viewed Apr.26,2006.- aSystem requirements:Plug-in viewer for Adobe Acrobat PDF documents.- a″The text of a presentation given to the 8th seminar on Archives,Libraries,Museums,24-26 November 2004,Porec,Croatia.″-0aInformation storage and retrieval systems.-24aCentre for Digital Library Research.-2 aArchives,Libraries,Museums(Conference)n(8th:d2004:cPorec,Croatia)-40acdlr.strath.ac.ukdpubs/dunsiregfcdlrcie.pdf-
  uhttp:∥cdlr.strath.ac.uk/pubs/dunsireg/cdlrcie.pdfqapplication/pdf- aC0bCX@
  使用MarcBreaker功能将MARC21记录转换成文本格式后,其记录格式如下:
  =LDR 01191nam 2200253Ka 45 0
  =001 ocm67705864
  =003 OCoLC
  =005 20060426101930.0
  =008 060426s2006\\\\stk\\\\\s\\\\\100\0\eng\d
  =040 \\D|SaCX@D|ScCX@
  =092 0\D|Sa025.04D|S222
  =049 \\D|SaCX@A
  =100 1\D|SaDunsire,Gordon.
  =245 14D|SaThe Centre for Digital Library Research and the common information environmentD|Sh[electronic resource]/D|ScGordon Dunsire.
  =260 \\D|SaGlasgow:D|SbCentre for Digital Library Research,D|Sc[2006].
  =538 \\D|SaMode of access:World Wide Web.
  =500 \\D|SaTitle from title screen.Description based on contents viewed Apr.26,2006.
  =538 \\D|SaSystem requirements:Plug-in viewer for Adobe Acrobat PDF documents.
  =500 \\D|Sa″The text of a presentation given to the 8th seminar on Archives,Libraries, Museums,24-26 November 2004,Porec, Croatia.″
  =650 \0D|SaInformation storage and retrieval systems.
  =610 24D|SaCentre for Digital Library Research.
  =711 2\D|SaArchives,Libraries,Museums(Conference)D|Sn(8th:D|Sd2004:D|ScPorec,Croatia)
  =856 40D|Sacdlr.strath.ac.ukD|Sdpubs/dunsiregD|Sfcdlrcie.pdfD|Suhttp:∥cdlr.strath.ac.uk/pubs/dunsireg/cdlrcie.pdfD|Sqapplication/pdf
  =994 \\D|SaC0D|SbCX@
  MarcEdit实现了各种元数据格式与MARC格式的相互转换,在很大程度上,可以改变元数据格式多样化、标引混乱和难以利用的局面。通过MarcEdit,图书馆工作人员可以将各种转换成MARC格式的元数据导入本地的自动化系统,还可以对元数据进行深度加工,使标引更加精确,管理更加简单,读者使用起来也就更加方便。
  3.3 元数据的获取
  MarcEdit还简化了获取OAI元数据的过程,用户只要简单的提供元数据仓储的地址(Server Address)和集名(Set Name),就可以获取来自这个仓储中所有属于这个集内的元数据记录。此外,用户还可以随意限定要获取的元数据类型(Metadata Type),并通过预先设置好的横道(Crosswalk Path),实现获取和转换的同步操作。在高级设置中,还有一些特殊的功能,比如说用户可以对子集进行限制(Start,End),可以获取个别的记录(GetRecord),可以恢复预定的记录点(Resumption Token,重获功能),还可以将记录的编码转换成MARC8格式。(见图4)
  在图4这个例子中,用户将在卫奇塔州立大学的元数据仓储中,获取所有来自hdl10057253(COE Theses and Dissertations)集内的所有DC元数据记录,并将获取的所有DC记录转换成MARC21 XML格式。图4 元数据收割示例图
   MarcEdit实现和简化了元数据获取和转换的过程,使图书馆工作人员能够轻松的将各种类型的元数据导入本地的自动化系统,并同时转换成容易识别的MARC格式,使网络资源的组织和管理更趋向于合理化和有效化,同时也使读者使用这些资源时无需面对各种复杂的格式或编码,实现了元数据格式的低障碍MARC化,从而提高读者对各种元数据的使用率。
  
  4 MarcEdit应用实例
  
  4.1 解决编码无法辨认的问题
  俄勒冈州立大学图书馆的工作人员在获取元数据的时候,发现获取到的元数据很多都是用UTF-8编码(Unicode Transformation Format-8 bit)的,而他们的图书馆自动化系统却不能识别这种编码形式,从而导致获取到的元数据不能顺利地导入本地的书目系统。在使用了MarcEdit以后,他们轻松地将UTF-8编码转换成了MARC记录,实现了元数据和本地书目数据的兼容并存,更好地为读者提供在线服务[6]。
  4.2 解决元数据获取中出现的问题
  密歇根州立大学图书馆的工作人员在元数据获取时,发现了两个问题。一个是数据提供者的服务器运行不稳定的问题。在获取过程中,一旦超过了10万条记录以后,服务器经常会断线。一旦断线之后,恢复获取将非常困难,而重新获取又将耗时耗力。另一个是元数据编码错误的问题。这是因为有些数据提供者并没有严格遵守OAI协议,返回记录的语法和编码有问题,一些特殊字符也没有正确编码。一条记录的编码错误可能使整个记录集无效,这时又必须面对重新获取的问题了。MarcEdit很好的解决了这两个问题。首先它有一个Re sumption Token功能,能够支持从断点开始继续获取元数据。另外,在元数据输出时,一旦 发现有错误记录,MarcEdit在获取的同时也可以马上对它进行修正。使用了MarcEdit以后, 工作人员很快就解决了这两个主要问题,元数据的获取也能够快速简单地进行了[6] 。
  
  5 结束语
  
  随着越来越多的图书馆提供数字典藏的在线服务,我们图书馆的工作人员也将面对分布式元数据组织和管理的问题。不像正式出版物典藏,如今的元数据仓储和数字典藏,将迫使我们的工作人员去创造一个新的工作流程,为读者提供更为宽阔的数字化服务。MarcEdit无疑已经简化了这个过程,它能够使我们的工作人员(即便是非技术人员)轻松地获取和转换各种格式的元数据,不再需要面对复杂的编码问题。也许在不久的将来,我们的工作人员就会把获取和转换元数据作为一个工作的重心,而新的工作流程和新型的工具也会被不断的开发出来。
  
  参考文献
  [1]刘炜等.DC元数据的历史、现状及未来[EB/OL].DCChina.http:∥www.libnet.sh.cn/sztsg/fulltext/reports/2005/DCoverview.pdf,2009-01-31.
  [2]http:∥www.dspace.org/.dspace.org[EB].2009-03-15.
  [3]http:∥www.contentdm.com/.CONTENTdm Digital Collection Management Software by OCLC[EB].2009-03-15.
  [4]http:∥oregonstate.edu/~reeset/marcedit/html/index.php.MarcEdit Homepage:Your Complete Free MARC Software[EB].2009-03-15.
  [5]毛军.元数据、自由分类法(Folksonomy)和大众的因特网[J].现代图书情报技术,2006,(2):1-4,9.
  [6]Terry Reese.Automated metadata harvesting:low-barrier MARC record generation from OAI-PMH repository stores using MarcEdit[J].Library Resources & Technical Services,2009,(2):121-134.
其他文献
[摘 要]以社会科学引文索引收录北京师范大学论文数据为依据,统计了2000-2008年北京师范大学SSCI收录论文。围绕学科,针对论文数量、院系分布、作者、载文期刊和被引次数方面进行了统计与分析。结果表明,SSCI收录论文的学科相对集中,主要分布在心理、教育以及神经科学研究领域。收录论文的院系分布、载文期刊以及论文作者的情况,折射出北京师范大学社会科学学科发展的特点。  [关键词]北京师范大学;S
期刊
〔摘 要〕本文讲述了数字图书馆在E-learning环境下运用语义网格理论,构造了基于语义网格的体系模型,并描述了其各层的功能划分及组成,它能够有效地实现资源的有效共享及统一管理,为数字图书馆开展教育资源服务提供了有力保障。  〔关键词〕网格;语义;共享;教育资源  〔中图分类号〕G250.76 〔文献标识码〕A 〔文章编号〕1008-0821(2009)05-0058-04    Study o
期刊
〔摘 要〕随着Web2.0技术在图书馆学界的广泛应用,图书馆2.0应运而生,它是图书馆原有信息服务功能的进一步深化,更能彰显个性化服务的针对性、方便性、智能性、交互性和高效性。在Web2.0环境下,图书情报工作者需要更新观念创新服务,构建稳定的图书馆2.0服务系统,保障图书馆个性化服务可持续发展。  〔关键词〕Web2.0;图书馆2.0;个性化服务;可持续发展  〔中图分类号〕G252 〔文献标识
期刊
[摘 要]以公共物品的视角分析我国城市图书馆由单一供给体制向多元供给体制转变的原因,发现城市图书馆在多元化供给中存在公益性与盈利性的矛盾,政府与市场供给边界模糊;协调机制缺失,重复建设严重;多元化供给中政府的职责不明确等问题,提出在城市图书馆多元供给中,政府应完善相关法律法规,为各供给主体进入城市图书馆领域创造条件;构建合理的交流合作机制;厘清多元化供给中各供给主体之间的关系;政府角色重新定位等对
期刊
〔摘 要〕B-K方程的莫德列夫修正式是研究文献老化的重要方法之一。但人们在使用该修正式时混淆了公式中系数的约束条件。本文从B-K方程的莫德列夫修正式出发,详细讨论了公式中系数的约束条件以及它的科学意义。经过严格的数学推导得出B-K方程的莫德列夫修正式中系数a,b的第一个约束条件是ae0.1+be0.2=1,另一个约束条件为0a2e0.1且1-2e0.1b1。认为
期刊
[摘 要]知识转化是实现学习过程目标的关键。论述建构主义学习过程,提出并诠释建构主义学习过程的知识转化模式。探讨该模式的理论基础,并以《文献检索和利用课》中“文献观”学习过程的知识转化予以印证,以期从理论和实践的结合上赋予知识转化研究新的内涵。  [关键词]知识转化;学习过程;建构主义;文献观;知识学  [中图分类号]G302 [文献标识码]A [文章编号]1008-0821(2010)05-00
期刊
〔摘 要〕非正式出版文献是地方特色文献的重要组成部分。本文以深圳图书馆为例,分析了非正式出版地方文献种类、时间和来源的分布,论述了编目加工时的细则、特点和建立专题目录数据库等问题,并对非正式出版的地方文献采访提出建议。  〔关键词〕非正式出版文献;地方文献;编目;专题目录数据库;文献采访  〔中图分类号〕G256 〔文献标识码〕A 〔文章编号〕1008-0821(2009)05-0104-03  
期刊
〔摘 要〕个人数字图书馆是数字图书馆技术走向大众的产物,是E时代的精神家园。它以其数字化、数据库化、交互性、个性化、多媒体化等特征改变着人们的生活方式、学习方式、工作方式,具有广泛的应用前途。在这里可以使人们彰显个性、展示风采、交流思想、创新思维、陶冶情操、实现价值。  〔关键词〕个人数字图书馆;精神家园;数字化;个性化  〔中图分类号〕G250.76 〔文献标识码〕A 〔文章编号〕1008-08
期刊
[摘 要]本文从自然资源和人文资源两个角度系统论述了临沂地方文献所蕴藏的经济价值,自然资源是创造地方文献的基础,人文资源充实了地方文献发展,分析了临沂地方文献对临沂地方经济的作用,力求使地方文献推助地方经济跨越发展。  [关键词]地方文献;地方经济;旅游;文化;资源  [中图分类号]G250 [文献标识码]A [文章编号]1008-0821(2010)05-0137-03  Territorial
期刊
[摘 要]河源是广东一个欠发达地级市。公共图书馆事业较为落后,其信息服务工作水平、数字化程度、服务条件等都不能满足社会经济发展对信息资源的需求。由于办学水平的要求,当地高职院校图书馆已发展成为地区最大规模的图书馆,已成为地区资源共建共享的中心图书馆。以高职院校图书馆为中心,建立区域信息服务保障体系,是欠发达地区集中资源、利用资源、调整服务结构为地方经济服务的一项新举措。  [关键词]高职院校;区域
期刊