生物信息学中的文本挖掘

来源 :科技风 | 被引量 : 0次 | 上传用户:yujian136
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
  摘 要:随着生物信息学领域的发展,信息抽取和信息检索广泛应用于生物信息学领域。文章总结了近几年来生物信息学中信息抽取和信息检索方法的应用,作为生物信息学中文本挖掘的重要工具,其研究价值正得到越来越多的认可和重视。
  关键词:生物信息学;信息抽取;信息检索;文本挖掘
  在过去的十几年中,随着生物医学文献的飞速增长,基因组学和蛋白质组学领域的生物医学数据出现了巨量增长。人类基因组序列排序标志着大规模基因组学和蛋白质组学时代的开始。虽然可以进行涉及基因和蛋白质的大規模实验,但对它们的解释仍然是一个关键问题。例如,到目前为止,许多基因组数据的大规模分析都侧重于基因表达模式,并且在基因表达基础上建立基因聚类,而解释形成的基因聚类需要进行更进一步的分析。
  当前,最常使用的生物医学摘要源是由美国国家生物医学技术信息中心(NCBI)维护的PubMed,它包含超过12,000,000篇生物医学科技文献摘要,每天被遍及世界的数百万用户访问。
  PubMed中的典型相关文献搜索是一个布尔查询,需要用户提供相应的搜索项或搜索项组合,然后返回所有满足查询的摘要集合。但是,PubMed并不提供基于相似度的工具以帮助用户访问这些返回的摘要集中与相关文档相似的文档。
  为了提高文献搜索的效率和精度,一些研究人员提出了一些自动文献搜索方法,主要分为两种方法:一种是建立在信息抽取和自然语言处理基础上的生物信息学信息抽取;另一种是建立在信息检索基础上的生物信息学信息检索,它在检索粒度上解决了文献挖掘问题。
  1 生物信息学信息抽取
  迄今为止,多数生物医学文献挖掘的工作都侧重于自动信息抽取,在生物信息学背景下,信息抽取系统旨在发现关于一个给定基因或关于特定基因间相互关系的信息。
  Leek利用隐马尔科夫模型(HMM)抽取文献中讨论染色体上基因定位的句子。基因和染色体名称利用简单的启发式识别,而实验方法以及定位标志在一个预定义列表中给出,HMM自身的状态概率和转移概率从被标注的OMIM项中学习。训练和测试集都由几百个句子组成,系统性能用准确率和召回率度量。
  Craven等在这一工作上进行了扩展,他们开发了用于从枯燥的句子中鉴别描述事实句子的系统。系统被设计成用于识别两种类型的事实:蛋白质亚细胞定位和基因疾病之间的关联。Ray & Craven进一步扩展了这一工作,他们利用描述句子结构的HMMs识别那些讨论基因与疾病间相关联的句子。该工作不使用预定义的词汇,而有关基因和蛋白质句子的正确识别也仍局限于在训练模型中使用过的名称。
  Rindflesch等和Friedman等在传统NLP基础上提出了基于解析和使用主题词表的方法,该方法可以从文档中抽取关于基因和蛋白质的相关信息。他们的不同之处在于Rindflesch等的工作关注药物对细胞中基因活性的作用,而Friedman等则关注于基因和作为调控途径的蛋白质之间的相互作用。
  Blachke等使用了一种更简单的方法,该方法依赖于句子中基因和蛋白质的共现,而不是机器学习方法或先进的NLP,其目标是在一个与蛋白质相关的预定义集合中抽取蛋白质相互作用的信息。它使用了一个蛋白质名称列表和一个相互作用,通过查找两个共现的蛋白质被一个表示相互作用的单词分割的句子来识别蛋白质相互作用。Blashke & Valencia扩展了这一工作,在该工作中他们使用了一个蛋白质名称检测模块,并对句子中的否定进行了处理。
  到目前为止所有的方法都是被应用于较小的样本集,Jenssen等迈出了在大规模分析上的重要一步。他们利用一个预定义的蛋白质名称列表,通过一个布尔查询查找PubMed中提及这些基因的所有摘要,并在此基础上建立了一个以基因作为节点和连接在相同文献中提及基因为边的图,边的权重表示共现的次数。与此类似,许多基于蛋白质/基因名称共现的系统通常建立在一个从公用数据中收集而来的词库基础上。
  虽然研究人员对于使用信息抽取和自然语言处理的方法投入了很多努力,但这些方法通常强依赖于预定义信息,但很多预定义信息往往难以获得。
  2 生物信息学信息检索
  最常用的信息检索已经被研究者广泛应用于搜索感兴趣的文章,同样,在生物信息学领域已经开发出许多基于信息检索的大规模生物医学分析方法。
  该领域的最初工作是由Shatkey等完成的,他们的目标是发现基因间的功能性关系而不强依赖于基因名称或句子结构,该方法是建立在许多基因和它们的功能已经在文献中讨论这一假设基础上。
  其他一些研究者将一些信息检索方法应用于生物信息学领域,主要是聚类和分类的变形。Renner & Azodi提出一个蛋白质标注聚类方法。Iliopoulos等将k-means聚类应用到一个较小的PubMed摘要集以获取有意义的子集,每一个子集讨论一些共同的主题,该主题由聚类中抽取的词项来描述。Marcotte等使用一个依赖于辨别词的Bayers分类器来识别讨论PPI的摘要。
  信息检索技术的另一个应用是蛋白质的同源性领域。Donaldson等开发了PreBind/Textomy系统,该系统为了从文献中发现PPI,组合了信息检索和信息抽取。
  在信息检索阶段,训练了一个SVM分类器来区分摘要是否讨论了PPI,然后分类器被用于识别和检索与PPI相关的摘要。一旦检索到相关摘要,则应用信息抽取来识别文本间的相互作用。
  3 结语
  随着生物信息学领域的发展,信息抽取和信息检索广泛应用于生物信息学领域。文章总结了近几年来生物信息学中信息抽取和信息检索方法的应用,作为生物信息学中文本挖掘的重要工具,其研究价值正得到越来越多的认可和重视。
  参考文献:
  [1] 于跃,徐志健,王珅等.基于双聚类方法的生物医学信息学文本数据挖掘研究[J].图书情报工作,2012,56(18):133-136.
  [2] 齐彬,吕婷.共现分析技术在生物医学信息文本数据挖掘中的应用[J].中华医学图书情报杂志,2009(3):41-43.
其他文献
著名天主教传教士艾儒略在福建活动达25年之久,使元代以后一度沉寂的天主教在福建重新得以传播和发展,为中西文化交流作出了重大贡献.本文试图以《口铎日抄》为例,从讲故事、
目的 探讨改进逆行第1跖背血管蒂岛状皮瓣修复(足母)趾趾端缺损的手术疗效.方法 在解剖学基础上,采用改进逆行第1跖背血管蒂岛状皮瓣修复(足母)趾趾端缺损10例.结果 术后10例皮瓣
目的探讨超声多普勒血流仪在移植皮瓣术后毛细血管反应观察中的应用价值。方法78例移植皮瓣术后患者除常规单纯肉眼观察外,还应用超声多普勒血流仪监测设为实验组;76例传统单纯
摘 要:高校史料教学,是指教师通过对相关史料的处理,让学生自主地从材料中获取历史信息的教学方法。史料教学应遵循结合重点、适度补充、多样性和真实性原则。史料教学适用于问题式教学法和情境式教学法。为使高校史料教学达到预期效果,关键在于提高历史教师运用史料的意识及提升教师处理史料的能力。  关键词:高校历史;史料教学;教学方法  一、史料教学概述  史料,通常是指那些人类社会历史在发展过程中所遗留下来的
目的探讨小腿上段皮肤软组织缺损、胫骨上段空腔及缺损伴感染,本小腿皮肤及肌肉条件差,已无法利用情况下创面的修复方法。方法应用缝匠肌肌皮瓣逆行转移修复。结果本组病例肌皮
血液滤过是血液净化疗法的一种,90年代以来己广泛应用于危重症领域的治疗,如急性肾功能衰竭、全身多脏器功能衰竭、严重体液及电解质紊乱酸碱平衡失调、严重创伤等。但应用于断
目的 比较左旋布比卡因与甲磺酸罗哌卡因用于肌间沟臂丛神经阻滞的效果.方法 断指再植手术患者80例,随机分为两组(n=40),实验组0.375%左旋布比卡因30ml,对照组0.596%甲磺酸罗派
写作是语言的五大基本技能之一,是各级各类成人考试的重要内容。在我国,由于“成品教学法”存在一些缺陷,“过程写作法”受到越来越多的重视。本文认为“过程写作法”更加符合我
目的探讨松节油灌注治疗手部高压油漆注射伤的疗效。方法1997年7月-2005年6月,我科采用松节油术中、术后灌注治疗手部高压油漆注射伤7例。结果术后随访1~2年,4例指掌色泽正常,基