论文部分内容阅读
信息是人类社会生活的基本要素之一,其中科技信息是推动人类社会发展的关键因素。专利文献作为科技信息最有效的载体,涵盖了全球90%以上的最新科技信息,在国家科技战略制定中发挥了重要作用。对专利信息进行深度挖掘和有效分析,可以选择技术开发的重点和方向,进行专利战略布局,制定技术创新策略,辅助政府和企业缩短研发时间,节省研发经费,监控世界技术发展状况。 目前,专利挖掘方法可分为专利元数据计量分析和专利文本挖掘两种。前者在方法上比较成熟,但是计量分析有局限性,其深入挖掘文本信息的能力较差。后者则是专利分析中的研究热点和难点,其深层分析和挖掘离不开专利文本的语义分析。现有的专利文本分析所使用的语义分析大都建立在句法分析基础上,多为规则方法或者模式匹配方法,语义分析的深度远远不足以支撑专利信息的有效分析。文章将自然语言处理中的浅层语义分析技术——自动语义角色标注引入专利文本分析中,在提高语义角色标注表现的基础上,利用语义角色标注完成专利文本的自动化语义分析,实现目前专利文本挖掘不能达到的深度,同时节省大量人工劳动。 本研究包含如下两个方面的内容: 其一,语义角色标注的基础理论。鉴于目前缺少面向专利文献的语义角色标注树库的现状,本研究构建了专利专属领域的语义角色标注树库,该树库的构建有利于后续的语义角色标注系统构建和评价;专利文本中长句居多,长句多为复杂的嵌套结构,常常带有从句,如名词性从句、形容词性从句和副词从句。本研究利用句法分析结果设计规则方法将专利长句划分为简化句,减少了句法分析错误,避免了句法分析错误向语义角色标注传播;在上述工作的基础上,为了更为有效地利用大量的专利文本以及专利的上下文语境,本研究引入词向量的表示方法进行细致的特征泛化工作,找到了多个能提高语义角色标注表现的新特征,实验证明加入了新特征的语义角色标注系统表现更好更稳定。 其二,语义角色标注在专利文本分析上的应用。为了从已标注语义角色的专利文本中抽取出有用的专利知识,需要甄别不同谓词的语义角色信息,既要保证准确率又要减少噪音,本研究通过对语义角色进行重定义和重分类,长句切分简化句,抽取了专利文本中的有用信息,实现了专利主题信息的自动提取和基于谓词驱动的专利功效矩阵的自动构建两种重要应用。这有效弥补了以前专利文本分析的“规则”方法、模式匹配方法以及统计分析方法的不足,偏重专利内容中的语义知识的挖掘,更多地利用其中隐性的知识情报,从而实现了专利文本的“半自动化”语义分析,更客观有效。