基于监督学习的校友实体关系抽取研究

来源 :南开大学 | 被引量 : 0次 | 上传用户:xjc132
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
校友是高校发展的重要资源,大量的校友信息蕴含在电子文本或者网页中,如何从中抽取出校友信息是一项很有价值的研究问题。传统的解决方法是使用实体抽取方法将人名看作候选校友,但在复杂语境下,会出现“人名-学校”匹配不准确的问题。本文将校友信息看成“人名-学校”关系,提出使用实体关系抽取模型来解决校友信息的抽取问题。而此类关系抽取模型亦可应用于抽取“人名-公司”的雇佣关系和“人名-职位”的任职关系等。   在实际抽取中可以发现校友关系是存在于不同层级的机构上的,例如,人名-学校,人名-院系,人名-班级等。而解决此类问题的关键则在于高校机构的   层级关系抽取。如此,得到的机构实体及基于此的校友关系便可以实现类似于数据仓库上卷、下钻的操作,便于获取不同层级的实体关系。   本文针对校友实体关系抽取、机构层级关系抽取这两个问题进行了研究。   在进行校友实体关系抽取时,提取当前实体特征、其他人物实体特征和其他层级序列特征,采用SVM作为分类算法,判断人物实体与机构层级序列之间是否具有校友关系。通过实验验证了算法的有效性,并且发现其他人物实体特征和其他层级序列特征的引入,对抽取的准确率和衡量整体性能的F值有一定提升。   在进行机构层级关系抽取时,从上下文中提取距离方面的特征、层级方面的特征和实体类型方面的特征,采用SVM作为分类算法,判断机构实体之间是否具有层级关系。通过实验验证了方法的有效性并且发现距离方面的特征对分类具有主要的贡献,此外实体类型特征的引入提升了算法的召回率。
其他文献
强化学习是人工智能领域中一种重要的用于解决学习控制问题的方法。但是经典强化学习算法在解决RoboCup局部策略训练问题时,仍然存在算法收敛速度缓慢,无法有效解决训练中存在
图像分割是指将一幅图像中的包含特殊含义的不同区域区分出来的过程,它是数字图像处理领域中最为基本的一个问题。由于其复杂性,至今仍然没有一种通用的方法能满足各种不同的需
JPEG图像作为应用最广泛的图像格式,保证其真实性在某些场合至关重要,而图像合成是最常见的图像篡改手段,JPEG图像合成伪造总体上可以分成同幅合成伪造和异幅合成伪造两类,针对于
随着生物技术、图像处理技术以及计算机技术的发展,医学图像配准已经成为现代医学图像处理的关键技术。作为医学图像融合及其他医学图像分析的前提和基础,医学图像配准对临床
近年来,空气质量问题受到社会各界的广泛关注。2012年2月,国家相关部门发布了新修订的《环境空气质量标准》,增设了PM2.5和O3浓度限值并对现有部分限值进行了调整,新标准势必要求
WebGIS是以互联网为环境,以Web页面作为GIS软件的用户界面,将Internet与GIS技术结合在一起,为各种地理信息应用提供GIS功能的技术[1],它将Web技术、GIS技术和数据库技术融为一体,
随着办公自动化的不断普及,信息采集系统已成为各个领域不可或缺的办公工具,数据作为信息采集系统最重要的部分,研究如何将数据以中文复杂报表的形式呈现出来是目前信息采集系统
多核和众核架构有望解决或缓解现代处理器设计面临的存储墙、线延迟和功耗问题,分片式处理器作为一种代表性的众核实现方案,强调功能单元的分布化、结构的层次化,将硬件细节暴露
随着网络技术的迅速发展,面向服务的体系架构(SOA)以其良好的可重用性、松耦合性和互操作性,已成为一种工业界和学术界广泛接受的网络化软件应用模式。Web服务作为SOA的主流
群体智能优化算法属于随机搜索算法的一种,由于其可以解决传统优化技术无法解决的优化问题,因此受到众多专家学者们的青睐。人工蜂群算法是新兴的群体智能优化算法,算法主要