论文部分内容阅读
校友是高校发展的重要资源,大量的校友信息蕴含在电子文本或者网页中,如何从中抽取出校友信息是一项很有价值的研究问题。传统的解决方法是使用实体抽取方法将人名看作候选校友,但在复杂语境下,会出现“人名-学校”匹配不准确的问题。本文将校友信息看成“人名-学校”关系,提出使用实体关系抽取模型来解决校友信息的抽取问题。而此类关系抽取模型亦可应用于抽取“人名-公司”的雇佣关系和“人名-职位”的任职关系等。
在实际抽取中可以发现校友关系是存在于不同层级的机构上的,例如,人名-学校,人名-院系,人名-班级等。而解决此类问题的关键则在于高校机构的
层级关系抽取。如此,得到的机构实体及基于此的校友关系便可以实现类似于数据仓库上卷、下钻的操作,便于获取不同层级的实体关系。
本文针对校友实体关系抽取、机构层级关系抽取这两个问题进行了研究。
在进行校友实体关系抽取时,提取当前实体特征、其他人物实体特征和其他层级序列特征,采用SVM作为分类算法,判断人物实体与机构层级序列之间是否具有校友关系。通过实验验证了算法的有效性,并且发现其他人物实体特征和其他层级序列特征的引入,对抽取的准确率和衡量整体性能的F值有一定提升。
在进行机构层级关系抽取时,从上下文中提取距离方面的特征、层级方面的特征和实体类型方面的特征,采用SVM作为分类算法,判断机构实体之间是否具有层级关系。通过实验验证了方法的有效性并且发现距离方面的特征对分类具有主要的贡献,此外实体类型特征的引入提升了算法的召回率。