论文部分内容阅读
研究人员的主要任务是学习本领域的知识与研究状况,并寻求有效的方法来解决研究中的难题。对于大部分研究人员,尤其对于一些缺乏研究经验的研究人员来说,这并非易事。现有的学术搜索系统,如谷歌学术搜索,为学术信息搜索带来一定的便利,但这些搜索系统通常只返回某研究领域内相关学术文献的列表。研究人员需要通过阅读大量的文献来了解领域内的研究状况、主要思想和技术,这个过程非常枯燥而且耗时。为了助于解决上述问题,本文对面向学术文献的知识提取与推荐方法分别进行研究。目前的研究与实验主要基于计算机科学相关领域的英文文献。 学术知识提取指从某个学术领域内的一定数量的文献中自动抽取有效的学术知识,并形象地展示出该领域的知识结构图。所抽取的学术知识主要包括学术概念和概念间的关系,其中学术概念包括所研究的学术任务概念与用于解决相应任务的学术方法概念。学术知识提取主要包括两部分:学术概念及关系的抽取与知识结构图的可视化。本文采用有监督的方法,对一定量的文献进行学术概念及概念间关系的标注,并根据概念及其关系在文献中出现的情况,及目标概念本身的特点,总结出一系列规则,应用马尔科夫逻辑网对学术概念及概念间的关系进行联合抽取。实验结果表明,基于马尔科夫逻辑网的联合抽取模型优于其他基于条件随机场、支持向量机等模型进行分步抽取的方法。在学术知识抽取的基础上,应用图排序算法,对一个研究领域内的学术概念进行重要性评价,并以学术概念词云图的形式展示,用显示尺寸的大小体现概念的重要程度,最后用概念关系图展现一个研究领域内的知识结构与研究状况。 学术知识推荐的目的在于为研究任务推荐新的学术方法。在由学术知识提取部分得到的知识结构图的基础上,构建基于学术概念间关系规约化的矩阵分解模型,通过模型求解分析学术概念间的关系,挖掘影响概念间关系的主要潜在因子,提炼低维的任务概念矩阵和方法概念矩阵。根据两类概念矩阵的内积,为学术任务推荐学术方法。为更有效地利用同类概念间关系,在矩阵分解模型中加入概念间关系的规约化,并讨论了三种不同的方法米计算同类概念间关系的强度,包括基于平均值计算法、基于SimRank计算法、和基于MRSSA计算法。实验中,将基于最近邻的协同过滤模型与传统的矩阵分解模型作为基准方法。通过实验的对比分析,验证本文提出的基于概念间关系规约化的矩阵分解模型的有效性。