论文部分内容阅读
通过搜索引擎来查找所需要的信息,是当前人们在网上获取信息的重要手段之一。在信息检索领域,评价一个检索系统性能的优劣,不仅要看检索模型是否有效,更要考察检索系统对于不同的查询是否具有良好的鲁棒性,即检索系统是否能对所有的查询都能返回用户想要的结果。查询性能预测是在没有相关信息的情况下,估算检索系统对于不同查询的性表现和鲁棒性。而对于查询性能预测模型的评价,主要是通过计算预测值和实际平均正确率(简称AP)之间的相关性来衡量模型的性能。 当前评价预测模型的标准做法是:首先,预测模型会预测检索系统对一组查询词中每个查询的检索性能,得出一个预测值;然后,检索系统会通过实际的检索来得到这组查询词真实的平均正确率;最后,通过评价模型来计算预测值与真实值之间的相关性系数来评价一个查询预测模型的好坏。 通常使用传统的数学方法来计算预测值和真实值之间的相关性系数,比如皮尔逊相关性系数,斯皮尔曼相关性系数,肯德尔相关性系数等。皮尔逊相关性系数主要是衡量两组变量间的线性相关性。斯皮尔曼相关性系数和肯德尔相关性系数是一种等级相关性系数,主要是把变量间的关系转换为等级关系之后再计算等级间的线性关系。 但是,以前的研究忽略了这些评价方法潜在的问题,传统方法中的某些局限性会影响到评价查询预测模型的准确性:(1)皮尔逊相关性系数只能衡量变量间的线性相关性,对于非线性相关性无法衡量,但是预测值和真实平均正确率之间并不一定只是线性关系;(2)皮尔逊相关性容易受到噪声数据的影响,特别是当这些噪声数据处于线性函数的两端时,会对相关性系数造成很大的影响;(3)在一些组合预测模型中,皮尔逊方法还会产生一种过拟合现象,由于过高的自由度而造成其相关性系数虚高;(4)斯皮尔曼相关性和肯德尔相关性将实际值转换为等级值,然后再计算相关性系数。但是这会导致丢失原始数据中数值间的关系,造成不同的数据分布被转换为相同的等级相关性。而在信息检索领域,返回结果的得分分布往往还有着特殊的含义,比如排名靠前的返回结果通常比排名靠后的结果包含更多的信息;(5)斯皮尔曼和肯德尔相关性不能衡量一些特殊的函数关系,比如正弦函数和椭圆函数等。 本文引入了一种新的查询性能预测模型的评价方法,叫做最大信息系数,简称MIC。该方法以基于互信息量的方法来计算变量间的相关性,具有以下优点:(1)不受变量分布的影响,可以处理不同的变量分布;(2)有效降低了噪声数据的对模型评价的影响;(3)由于该方法脱离的传统的线性相关性的约束,因此不会产生类似皮尔逊方法的过拟合现象;(4)不受限于特殊的函数形式,对线性函数关系和非线性函数关系都能做出有效的评价;(5)该方法能有效反应出模型参数的变化;(6)该方法算法简洁,计算量小。本文在TREC海量大数据集上(大约两千多万篇文档),实现了三种主流的查询性能预测模型模型,AvICTF、NQC、WIG,并通过大量实验将MIC方法的结果和传统评价方法进行对比,验证了新评价方法的有效性。实验结果表明,MIC在评价预测模型性能上,对模型参数的变化更为敏感,相比于传统评价方法更能反映出预测模型在不同数据集不同参数下性能的优劣。 本文的主要贡献有以下三个方面:(1)本文引入了一种新的评价方法来评价查询性能预测模型,该新方法为评价预测模型提供了新的视角,并有效的克服传统方法的局限性,而且在反映预测模型参数敏感性方面尤其出色;(2)我们在两千多万篇文档的数据集上,对当前主流的查询性能预测模型进行了全面的实验,并给出详尽的实验数据以及综合性的比较和分析,为后续的预测模型和评价方法的研究提供了有效的实验依据;(3)本文通过大量实验详细探究了主流预测模型在各类数据集,不同模型参数对于模型性能的影响,指出新旧评价方法对于参数敏感性的差异,为后续实际检索系统上的应用和调参提供了有效的参考。