论文部分内容阅读
本文详细介绍了一个搜索引擎检索系统的设计与实现,针对搜索引擎检索系统的性能问题进行了研究,讨论了影响检索性能的几个因素,并分别提出改进的方法和途径。这些方法包括设计出结构更加良好的倒排文件结构,改进整数压缩编码,引入倒排文件cache,预先计算关键词与文档相关度,减少关键词相对位置计算开销,改进站点聚类算法等。
另外,阐述了系统中使用的新的相关度计算方法,这个算法使得在最终的结果排序上比原有系统有了一些改进。论文的组织形式以实际系统中各模块为主线,这些模块包括倒排文件结构,底层数据接口,查询,计分和站点聚类等。最后,给出了系统的综合测试结果,指出系统中还存在的不足,并对后续工作提出了一些建议。