基于文档扩展的中文信息检索系统

来源 :第九届全国计算语言学学术会议 | 被引量 : 0次 | 上传用户：wyfwin

【摘要】

：

本文介绍了我们参加国际信息检索比赛NTCIR中所使用的方法。我们首先利用传统的伪相关扩展方法检索文档,得到单个文档与查询之间的相似度:然后将前n篇文档聚类,再次计算类别

【作者】

：

李立何婷婷瞿国忠张勇

【机构】

：

华中师范大学计算机科学系武汉 430079 国家语言资源监测与研究中心网络媒体分中心武汉 430079

【出处】

：

第九届全国计算语言学学术会议

【发表日期】

：

2007年期

【关键词】

：

文档聚类扩展方法中文相似度查询信息检索线性组合检索效果结果集计算类实验程度比赛

下载到本地 , 更方便阅读

下载此文赞助VIP

声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架

论文部分内容阅读

本文介绍了我们参加国际信息检索比赛NTCIR中所使用的方法。我们首先利用传统的伪相关扩展方法检索文档,得到单个文档与查询之间的相似度:然后将前n篇文档聚类,再次计算类别与查询之间的相似度,并将它赋给该类别中的每一个文档;最后,将这两个相似度线性组合起来,得到了每个文档与查询之间最终的相似度,并以此重排结果集。实验表明,相对于一般的查询扩展方法,这种文档扩展的方法在检索效果上取得了一定程度的提高。

其他文献

基于二部图最大匹配的汉日词对齐

该文提出了基于二部图的词对齐模型:利用二部图为双语句对建模,利用词形、语义、词性和共现等信息计算单词间的相似度,利用加权二部图最大匹配获得最终对齐结果。实验表明,该

反义4CL基因调节烟草木质素生物合成

采用根癌农杆菌介导法的叶盘转化法,将紫穗槐反义4CL基因片段导入烟草中,获得T0代阳性转化植株.T0代转基因植株自花授粉,收获种子,种植后获得T1代植株.PCR、RT-PCR (T1代)检

期刊

LigninTobacco (Nicotiana tabacum L.)4-coumarate coenzyme A ligase (4CL)Antise

一种面向机器翻译的双语组块识别方法

指出双语组块最重要的特点是语义自足性、结构合法性和翻译转换的充分性,即识别出来的"双语组块"包含有确定的语义信息和双语对译信息,并且符合-定的语法规范。为此,相应地提

会议

人类史上的十大环境灾难

从1986年以后每年人们郡像往常一样来到切尔诺贝利核事故纪念碑前哀悼死难者.人类对自然和科学的掌握.创造了更好的生活,也带来了不少灾难.环境的污染和资源的流失,威胁到了

期刊

人类历史切尔诺贝利核事故环境保护意识环境灾难十大事件纪念碑自然资源污染威胁梳理时代生物生活生存美国流失科学创造

基于树到串对齐模板翻译模型的n-best解码算法

基于树到串对齐模板的统计机器翻译模型是一种新颖的翻译模型,本文提出了基于树到串对齐模板翻译模型的n-best解码算法。实验结果表明,本文提出的解码算法不但提高了开发集上

会议

对齐模板翻译模型解码算法最小错误率训练程序模型参数翻译质量翻译系统统计实验开发机器

基于句型模板和统计机器翻译技术的翻译方法

当前统计机器翻译系统还存在很多弊端,对于一些常见的语言学现象的处理并不理想,离真正的实用化还有一定的差距。本文结合统计和规则翻译方法的优点,提出了一种将句型模板融

会议

基于“松弛尺度”的短语翻译对抽取方法

短语对抽取是基于短语统计机器翻译方法的关键技术。当前广泛使用的Och提出的短语对抽取方法,过于依赖词对齐结果,因而只能抽取与词对齐完全相容的短语对。本文给出一种基于

会议

尺度短语翻译对短语抽取机器翻译方法词对齐标注信息关键技术源短语性能比统计实验目标词性词典

基于N-gram的句子相似度计算技术

在基于大规模双语语料库的机器翻译研究中,如何找到最有效的翻译参考一直以来都是人们的关注焦点,其核心技术就是参考例句的相似度计算。本文提出了一种基于HowNet词语相似度

会议

句子相似度相似度计算方法机器翻译语义相似度计算双语语料库词语相似度评价公式关注焦点翻译研究交互式应用评测例句技术基础辅助

FirteX-高性能全文索引和检索平台

FinteX是一个功能强大、高性能、灵活的全文索引和检索平台。FinteX的主要目标是作为一个开放式的实验平台研究信息检索的各种数据结构、算法和模型,并可快速搭建实验系统。

会议

基于后缀数组方法的网络译文挖掘

利用互联网上丰富的信息资源来挖掘出专业术语的翻译选项可以应用在计算机辅助学习、机器翻译和跨语言检索等多个领域。如何挖掘出Web上所有可能的标注对形式并获取候选译文

会议

基于文档扩展的中文信息检索系统

其他学术论文