基于用户点击信息检索评价方法综述

来源 :第十一届全国计算语言学学术会议 | 被引量 : 0次 | 上传用户:fh1130
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
评价是信息检索研究长期关注的焦点,推动信息检索技术的进步.在简要分析Cranfield评价的优点和不足、基于检索日志进行检索评价的巨大潜力后,本文论述从搜索日志中获得可靠文档相关性估计存在的困难,分析了近年国内外研究人员提出的若干典型点击模型,并对其就可扩展性、增量可计算性、点击预测精度、模型的复杂性等方面进行讨论.简单的点击模型无法描述真实点击的多样性,点击预测精度也刻氏;复杂的模型带来的是计算上巨大的时间和空间开销。点击模型应在精确性与复杂性之间进行取舍。将点击贝叶斯斯网络简化为两个部分可观察的马尔可夫时序模型,做了模型复杂度与预测精度之间的折衷:有人考虑查询所类别不同,用户检索决策出发点不同,除了保证文档相关胜推理的可靠性外,一个理想的点由模型应能处理大规模、TB级点击数据,同时能根据数据更新动态更新模型。点击链模型、依赖点击模型、动态贝叶斯点击网络兼具三个特性。上述所有研究工作或是基于可控实验环境中,与真实网络用户行为有一定差距。比如检索日志可能包含大量非真实用户-网络爬虫行为,用户在检索过程受到广告干扰等等。上述所有研究工作或是基于大规模群体用户的点击行为分析,尤其是对同一查询,需要大量的用户点击信息,难以处理用户访问频度低的长尾查询词。
其他文献
为了更好地解决统计机器翻译中的调序问题,本文提出了基于句法信息、词性标注信息和规则相结合的源语言重排序模型作为统计机器翻译的预处理模块.该模型分为两种,一种是基于依存信息、词性标注信息和规则相结合的模型,另一种是基于短语结构信息、词性标注信息和规则相结合的模型.以汉蒙统计机器翻译做实验,结果显示经过该模型进行预处理后的统计机器翻译的BLEU评分比经典的短语翻译有较为明显地提高.实验结果表明这两种源
汉语词法分析是中文信息处理的基础,现阶段汉语词法分析的主流技术是基于统计的方法,这类方法的本质都是把词法分析过程看作序列数据标注问题.上下文是统计语言学中获取语言知识和解决自然语言处理中多种实际应用问题必须依靠的资源和基础.汉语词法分析时需要从上下文获取相关的语言知识,但上文和下文是否同样重要。为克服仅凭主观经验给出猜测结果的不足,对汉语词法分析的分词、词性标注、命名实体识别这三项子任务进行了深入
在当前基于信息库的语言教学的启发下,建立了《对外汉语新词教学信息库》.在《信息库》的基础上,对新词的语音、语法、语义、语用等语言信息和社会文化、心理认知等非语言信息进行了量化统计和数据分析,语言是个复杂的系统,从整体上说,语言系统的内部因素和语言系统的外部因素是一个相互依存的互动的过程,语言的社会属性和自身的系统性要求在看待语言发展时要树立全面的、动态的观点,试图将这些要素分开来说明新词在词汇系统
当前词类研究不仅要面向语言教学,更要面向机器的语言自动处理,由于机器对于语言知识内在逻辑性的严格要求以及实际应用任务的严格检验,都使得汉语现有词类体系和词类知识暴露出诸多问题,这些问题已经引起研究者的普遍关注。本文使用词性自动标注模型对影响英汉语词性标注的相关因素进行定量研究,进而探究词汇因素与语法因素各自对英汉语词性标注的影响,目的是为深入分析英汉语在词类问题上的差别,更好地构建汉语语料库提供参
共指消解是指将多个命名实体指向现实世界中的同一实体,其目标是识别出文档中所有存在的共指关系。共指消解在自然语言处理任务中有着广泛的应用。选择合适的特征是共指消解任务中一个重要的组成部分.特征不是越多越好,反映本质的特征很重要;对于不同种类的语料,一个公共的特征集往往难以适应,为了提高特征对语料的针对性,对不同的语料应选择不同的特征.本文基于上述观点,采用粗糙集理论中的属性约简方法来解决共指消解的特
文本蕴含可以定义为:个连贯的文本(Text)T和一个被看作假设(Hypothesis)H之间的一种语义包含关系。如果H的意义可以从文本T的意义中推断出来,那么就说T蕴含H(即H是T的推断)。文本蕴含的研究对于自然语言处理中不同应用所需的语言表达多样性的推理识别有着重要意义。比如在多文本自动文摘中,从文本中省去的冗余句子或表达应该被摘要中的其他表达所蕴含;对于信息抽取,表达相同关系的不同文本之间也存
本文基于隐喻认知观和词语属性分析理论,利用网络数据挖掘技术,构建了基于《知网》语义体系的汉英双语词汇隐喻属性知识库,进行跨语言系统对比分析词汇隐喻属性.通过研究跨语言词汇隐喻属性的异同,用量化统计和系统分析初步地回答了隐喻的否跨语言特点,本文同时进而提出了利用双语知识库,以一种语言的词语隐喻来增益研究对译词语隐喻属性的方法,为基于隐喻属性的语义分析计算打下了一定的研究基础.
隐喻的计算语言学研究主要存在两个问题:隐喻理论多样且差异较大;隐喻知识库和语料库的可计算性不足.为解决隐喻理论与计算的衔接,寻找面向计算的隐喻分析框架,本文提出了利用易收集、本体喻体喻底易区分的明喻句作为媒介,通过分析其概念域的整合方式为其他隐喻方式的研究提供理论和计算依据的方法.语域受限的封闭语料穷尽分析试验表明,属性明喻句可通过凸显特征来计算;动作隐喻方式复杂,其可计算性比较低,并非现有知识库
基于依存语法的统计机器翻译中,由于依存文法的扁平化,随着节点数目的增多,解码过程中很难匹配到完整的规则,会有大量未覆盖节点需要进行粘贴操作,传统的粘贴操作采用邻近保序策略,但会在一定程度上造成译文顺序的混乱.本文构建了一个基于最大熵的粘贴模型,利用丰富的上下文信息指导译文粘贴.在NIST2005汉英测试集上的实验结果表明,使用粘贴模型能够有效的减少粘贴操作带来的错误影响,相对于基准系统提高了1.1
句子级对齐双语语料是自然语言处理的重要资源之一,对于机器翻译、跨语言检索、双语词典编纂等研究有很大应用价值.关于自动句子对齐的研究主要针对于英语、法语、汉语等语言,据了解,尚未见到针对越南语-汉语的相关研究.本文考查了使用不同参数时,基于长度的句子对齐算法、Champollion算法在越南语-汉语双语文本上的效果,并根据汉字与越南语音节间的独特对应关系对Champollion算法进行了改进,获得了