基于网络资源的中文命名识别与翻译方法研究

来源 :中国科学院研究生院 中国科学院大学 | 被引量 : 0次 | 上传用户:zlmgwj006
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
命名实体识别与翻译是自然语言处理的一个基础性的工作,同时也是很多应用中的关键性技术,如信息检索、信息抽取以及机器翻译等。近年来,大量以人名、地名、机构名等命名实体居多的新词不断涌现,传统的基于规则或基于统计的方法已不能满足更新速度不断加快、规模数量不断扩大的命名实体识别与翻译任务。本文利用网络资源对命名实体识别与翻译方法进行了研究,目标在于提高命名实体识别与翻译的性能。   具体的说,本文的主要研究内容如下:   第一,研究了一种充分利用网络词典实现中文地址翻译方法。首先利用区划词典、关键字词典和模式表进行分词及词语类型标注,并根据词语类型划分地址单元;然后,以统计翻译模型为基础结合少量的翻译词典和人工模板对地址单元进行翻译;最后,将地址单元的翻译结果以逆序粘合在一起,形成最终译文。实验表明,利用本文的方法翻译中文地址能够取得较好的翻译效果。   第二,研究了基于维基百科的命名实体识别与消歧方法。首先,利用开源的JWPL工具建立了维基百科数据库;然后,抽取维基百科页面第一句话中的定义性名词作为额外的知识加入到命名实体识别中;最后,利用维基百科消歧页面和上下文信息实现命名实体消歧。实验表明,利用维基百科特征可以有效提高命名实体识别的正确率。   第三,研究了基于维基百科的命名实体翻译词典抽取及应用方法。我们充分利用维基百科结构化的层次分类系统,提出了一个基于种子的反复迭代法从维基百科页面抽取一部庞大的命名实体翻译词典并将该词典应用于统计机器翻译当中。实验表明,本文抽取的维基百科命名实体翻译词典能有效的提高机器翻译的质量。
其他文献
随着集成电路制造工艺步入超深亚微米(very deep submicron,VDSM)和纳米(nanometer)阶段,芯片的缺陷密度不断上升,快速的成品率学习(yicld learning)有助于迅速提高芯片的成
激光标刻技术是激光技术的一个重要应用,目前已被广泛地应用到各个领域,从产品标识,到激光防伪,甚至到一些高新产品的制造中都或多或少地留下了激光标刻的痕迹。虽然目前激光标刻
污水是一种广泛存在的水体,逼真地展现污水可以给用户带来更真实、奇幻的视觉体验。污水含有丰富的污染物质,使其表现出浑浊状态,还会因为污染物质种类和浓度的不同,呈现不同
HDAudio高清音频协议是新一代音频协议。该协议具有高可靠性和灵活性的特点,为现代的计算机系统提供必要的音频接口,被广泛应用于PC和高性能的嵌入式系统中。HDAudio高清音频
随着我国研究生教育的迅猛发展,普通高等学校的招生规模越来越大,这就使得研究生数量上和种类上都得到了扩大和充实,与之同时的研究生信息化建设也迅速发展,这就使得研究生管理信
高速增长的网络链路速率(OC768,40Gbps)给IP查找的吞吐量带来了巨大的挑战。另外,路由表规模急剧增加,而虚拟路由器导致路由表规模进一步扩大,这给IP查找的存储资源带来了严
随着互联网技术的高速发展,信息技术为传统通讯业务带来了更丰富、更高效的实现手段。IT(Internet Technology信息技术)与CT(Communication Technology通讯技术)在逐渐融合中
实时车辆监管系统是一种用于对在城市道路上行驶的车辆进行实时监控和管理的系统,是城市道路交通管理的重要工具。   随着监控范围的不断扩张,原有集中式的数据处理方式已
随着计算机系统规模越来越大,用户对计算机系统的可靠性和可用性要求越来越高;集群系统因其良好的性能、易构建性和可扩展性己成为大规模生产性计算平台的首选。但大规模集群
近年来,统计机器翻译取得了很大的成功。统计机器翻译模型依赖于大规模双语语料库的训练。现有的训练方法在新增语料时需要合并新语料和原始语料,并重新进行模型训练。这种训