论文部分内容阅读
随着机器翻译的发展,机器翻译评价也越来越受到重视.机器翻译评价是一项复杂的研究课题,最主要的困难在于评价指标的确定.如何评价一个机器翻译系统好与坏,如何在多个翻译系统中评价出哪个更好,这都需要一个全面的、客观的评价体系.人工评价往往带有主观性,同时又费时费力,所以能否找到一个可行的自动机器翻译评价方法是机器翻译评价研究的发展方向.该文对机器翻译系统采用了白箱测试方法,评测主要以自动的方式实现.文中涉及到了分词及词性标注的评测、句法分析评测和译文质量评测.在分词及词性标注评测部分共对3个系统进行了分词、未登录词识别、歧义字段识别及词性标注评测.评测参考国家863中文与接口技术评测活动中的分词评测标准,评测指标除采用标准的正确率、召回率及调和平均数外,还增加了一些新的评测指标.分词评测增加了可接受性指标,增加这个指标可使评测结果更合理,但这个指标难以实现自动评测.考虑到分词结果对词性标注的影响在词性标注评测中增加了一个相对正确率的评测指标.另外,在对多个不同的词性标注系统进行评测时,使用了一个最小的词性标注集,将每个系统的标注集都映射到这个最小的标注集上,这样才能评测出不同系统的词性标注结果.在句法分析评测部分从基本短语识别和句子级短语分析两个方面评测,评测指标采用了正确率、召回率和调和平均数三个评测指标,详细地对每类短语分析的结果进行评测.译文质量评测主要依据成熟的BLEU标准,对汉语译文质量进行自动评测.根据汉语的特点,在使用BLEU标准评测时分别以字和词为模型进行评测.实验结果证明,采用词模型的一元关系的评测比采用字模型的一元和二元关系的评测更接近人工评测结果.