论文部分内容阅读
句法分析是自然语言处理中的关键一环,它连接更基础的词法分析和更高级的语义分析。句法分析精度的提高,将对机器翻译、信息检索和自动问答系统等上层应用产生积极影响。依存语法以其形式简洁、标注容易、应用方便等优点,受到研究人员的重视,在句法分析研究中广泛使用。依存句法分析的目标是,对于给定句子为其建立合乎依存语法的依存结构句法树。提高依存句法分析的精度.克服标注语料不足的限制,增强依存句法分析的领域适应能力等是当前依存句法分析的研究重点。汉语依存句法分析由于起步晚、语言分析难度大,研究任务更显迫切。针对以上问题,本文在提高汉语依存句法分析性能上做出了以下工作:1.实现了多个汉语依存句法分析系统。本文在现有依存句法分析技术的基础上,融入自己的创新,实现了基于Shift-Reduce算法的多次转移依存句法分析方法、利用自动抽取的依存子树特征的半监督依存句法分析方法、利用HowNet语义类别特征的半监督依存句法分析方法。通过多组评测实验,分析了汉语依存句法分析的特点和难点,对比了生语料规模对半监督方法的影响,探索了HowNet等语义知识库对汉语依存句法分析的意义。2.提出并实现了基于字符的中文分词、词性标注和依存句法分析联合模型。本文首先利用词语内部句法结构,将传统的基于词语的依存句法树转化成了基于字符的依存句法树。在此基础上,基于转移策略模型,设计处理框架和特征模板,实现了中文分词、词性标注和依存句法分析联合模型。该联合模型使三大任务的最小处理单位统一到了字,使处理框架的设计和实现更加简洁、流畅与合理。实验结果显示,本文的联合模型在各个任务上的处理结果都要优于单任务模型的处理结果,在词性标注和句法分析上的结果提升更加显著(0.86%和1.79%)。3.提出并实现了半监督的中文分词、词性标注和依存句法分析联合模型。本文选取只有分词标注的语料作为联合模型的生语料,从序列层面和结构层面抽取了具有代表性的n-gram特征和依存子树特征,实现了半监督的中文分词、词性标注和依存句法分析联合模型。实验结果显示,本文的半监督联合模型在中文分词、词性标注和依存句法分析任务上的F1值分别达到了98.31%、94.84%和81.71%,比单纯的联合模型结果分别提升了0.79%,0.91%和2.16%,比单任务模型的分步处理结果更是分别提升了0.92%、1.77%和3.95%。其中,分词和词性标注任务在目前公开的结果中取得了最好成绩。