中文新词提取与过滤研究综述

来源 :中国科技博览 | 被引量 : 0次 | 上传用户:wangleisxh1234
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
  摘要:新词识别是中文信息处理领域的关键技术,而候选新词提取与垃圾串过滤是新词识别的必经阶段。中文文本不以特定的符号标志词的边界,因此任何相邻字符都有成词的可能性,这给新词提取与过滤带来了很大困难,先验知识与统计数据的缺乏使得新词提取成为中文词性标注的技术瓶颈。文章深入研究了中文新词识别技术中新词提取与过滤技术的研究现状,分析了新词提取与过滤技术中存在的问题,并对新词提取与过滤技术的研究方向进行了展望。
  关键词:计算机应用技术; 新词识别;新词提取;垃圾串过滤;训练语料;监督方法
  中国分类号:TP391 文献标识码:A 文章编号:1009-914X(2013)30-0209-02
  0 引言
  新词新语是反映真实社会生活的重要信息,随着社会的发展进步以及网络社交的迅速蔓延,大量反映新事物、新观念、新想法的新词语涌现出来。很多反映当前社会状况或者未来发展趋势的新词汇相继诞生,因特网的普及以及Web2.0的兴起,加速了新词的产生和传播。这不仅是一种引人注目的社会现象,更给中文信息处理带来了极大挑战。国家语委语言应用研究所曾做过统计,当代汉语每年出现1000个左右的新词,平均每天出现三个。这些新词中,有些迅速出现又迅速消亡,有些则迅速推广开来,成为现代生活中的一部分,被广泛应用于日常生活与各种媒体之中,直接体现现代社会生活的发展与变化。像“微博”、“给力”、“粉丝”等新词从诞生到流行只用了很短的时间。在这样一个信息高效快节奏的发展进程中,如何准确快速的识别出新词新语,成为信息处理中的一个关键课题[1]。
  下文主要从以下几个方面来进行论述:①介绍候选新词提取与过滤的相关工作与研究进展。②分析现有的候选新词提取与过滤的相关技术及不同技术的优缺点。③总结新词提取与过滤的研究现状,展望下一步工作。
  2 候选新词提取与过滤研究进展
  在新词提取中,任何相邻的汉字在理论上都是新词的候选对象。候选新词提取是新词识别的必经阶段,候选新词中必然包含很多非词垃圾串[2,3]。对于候选新词的提取与垃圾串的过滤的研究,基本是采用基于监督的方法与基于非监督的方法两种方式[4,5]。
  Goh[6]等先用 HMM 模型来进行分词和预标注, 在此基础上, 对词标注3POS- posit ion4标记, 然后使用上述标注过的语料训练 SVM 模型, 最后用SVM对字符标 注3PO S- po sitio n4 标记, 从 而获得新 词。但基于H M M 粗分获得的语料进行模型训练, 可能会引入较大的误差。
  Peng[7]等使用基于字符位置的标记方法训练 CRF 模型, 进行中文分词。分词后, 计算字串可信度, 当可信度高于阈值时, 认为是新词。由于 CRF 标记的准确性高, 使得新词识别具有很好的效果。
  邹纲[8]等统计按时间排序后的网页中所有的重复字串,频率高于阈值的作为候选词串; 接着以某个时间点为界限, 把候选字串划分为前景集合与背景集合, 取集合差作为新词候选集合。最后使用过滤规则排除垃圾词串。该方法的优点是可获得某个时间点后出现的新词, 且集合差运算后, 能过滤掉部分垃圾词串。但由于新词出现的时间具有模糊性, 集合相减会将部分新词误删; 使用基于分词的串频统计, 性能会受到分词工具的影响。
  崔世起[9]等在邹纲的重复字串基础上, 先对词的构成模式进行分类, 然后采用针对性方法进行过滤。通过统计获得垃圾头( 尾) 的过滤词典来过滤单字垃圾串; 对类似 3+ 1, 2+ 1 形式的使用词缀词典过滤。该方法针对部分模式字串, 过滤效果较好, 但处理模式不完善, 会造成新词漏召。有研究者使用滑动窗口来简化串频统计。
  曹勇刚[10]等先对句子进行二元切分, 并统计切分后的整个文档在这一级别上字串的频率,将频率高于阈值的字串加入词频表中; 然后合并选取的二元词, 作为字进入下一轮迭代; 之后再次使用二元语法进行句子切分, 再统计这一层面上的串频, 扩充词频表, 直至二元迭代结束。最后基于停用词表设计过滤规则, 去除垃圾字串。试验表明该方法识别效果较好, 速度较快。但在迭代时, 后续迭代要受到前期迭代影响, 可能造成新词漏召。
  罗智勇[11]等使用 PAT-Array 算法提取的重复串作为候选新词; 用手工标注的小规模训练语料来训练 SVM 分类模型剔除垃圾串, 从而获得新词。由于使用高效的统计算法, 重复串的统计效率得到了很大提升[12]。但使用小规模标注语料来训练过滤模型, 会影响垃圾串过滤效果[13]。
  3 候选新词的提取与过滤技术
  现有的候选新词提取与过滤技术主要分为两类,一是有监督方法,即在大规模训练语料基础上,通过统计方法来确定新词边界,进而获得候选新词[14];另外一种是无监督方法,即统计待处理文本的字串频率,而不需要大规模语料库的支持,频率高于阈值的重复串作为候选新词。
  3.1 基于监督方法提取与过滤候选新词
  在大规模训练语料的支持下, 研究者将候选新词提取问题转化为分类或标注问题, 对各种统计模型进行了尝试和探索[15]。
  3.1.1 基于隐马尔科夫模型
  隐马尔科夫模型中观察到的事件时状态的随机函数,因此该模型是一双重随机过程,由马尔可夫链和一般随机过程两部分组成。其中马尔可夫链不能直接观察到,通过状态转移概率矩阵描述;一般随机过程描述状态与观察序列间的关系,由符号输出概率矩阵来定义。图1 给出了隐马尔可夫模型的组成示意图,
  图1 隐马尔可夫模型的组成
  隐马尔可夫模型(HMM)由一個五元组(Ωx,Ω0,Α,Β,π)表示,其中Ωx={X1,…,XN}表示隐藏状态集合;Ω0={O1,…,OM}表示观察值集合;Α=(aij)表示状态转移概率矩阵,aij表示从状态Si转移到Sj的概率;Β=(bi(k))表示观察值概率矩阵,bi(k)表示在状态Si时输出符号Vk的概率;π=(π1,…,πN)是初始状态。通常简略的将隐马尔科夫模型表示成三元组的形式λ={Α,Β,π}。   解码问题是隐马尔可夫模型主要解决的问题之一[16],解码问题是指对于给定的模型λ={Α,Β,π}和观察值序列Ω0={O1,…,OM},求所对应的状态序列的最好解释,该问题的主要算法有Viterbi算法。Viterbi算法是一种动态规划算法,Viterbi算法是一种动态规划算法,将全局最优解的计算过程分解成各阶段最优解的计算。该算法的目的是找到一条最优路径,每一阶段的每个状态都记录着从上一阶段到自身的最优路径。当经过所有阶段,获得最优值后,根据获得最优值的状态所录的路径进行回溯,即可得到最优路径上的状态。
  3.1.2 基于决策树模型
  决策树方法是一种通过建立决策树来发现数据集中情况,分类样例的数据挖掘方法,决策树分类方法具有精度高、生成模式简单、速度快、而且能够处理大数据库等多种优点。决策树所表示的分类知识可以用文字概括出来,并可以用if-then的分类规则形式加以表示。从决策树的根节点到每一个叶子节点所对应的一条路径就形成了一条分类规则。沿着决策树的一条路径上所有的属性以及对应的值的合取就构成了分类规则的条件部分(if部分),叶子节点所标记的类别就构成了规则的结论部分(then部分)[17]。
  3.1.3 基于条件随机场模型
  条件随机场模型(CRFs)是一种判别式模型,采用的是无向图分布,没有严格的独立性假设,可以任意选取特征,而且因为采用全局归一化的方法,避免产生标记偏移问题,所以在新词提取与过滤上取得较好效果[18],其中链式CRFs在词串提取中较为常用。在给定观察序列条件下,标记序列的条件概率为:
  其中,x表示需要标注的观察序列;y表示相应的标注序列表;在一阶链式结构的图G=(V,E)中,V代表图中的节点集,E表示图中的边,最大图包含相邻的2个节点,即图G的边。对1个最大图中的无向边e=(Vt-1,Vt),fk(e,y|e,x)为状态转移特征函数;gk(v,y|v,x)为状态特征函数;λk和μk是由训练样本得到的特征权重;k为特征函数编号;v为V中的节点。计算特征权重函数采用极大似然估计方法。CRFs指数模型为凸函数,可采用迭代方法找到全局最优解。图3给出了将CRFs应用到新词提取与过滤中的新词提取过程。
  图5 基于CRFs模型进行新词提取与过滤
  CRF模型能够很好的应用领域知识和标记之间的依赖,充分利用各种统计信息,提高标注准确性。但在模型训练方面,都需要大规模训练预料的支持,而且训练和解码的速度不够理想。
  3.2 基于非监督方法提取与过滤候选新词
  3.2.1 基于启发规则
  采用词类方法进行新词识别, 需要先构造新词模板, 然后使用模板匹配来获得候选新词。再用统计特征进行过滤, 得到新词。该方法识别新词速度快, 但适应性不强。通常只对简单命名实体或者特定领域的新词识别有效[19]。
  使用基于启发规则的方法来获得候选词串,实现起来比较简单,识别速度快,准确率较高,垃圾串过滤的压力想对较小;但新词召回率会受到规则完备性的影响,而且应用范围会受到限制。
  3.2.2 基于高效的重复串统计算法
  PAT-Array 算法提取的重复串作为候选新词; 用手工标注的小规模训练语料来训練 SVM 分类模型剔除垃圾串, 从而获得新词。由于使用高效的统计算法, 重复串的统计效率得到了很大提升。但使用小规模标注语料来训练过滤模型, 会影响垃圾串过滤效果。高效的重复串统计算法,虽然实现起来略显复杂,垃圾串的过滤任务同样繁重,但效率很高,是非监督方法中的主导方法。
  4 结束语
  随着新词新语大量快速的涌现与扩展,读新词新语的提取与过滤的研究成为目前关注的重点,研究者已经在这方面做了很多深入的研究工作,本文对近几年来国内外在该领域的主要成果进行了回顾与总结,综述了新词新语的研究现状与研究方法,同时指出了各种方法存在的问题和将来进一步的研究方向。对于新词的提取与过滤,综合使用统计特征和启发式过滤规则,将各种过滤特征进行系统综合,最大限度过滤垃圾串、提高过滤准确性,将是下一步的重点研究方向。
  参考文献:
  [1] 张海军, 史树敏, 朱朝勇, 等. 中文新词识别技术综述 [J].计算机科学, 2010, 37(3): 6-10.
  [2] Gao J, LiM , Wu A , et al. Chinese Word Segmentation andNamed Entity Recognition: A Pragmatic Approach [ J] . Computation al Linguistics, 2005, 31( 4) :531-572
  [3] Liu T, Liu B- Q , Wang X-L, et al . The Effectiveness Study of Local Maximum Feature f or Chinese Unknown Word Identification[ J] . Journal of Chinese Language and Computing, 2007,17( 1) :15-26
  [4] Ling G C, Asahara M , M atsum oto Y . Chinese Unknown Word Identification Using Character-based Tagging and Chunking[ C]//Proceedings of the 41st Annual Meeting of the Association for Computational Linguistics. Sapporo, Japan, 2003: 197- 200   [5] Qiu L, Hu C, Zhao K . A Method for Automatic POS Guessing of Chinese Unknown Words[ C]// Proceedings of t he 22nd International Conference on Computational Linguistics (Coling 2008) .Manchester, 2008: 705-712
  [6] Goh C-L, Asahara M , Matsum oto Y . Machine Learning-based Methods to Chinese Unknown Word Detection and POS Tag Guessing [ J ] . Journal of Chinese Language and Computing, 2006, 16( 4) : 185-206.
  [7] Peng F, Feng F, McCallum A . Chinese Segmentation and New Word Detection using Conditional Random Fields [ C]// Proceedings of The 20th International Conference on Computational Linguistics. University of Geneva, Switzerl and, 2004: 562- 568.
  [8] 邹纲, 刘洋, 刘群, 等.面向 Internet 的中文新词语检测[ J] . 中文信息学报, 2004, 18( 6) : 1- 9.
  [9] 崔世起, 刘群, 孟遥, 等. 基于大规模语料库的新词检测[ J ] . 计算机研究与发展, 2006, 43( 5) : 927-932.
  [10] 曹勇刚, 曹羽中, 金茂忠, 等. 面向信息检索的自适应中文分词系统[ J] . 软件学报, 2006, 17( 3) : 356- 363.
  [11] 罗智勇, 宋柔. 基于多特征的自适应新词识别[J] . 北京工业大学学报, 2007, 33( 7) :718-725.
  [12] Fu G- h, Luke K-k. Chinese unknown word identification as known word tagging[ C]// Proceedings of the Third International Conference on Machine Learning and Cybernetics. Shanghai,2004: 2612- 2617.
  [13] Fu G,Luke K-k. Chinese Unknown Word Identification Using Class based LM [C]// Proceedings of The First International Joint Conference on Natural Language Processing. Hainan Island, China,2004: 262-269.
  [14] Goh C-L, Masayu ki, Asahara, et al. Training Multi- Classifiers for Chinese Unknown Word Detect ion [ J ] . Journal of Chinese Language and Computing, 2005, 15( 1) : 1-12
  [15] 丁建立,慈祥,黃剑雄.一种基于免疫遗传算法的网络新词识别方法 [J]. 计算机科学, 2011,38(1):240-245.
  [16] 袁里驰. 基于改进的隐马尔科夫模型的词性标注方法[J].中南大学学报,2012,43(8):3053-3057.
  [17] Carus A, Mesut A. Fast text compression using multiple static dictionaries [J].Information Technology Journal, 2010, 9(5):1013-1021.
  [18] 张婵婵,鲁淑霞,王熙照.基于无监督决策树聚类方法的研究[D].河北:河北大学,2010. [19] Wang Z, Huang C, Zhu J. Which Performs Better on In-Vocabulary Word Segmentation-Based on Word or Character[ C]// Proceeding of t he Sixth Sighan Work shop on Chinese Language.Hyderabad, India, 2008: 61-68.
  基金项目:中国矿业大学(北京)中央高校科研业务费项目(2011YJ04)
其他文献
中图分类号:TN918.6  高校保密工作是我国保密工作的重要组成部分,它关系到学校发展、社会稳定和国家安全。高校保密工作同时也是高校管理的重要组成部分,是维护高校稳定、促进高校改革发展的重要工作。因此,高校如何做好保密工作就显得日趋重要,这也是当前高校保密工作者亟待深入研究和思考的一个重要课题。本研究结合新时期保密工作特点,探赜新时期高校保密工作的建设途径和对策。  一、新时期高校保密工作的主要
期刊
摘要:思想政治工作是党和国家的优良传统和政治优势,是做好各项工作的法宝。目的是引导职工树立正确的理想信念和价值观,最终达到提高企业经济效益的目的。因此,树立和强化企业文化建设,用价值观统一思想意识,把职工的思想和干劲凝聚到企业建设中,最大限度地调动其积极性、创造性,不断提高企业经济效益,促进生产发展是企业的当务之急。  关键词:思想政治工作 企业文化 企业文化建设  中图分类号:P285.2+8 
期刊
内容摘要:本文以预算管理为主线,讨论企业在策划内部控制制度和业绩评价标准时应关注的基本框架。通过预算管理中财务报表的预算过程,逐项说明设定内部控制制度所涉及的主要环节,以及业绩评价与哪些财务预算数据相关。并且通过事前、事中和事后控制全面完成企业的既定目标,从而实现企业的科学化管理。财务管理是企业管理的中心,预算管理是财务管理的核心内容。如何把握主线、围绕中心、策划企业管理中的重要内容是财务人员除了
期刊
[摘要]: 目前,由于老矿井的开采深度、范围正在逐年增加以及开采的机械化水平也在逐渐提高,老矿区要想继续开采,面临的首要问题是高效掘进以及解决不利的复杂水文地质条件。本文分析了某矿的复杂水文地质条件,根据其存在的实际情况,有针对性的提出了继续开采的新方案—骑行掘进,这一方案的实施,不仅增强了矿井掘进面的安全性,还提高了矿井煤巷的掘进速度。  [关键词]: 复杂水文地质;煤巷;综掘工作面; 掘进技术
期刊
摘要:本文结合当前医院政工队伍中存在的问题,分析了医院政工队伍建设的一些做法和措施。  关键词:政工 队伍 建设  中图分类号:D693.66  一、当前医院政工队伍中存在的问题  (一)知识结构与工作要求不适应。医院许多政工人员由临床科室转行或从其他部门调入,理论根底浅,文字能力薄弱,队伍职业化程度较低,对有关的政治、法律、科技特别是管理科学知之不多,知识面偏窄,工作中表现出理论思维能力差,缺乏
期刊
摘要:采用实验法等在田径专项课程中进行新型教学模型研究。结果显示“心体式”教学能够培养学生自学、创新、组织教学等综合能力,有利于实现培养目标。  关键词:体育教育专业;术科;专项课;“心体式”  中图分类号:D648.1  体育教育专业的专项课是所有术科课学时最多的一门课程。是在普修课教学基础上开设,可谓是发展学生综合能力的黄金教学阶段。探索新型的教学模型对实现 “培养目标”有重要意义。  1研究
期刊
摘要:文章首先简单介绍了当今社会档案存在的两种主要形式——纸质档案和电子档案,然后对两者多方面的特征进行了对比分析,通过分析阐明了当今社会两种档案同时存在是一种不可避免的现象。  關键词:纸质档案 电子档案 档案管理 共存  中图分类号:G275.3  档案是人们对生活及工作中展开的各项活动产生的有保存价值的真实的历史记录。随着人类潜能的不断开发,通信技术迅猛发展,以及计算机的广泛应用,档案也在由
期刊
摘要:文章阐述了市政项目工程中的管理要点。  关键词:市政 项目 管理  中图分类号:TU99  项目管理的广泛应用体现了项目管理的向专业化方向的发展,更突出的它的重要性,其表现在项目管理知识体系的不断发展和完善、学历教育和非学历教育竞相发展、各种项目管理软件开发及研究咨询机构的出现等等,随之出现的行业项目管理专业化也是趋势。应该说这些专业化的探索与发展,也正是项目管理学科逐渐走向成熟的标志。而今
期刊
【摘要】对于化工制药工艺而言,其具体的生产过程离不开良好的制药装置以及精湛的制药工艺。在其制药工艺中,制药设备处于关键性地位,对工艺好坏的发挥影响深刻。优化化工制药工艺,离不开对其涉及环节的全面研究把握。本文从化工制药工艺的现状入手,全面剖析化工制药工艺中存在的问题,并根据问题所在有针对性地提出合理的优化办法,以期为破解化工制药工艺过程中的难题,寻求真正的优化之路提供借鉴。  【关键词】化工制药
期刊
摘要:本文针对美、日、法三个发达国家的科技评估制度展开讨论,总结各自发展中的共同因素,并对具体制度中的不同构成提出意见。  关键词:科技评估;组织机构;评估方法;分析比较  中图分类号:E835.8  一、概述  “科技评估”作为科技部门进行监督管理,预防和治理腐败,优化科技资源配置,提高科技资金使用效益所采取的方法之一,主要是为科技系统的决策咨询服务。作为科技管理与市场机制相结合的产物,科技评估
期刊