论文部分内容阅读
摘要:新词识别是中文信息处理领域的关键技术,而候选新词提取与垃圾串过滤是新词识别的必经阶段。中文文本不以特定的符号标志词的边界,因此任何相邻字符都有成词的可能性,这给新词提取与过滤带来了很大困难,先验知识与统计数据的缺乏使得新词提取成为中文词性标注的技术瓶颈。文章深入研究了中文新词识别技术中新词提取与过滤技术的研究现状,分析了新词提取与过滤技术中存在的问题,并对新词提取与过滤技术的研究方向进行了展望。
关键词:计算机应用技术; 新词识别;新词提取;垃圾串过滤;训练语料;监督方法
中国分类号:TP391 文献标识码:A 文章编号:1009-914X(2013)30-0209-02
0 引言
新词新语是反映真实社会生活的重要信息,随着社会的发展进步以及网络社交的迅速蔓延,大量反映新事物、新观念、新想法的新词语涌现出来。很多反映当前社会状况或者未来发展趋势的新词汇相继诞生,因特网的普及以及Web2.0的兴起,加速了新词的产生和传播。这不仅是一种引人注目的社会现象,更给中文信息处理带来了极大挑战。国家语委语言应用研究所曾做过统计,当代汉语每年出现1000个左右的新词,平均每天出现三个。这些新词中,有些迅速出现又迅速消亡,有些则迅速推广开来,成为现代生活中的一部分,被广泛应用于日常生活与各种媒体之中,直接体现现代社会生活的发展与变化。像“微博”、“给力”、“粉丝”等新词从诞生到流行只用了很短的时间。在这样一个信息高效快节奏的发展进程中,如何准确快速的识别出新词新语,成为信息处理中的一个关键课题[1]。
下文主要从以下几个方面来进行论述:①介绍候选新词提取与过滤的相关工作与研究进展。②分析现有的候选新词提取与过滤的相关技术及不同技术的优缺点。③总结新词提取与过滤的研究现状,展望下一步工作。
2 候选新词提取与过滤研究进展
在新词提取中,任何相邻的汉字在理论上都是新词的候选对象。候选新词提取是新词识别的必经阶段,候选新词中必然包含很多非词垃圾串[2,3]。对于候选新词的提取与垃圾串的过滤的研究,基本是采用基于监督的方法与基于非监督的方法两种方式[4,5]。
Goh[6]等先用 HMM 模型来进行分词和预标注, 在此基础上, 对词标注3POS- posit ion4标记, 然后使用上述标注过的语料训练 SVM 模型, 最后用SVM对字符标 注3PO S- po sitio n4 标记, 从 而获得新 词。但基于H M M 粗分获得的语料进行模型训练, 可能会引入较大的误差。
Peng[7]等使用基于字符位置的标记方法训练 CRF 模型, 进行中文分词。分词后, 计算字串可信度, 当可信度高于阈值时, 认为是新词。由于 CRF 标记的准确性高, 使得新词识别具有很好的效果。
邹纲[8]等统计按时间排序后的网页中所有的重复字串,频率高于阈值的作为候选词串; 接着以某个时间点为界限, 把候选字串划分为前景集合与背景集合, 取集合差作为新词候选集合。最后使用过滤规则排除垃圾词串。该方法的优点是可获得某个时间点后出现的新词, 且集合差运算后, 能过滤掉部分垃圾词串。但由于新词出现的时间具有模糊性, 集合相减会将部分新词误删; 使用基于分词的串频统计, 性能会受到分词工具的影响。
崔世起[9]等在邹纲的重复字串基础上, 先对词的构成模式进行分类, 然后采用针对性方法进行过滤。通过统计获得垃圾头( 尾) 的过滤词典来过滤单字垃圾串; 对类似 3+ 1, 2+ 1 形式的使用词缀词典过滤。该方法针对部分模式字串, 过滤效果较好, 但处理模式不完善, 会造成新词漏召。有研究者使用滑动窗口来简化串频统计。
曹勇刚[10]等先对句子进行二元切分, 并统计切分后的整个文档在这一级别上字串的频率,将频率高于阈值的字串加入词频表中; 然后合并选取的二元词, 作为字进入下一轮迭代; 之后再次使用二元语法进行句子切分, 再统计这一层面上的串频, 扩充词频表, 直至二元迭代结束。最后基于停用词表设计过滤规则, 去除垃圾字串。试验表明该方法识别效果较好, 速度较快。但在迭代时, 后续迭代要受到前期迭代影响, 可能造成新词漏召。
罗智勇[11]等使用 PAT-Array 算法提取的重复串作为候选新词; 用手工标注的小规模训练语料来训练 SVM 分类模型剔除垃圾串, 从而获得新词。由于使用高效的统计算法, 重复串的统计效率得到了很大提升[12]。但使用小规模标注语料来训练过滤模型, 会影响垃圾串过滤效果[13]。
3 候选新词的提取与过滤技术
现有的候选新词提取与过滤技术主要分为两类,一是有监督方法,即在大规模训练语料基础上,通过统计方法来确定新词边界,进而获得候选新词[14];另外一种是无监督方法,即统计待处理文本的字串频率,而不需要大规模语料库的支持,频率高于阈值的重复串作为候选新词。
3.1 基于监督方法提取与过滤候选新词
在大规模训练语料的支持下, 研究者将候选新词提取问题转化为分类或标注问题, 对各种统计模型进行了尝试和探索[15]。
3.1.1 基于隐马尔科夫模型
隐马尔科夫模型中观察到的事件时状态的随机函数,因此该模型是一双重随机过程,由马尔可夫链和一般随机过程两部分组成。其中马尔可夫链不能直接观察到,通过状态转移概率矩阵描述;一般随机过程描述状态与观察序列间的关系,由符号输出概率矩阵来定义。图1 给出了隐马尔可夫模型的组成示意图,
图1 隐马尔可夫模型的组成
隐马尔可夫模型(HMM)由一個五元组(Ωx,Ω0,Α,Β,π)表示,其中Ωx={X1,…,XN}表示隐藏状态集合;Ω0={O1,…,OM}表示观察值集合;Α=(aij)表示状态转移概率矩阵,aij表示从状态Si转移到Sj的概率;Β=(bi(k))表示观察值概率矩阵,bi(k)表示在状态Si时输出符号Vk的概率;π=(π1,…,πN)是初始状态。通常简略的将隐马尔科夫模型表示成三元组的形式λ={Α,Β,π}。 解码问题是隐马尔可夫模型主要解决的问题之一[16],解码问题是指对于给定的模型λ={Α,Β,π}和观察值序列Ω0={O1,…,OM},求所对应的状态序列的最好解释,该问题的主要算法有Viterbi算法。Viterbi算法是一种动态规划算法,Viterbi算法是一种动态规划算法,将全局最优解的计算过程分解成各阶段最优解的计算。该算法的目的是找到一条最优路径,每一阶段的每个状态都记录着从上一阶段到自身的最优路径。当经过所有阶段,获得最优值后,根据获得最优值的状态所录的路径进行回溯,即可得到最优路径上的状态。
3.1.2 基于决策树模型
决策树方法是一种通过建立决策树来发现数据集中情况,分类样例的数据挖掘方法,决策树分类方法具有精度高、生成模式简单、速度快、而且能够处理大数据库等多种优点。决策树所表示的分类知识可以用文字概括出来,并可以用if-then的分类规则形式加以表示。从决策树的根节点到每一个叶子节点所对应的一条路径就形成了一条分类规则。沿着决策树的一条路径上所有的属性以及对应的值的合取就构成了分类规则的条件部分(if部分),叶子节点所标记的类别就构成了规则的结论部分(then部分)[17]。
3.1.3 基于条件随机场模型
条件随机场模型(CRFs)是一种判别式模型,采用的是无向图分布,没有严格的独立性假设,可以任意选取特征,而且因为采用全局归一化的方法,避免产生标记偏移问题,所以在新词提取与过滤上取得较好效果[18],其中链式CRFs在词串提取中较为常用。在给定观察序列条件下,标记序列的条件概率为:
其中,x表示需要标注的观察序列;y表示相应的标注序列表;在一阶链式结构的图G=(V,E)中,V代表图中的节点集,E表示图中的边,最大图包含相邻的2个节点,即图G的边。对1个最大图中的无向边e=(Vt-1,Vt),fk(e,y|e,x)为状态转移特征函数;gk(v,y|v,x)为状态特征函数;λk和μk是由训练样本得到的特征权重;k为特征函数编号;v为V中的节点。计算特征权重函数采用极大似然估计方法。CRFs指数模型为凸函数,可采用迭代方法找到全局最优解。图3给出了将CRFs应用到新词提取与过滤中的新词提取过程。
图5 基于CRFs模型进行新词提取与过滤
CRF模型能够很好的应用领域知识和标记之间的依赖,充分利用各种统计信息,提高标注准确性。但在模型训练方面,都需要大规模训练预料的支持,而且训练和解码的速度不够理想。
3.2 基于非监督方法提取与过滤候选新词
3.2.1 基于启发规则
采用词类方法进行新词识别, 需要先构造新词模板, 然后使用模板匹配来获得候选新词。再用统计特征进行过滤, 得到新词。该方法识别新词速度快, 但适应性不强。通常只对简单命名实体或者特定领域的新词识别有效[19]。
使用基于启发规则的方法来获得候选词串,实现起来比较简单,识别速度快,准确率较高,垃圾串过滤的压力想对较小;但新词召回率会受到规则完备性的影响,而且应用范围会受到限制。
3.2.2 基于高效的重复串统计算法
PAT-Array 算法提取的重复串作为候选新词; 用手工标注的小规模训练语料来训練 SVM 分类模型剔除垃圾串, 从而获得新词。由于使用高效的统计算法, 重复串的统计效率得到了很大提升。但使用小规模标注语料来训练过滤模型, 会影响垃圾串过滤效果。高效的重复串统计算法,虽然实现起来略显复杂,垃圾串的过滤任务同样繁重,但效率很高,是非监督方法中的主导方法。
4 结束语
随着新词新语大量快速的涌现与扩展,读新词新语的提取与过滤的研究成为目前关注的重点,研究者已经在这方面做了很多深入的研究工作,本文对近几年来国内外在该领域的主要成果进行了回顾与总结,综述了新词新语的研究现状与研究方法,同时指出了各种方法存在的问题和将来进一步的研究方向。对于新词的提取与过滤,综合使用统计特征和启发式过滤规则,将各种过滤特征进行系统综合,最大限度过滤垃圾串、提高过滤准确性,将是下一步的重点研究方向。
参考文献:
[1] 张海军, 史树敏, 朱朝勇, 等. 中文新词识别技术综述 [J].计算机科学, 2010, 37(3): 6-10.
[2] Gao J, LiM , Wu A , et al. Chinese Word Segmentation andNamed Entity Recognition: A Pragmatic Approach [ J] . Computation al Linguistics, 2005, 31( 4) :531-572
[3] Liu T, Liu B- Q , Wang X-L, et al . The Effectiveness Study of Local Maximum Feature f or Chinese Unknown Word Identification[ J] . Journal of Chinese Language and Computing, 2007,17( 1) :15-26
[4] Ling G C, Asahara M , M atsum oto Y . Chinese Unknown Word Identification Using Character-based Tagging and Chunking[ C]//Proceedings of the 41st Annual Meeting of the Association for Computational Linguistics. Sapporo, Japan, 2003: 197- 200 [5] Qiu L, Hu C, Zhao K . A Method for Automatic POS Guessing of Chinese Unknown Words[ C]// Proceedings of t he 22nd International Conference on Computational Linguistics (Coling 2008) .Manchester, 2008: 705-712
[6] Goh C-L, Asahara M , Matsum oto Y . Machine Learning-based Methods to Chinese Unknown Word Detection and POS Tag Guessing [ J ] . Journal of Chinese Language and Computing, 2006, 16( 4) : 185-206.
[7] Peng F, Feng F, McCallum A . Chinese Segmentation and New Word Detection using Conditional Random Fields [ C]// Proceedings of The 20th International Conference on Computational Linguistics. University of Geneva, Switzerl and, 2004: 562- 568.
[8] 邹纲, 刘洋, 刘群, 等.面向 Internet 的中文新词语检测[ J] . 中文信息学报, 2004, 18( 6) : 1- 9.
[9] 崔世起, 刘群, 孟遥, 等. 基于大规模语料库的新词检测[ J ] . 计算机研究与发展, 2006, 43( 5) : 927-932.
[10] 曹勇刚, 曹羽中, 金茂忠, 等. 面向信息检索的自适应中文分词系统[ J] . 软件学报, 2006, 17( 3) : 356- 363.
[11] 罗智勇, 宋柔. 基于多特征的自适应新词识别[J] . 北京工业大学学报, 2007, 33( 7) :718-725.
[12] Fu G- h, Luke K-k. Chinese unknown word identification as known word tagging[ C]// Proceedings of the Third International Conference on Machine Learning and Cybernetics. Shanghai,2004: 2612- 2617.
[13] Fu G,Luke K-k. Chinese Unknown Word Identification Using Class based LM [C]// Proceedings of The First International Joint Conference on Natural Language Processing. Hainan Island, China,2004: 262-269.
[14] Goh C-L, Masayu ki, Asahara, et al. Training Multi- Classifiers for Chinese Unknown Word Detect ion [ J ] . Journal of Chinese Language and Computing, 2005, 15( 1) : 1-12
[15] 丁建立,慈祥,黃剑雄.一种基于免疫遗传算法的网络新词识别方法 [J]. 计算机科学, 2011,38(1):240-245.
[16] 袁里驰. 基于改进的隐马尔科夫模型的词性标注方法[J].中南大学学报,2012,43(8):3053-3057.
[17] Carus A, Mesut A. Fast text compression using multiple static dictionaries [J].Information Technology Journal, 2010, 9(5):1013-1021.
[18] 张婵婵,鲁淑霞,王熙照.基于无监督决策树聚类方法的研究[D].河北:河北大学,2010. [19] Wang Z, Huang C, Zhu J. Which Performs Better on In-Vocabulary Word Segmentation-Based on Word or Character[ C]// Proceeding of t he Sixth Sighan Work shop on Chinese Language.Hyderabad, India, 2008: 61-68.
基金项目:中国矿业大学(北京)中央高校科研业务费项目(2011YJ04)
关键词:计算机应用技术; 新词识别;新词提取;垃圾串过滤;训练语料;监督方法
中国分类号:TP391 文献标识码:A 文章编号:1009-914X(2013)30-0209-02
0 引言
新词新语是反映真实社会生活的重要信息,随着社会的发展进步以及网络社交的迅速蔓延,大量反映新事物、新观念、新想法的新词语涌现出来。很多反映当前社会状况或者未来发展趋势的新词汇相继诞生,因特网的普及以及Web2.0的兴起,加速了新词的产生和传播。这不仅是一种引人注目的社会现象,更给中文信息处理带来了极大挑战。国家语委语言应用研究所曾做过统计,当代汉语每年出现1000个左右的新词,平均每天出现三个。这些新词中,有些迅速出现又迅速消亡,有些则迅速推广开来,成为现代生活中的一部分,被广泛应用于日常生活与各种媒体之中,直接体现现代社会生活的发展与变化。像“微博”、“给力”、“粉丝”等新词从诞生到流行只用了很短的时间。在这样一个信息高效快节奏的发展进程中,如何准确快速的识别出新词新语,成为信息处理中的一个关键课题[1]。
下文主要从以下几个方面来进行论述:①介绍候选新词提取与过滤的相关工作与研究进展。②分析现有的候选新词提取与过滤的相关技术及不同技术的优缺点。③总结新词提取与过滤的研究现状,展望下一步工作。
2 候选新词提取与过滤研究进展
在新词提取中,任何相邻的汉字在理论上都是新词的候选对象。候选新词提取是新词识别的必经阶段,候选新词中必然包含很多非词垃圾串[2,3]。对于候选新词的提取与垃圾串的过滤的研究,基本是采用基于监督的方法与基于非监督的方法两种方式[4,5]。
Goh[6]等先用 HMM 模型来进行分词和预标注, 在此基础上, 对词标注3POS- posit ion4标记, 然后使用上述标注过的语料训练 SVM 模型, 最后用SVM对字符标 注3PO S- po sitio n4 标记, 从 而获得新 词。但基于H M M 粗分获得的语料进行模型训练, 可能会引入较大的误差。
Peng[7]等使用基于字符位置的标记方法训练 CRF 模型, 进行中文分词。分词后, 计算字串可信度, 当可信度高于阈值时, 认为是新词。由于 CRF 标记的准确性高, 使得新词识别具有很好的效果。
邹纲[8]等统计按时间排序后的网页中所有的重复字串,频率高于阈值的作为候选词串; 接着以某个时间点为界限, 把候选字串划分为前景集合与背景集合, 取集合差作为新词候选集合。最后使用过滤规则排除垃圾词串。该方法的优点是可获得某个时间点后出现的新词, 且集合差运算后, 能过滤掉部分垃圾词串。但由于新词出现的时间具有模糊性, 集合相减会将部分新词误删; 使用基于分词的串频统计, 性能会受到分词工具的影响。
崔世起[9]等在邹纲的重复字串基础上, 先对词的构成模式进行分类, 然后采用针对性方法进行过滤。通过统计获得垃圾头( 尾) 的过滤词典来过滤单字垃圾串; 对类似 3+ 1, 2+ 1 形式的使用词缀词典过滤。该方法针对部分模式字串, 过滤效果较好, 但处理模式不完善, 会造成新词漏召。有研究者使用滑动窗口来简化串频统计。
曹勇刚[10]等先对句子进行二元切分, 并统计切分后的整个文档在这一级别上字串的频率,将频率高于阈值的字串加入词频表中; 然后合并选取的二元词, 作为字进入下一轮迭代; 之后再次使用二元语法进行句子切分, 再统计这一层面上的串频, 扩充词频表, 直至二元迭代结束。最后基于停用词表设计过滤规则, 去除垃圾字串。试验表明该方法识别效果较好, 速度较快。但在迭代时, 后续迭代要受到前期迭代影响, 可能造成新词漏召。
罗智勇[11]等使用 PAT-Array 算法提取的重复串作为候选新词; 用手工标注的小规模训练语料来训练 SVM 分类模型剔除垃圾串, 从而获得新词。由于使用高效的统计算法, 重复串的统计效率得到了很大提升[12]。但使用小规模标注语料来训练过滤模型, 会影响垃圾串过滤效果[13]。
3 候选新词的提取与过滤技术
现有的候选新词提取与过滤技术主要分为两类,一是有监督方法,即在大规模训练语料基础上,通过统计方法来确定新词边界,进而获得候选新词[14];另外一种是无监督方法,即统计待处理文本的字串频率,而不需要大规模语料库的支持,频率高于阈值的重复串作为候选新词。
3.1 基于监督方法提取与过滤候选新词
在大规模训练语料的支持下, 研究者将候选新词提取问题转化为分类或标注问题, 对各种统计模型进行了尝试和探索[15]。
3.1.1 基于隐马尔科夫模型
隐马尔科夫模型中观察到的事件时状态的随机函数,因此该模型是一双重随机过程,由马尔可夫链和一般随机过程两部分组成。其中马尔可夫链不能直接观察到,通过状态转移概率矩阵描述;一般随机过程描述状态与观察序列间的关系,由符号输出概率矩阵来定义。图1 给出了隐马尔可夫模型的组成示意图,
图1 隐马尔可夫模型的组成
隐马尔可夫模型(HMM)由一個五元组(Ωx,Ω0,Α,Β,π)表示,其中Ωx={X1,…,XN}表示隐藏状态集合;Ω0={O1,…,OM}表示观察值集合;Α=(aij)表示状态转移概率矩阵,aij表示从状态Si转移到Sj的概率;Β=(bi(k))表示观察值概率矩阵,bi(k)表示在状态Si时输出符号Vk的概率;π=(π1,…,πN)是初始状态。通常简略的将隐马尔科夫模型表示成三元组的形式λ={Α,Β,π}。 解码问题是隐马尔可夫模型主要解决的问题之一[16],解码问题是指对于给定的模型λ={Α,Β,π}和观察值序列Ω0={O1,…,OM},求所对应的状态序列的最好解释,该问题的主要算法有Viterbi算法。Viterbi算法是一种动态规划算法,Viterbi算法是一种动态规划算法,将全局最优解的计算过程分解成各阶段最优解的计算。该算法的目的是找到一条最优路径,每一阶段的每个状态都记录着从上一阶段到自身的最优路径。当经过所有阶段,获得最优值后,根据获得最优值的状态所录的路径进行回溯,即可得到最优路径上的状态。
3.1.2 基于决策树模型
决策树方法是一种通过建立决策树来发现数据集中情况,分类样例的数据挖掘方法,决策树分类方法具有精度高、生成模式简单、速度快、而且能够处理大数据库等多种优点。决策树所表示的分类知识可以用文字概括出来,并可以用if-then的分类规则形式加以表示。从决策树的根节点到每一个叶子节点所对应的一条路径就形成了一条分类规则。沿着决策树的一条路径上所有的属性以及对应的值的合取就构成了分类规则的条件部分(if部分),叶子节点所标记的类别就构成了规则的结论部分(then部分)[17]。
3.1.3 基于条件随机场模型
条件随机场模型(CRFs)是一种判别式模型,采用的是无向图分布,没有严格的独立性假设,可以任意选取特征,而且因为采用全局归一化的方法,避免产生标记偏移问题,所以在新词提取与过滤上取得较好效果[18],其中链式CRFs在词串提取中较为常用。在给定观察序列条件下,标记序列的条件概率为:
其中,x表示需要标注的观察序列;y表示相应的标注序列表;在一阶链式结构的图G=(V,E)中,V代表图中的节点集,E表示图中的边,最大图包含相邻的2个节点,即图G的边。对1个最大图中的无向边e=(Vt-1,Vt),fk(e,y|e,x)为状态转移特征函数;gk(v,y|v,x)为状态特征函数;λk和μk是由训练样本得到的特征权重;k为特征函数编号;v为V中的节点。计算特征权重函数采用极大似然估计方法。CRFs指数模型为凸函数,可采用迭代方法找到全局最优解。图3给出了将CRFs应用到新词提取与过滤中的新词提取过程。
图5 基于CRFs模型进行新词提取与过滤
CRF模型能够很好的应用领域知识和标记之间的依赖,充分利用各种统计信息,提高标注准确性。但在模型训练方面,都需要大规模训练预料的支持,而且训练和解码的速度不够理想。
3.2 基于非监督方法提取与过滤候选新词
3.2.1 基于启发规则
采用词类方法进行新词识别, 需要先构造新词模板, 然后使用模板匹配来获得候选新词。再用统计特征进行过滤, 得到新词。该方法识别新词速度快, 但适应性不强。通常只对简单命名实体或者特定领域的新词识别有效[19]。
使用基于启发规则的方法来获得候选词串,实现起来比较简单,识别速度快,准确率较高,垃圾串过滤的压力想对较小;但新词召回率会受到规则完备性的影响,而且应用范围会受到限制。
3.2.2 基于高效的重复串统计算法
PAT-Array 算法提取的重复串作为候选新词; 用手工标注的小规模训练语料来训練 SVM 分类模型剔除垃圾串, 从而获得新词。由于使用高效的统计算法, 重复串的统计效率得到了很大提升。但使用小规模标注语料来训练过滤模型, 会影响垃圾串过滤效果。高效的重复串统计算法,虽然实现起来略显复杂,垃圾串的过滤任务同样繁重,但效率很高,是非监督方法中的主导方法。
4 结束语
随着新词新语大量快速的涌现与扩展,读新词新语的提取与过滤的研究成为目前关注的重点,研究者已经在这方面做了很多深入的研究工作,本文对近几年来国内外在该领域的主要成果进行了回顾与总结,综述了新词新语的研究现状与研究方法,同时指出了各种方法存在的问题和将来进一步的研究方向。对于新词的提取与过滤,综合使用统计特征和启发式过滤规则,将各种过滤特征进行系统综合,最大限度过滤垃圾串、提高过滤准确性,将是下一步的重点研究方向。
参考文献:
[1] 张海军, 史树敏, 朱朝勇, 等. 中文新词识别技术综述 [J].计算机科学, 2010, 37(3): 6-10.
[2] Gao J, LiM , Wu A , et al. Chinese Word Segmentation andNamed Entity Recognition: A Pragmatic Approach [ J] . Computation al Linguistics, 2005, 31( 4) :531-572
[3] Liu T, Liu B- Q , Wang X-L, et al . The Effectiveness Study of Local Maximum Feature f or Chinese Unknown Word Identification[ J] . Journal of Chinese Language and Computing, 2007,17( 1) :15-26
[4] Ling G C, Asahara M , M atsum oto Y . Chinese Unknown Word Identification Using Character-based Tagging and Chunking[ C]//Proceedings of the 41st Annual Meeting of the Association for Computational Linguistics. Sapporo, Japan, 2003: 197- 200 [5] Qiu L, Hu C, Zhao K . A Method for Automatic POS Guessing of Chinese Unknown Words[ C]// Proceedings of t he 22nd International Conference on Computational Linguistics (Coling 2008) .Manchester, 2008: 705-712
[6] Goh C-L, Asahara M , Matsum oto Y . Machine Learning-based Methods to Chinese Unknown Word Detection and POS Tag Guessing [ J ] . Journal of Chinese Language and Computing, 2006, 16( 4) : 185-206.
[7] Peng F, Feng F, McCallum A . Chinese Segmentation and New Word Detection using Conditional Random Fields [ C]// Proceedings of The 20th International Conference on Computational Linguistics. University of Geneva, Switzerl and, 2004: 562- 568.
[8] 邹纲, 刘洋, 刘群, 等.面向 Internet 的中文新词语检测[ J] . 中文信息学报, 2004, 18( 6) : 1- 9.
[9] 崔世起, 刘群, 孟遥, 等. 基于大规模语料库的新词检测[ J ] . 计算机研究与发展, 2006, 43( 5) : 927-932.
[10] 曹勇刚, 曹羽中, 金茂忠, 等. 面向信息检索的自适应中文分词系统[ J] . 软件学报, 2006, 17( 3) : 356- 363.
[11] 罗智勇, 宋柔. 基于多特征的自适应新词识别[J] . 北京工业大学学报, 2007, 33( 7) :718-725.
[12] Fu G- h, Luke K-k. Chinese unknown word identification as known word tagging[ C]// Proceedings of the Third International Conference on Machine Learning and Cybernetics. Shanghai,2004: 2612- 2617.
[13] Fu G,Luke K-k. Chinese Unknown Word Identification Using Class based LM [C]// Proceedings of The First International Joint Conference on Natural Language Processing. Hainan Island, China,2004: 262-269.
[14] Goh C-L, Masayu ki, Asahara, et al. Training Multi- Classifiers for Chinese Unknown Word Detect ion [ J ] . Journal of Chinese Language and Computing, 2005, 15( 1) : 1-12
[15] 丁建立,慈祥,黃剑雄.一种基于免疫遗传算法的网络新词识别方法 [J]. 计算机科学, 2011,38(1):240-245.
[16] 袁里驰. 基于改进的隐马尔科夫模型的词性标注方法[J].中南大学学报,2012,43(8):3053-3057.
[17] Carus A, Mesut A. Fast text compression using multiple static dictionaries [J].Information Technology Journal, 2010, 9(5):1013-1021.
[18] 张婵婵,鲁淑霞,王熙照.基于无监督决策树聚类方法的研究[D].河北:河北大学,2010. [19] Wang Z, Huang C, Zhu J. Which Performs Better on In-Vocabulary Word Segmentation-Based on Word or Character[ C]// Proceeding of t he Sixth Sighan Work shop on Chinese Language.Hyderabad, India, 2008: 61-68.
基金项目:中国矿业大学(北京)中央高校科研业务费项目(2011YJ04)