论文部分内容阅读
当前随着计算机和互联网技术的普及,人们已经进入了信息呈指数级爆炸式增长的信息时代,每个人在实际生活中每时每刻都在不断地与信息打交道:接收信息、加工信息和利用信息。面对各种海量信息,人们试图引入计算机来帮助我们进行信息管理,并取得不错的效果,然而这种管理通常局限于小部分的可用数据库系统管理的结构化信息,在IT应用中除了结构化信息外,还存在有非结构化信息,如文本档案、电子邮件、声音、影片、图像等。非结构化信息隐含了许多有价值的关键信息,但由于非结构化信息的割裂性和不可操作性使得对这部分信息的提取很困难,目前人们已经着力于各种技术的研究,以期在非结构化信息提取中取得突破,中文信息处理技术就是其中一种,目前中文信息技术已经呈现海量、自动化和智能化的特征,并逐渐融合包括音频、视频在内的多媒体技术特性。中文信息处理以词作为加工的基本单位,可以说中文分词是中文信息处理的必备条件,分词的处理效率将直接制约中文信息处理的效果。
本文通过对目前存在的多种中文分词技术,如基于机械匹配的分词方法、基于统计的分词方法及基于人工智能技术的分词方法等的深入研究,发现目前的并行分词算法大多都存在一个特点:在单处理机上进行并行处理。另一方面,各种并行计算机的研究已经从理论模型研究阶段进入了商用阶段,各种并行算法也如雨后春笋般迅速普及,并行计算的应用已经成为了可能。本论文将并行计算技术引入到中文分词领域,设计出了一种基于并行计算的中文分词系统,使用该系统对大规模批量文本文件进行中文分词处理分词性能得到了显著的提升。该系统从现有的基于词典的机械匹配分词算法出发,通过一系列步骤,最终设计出一个能展示并发性、可扩展性的并行分词系统。此过程可分为四步,即任务划分、通信分析、任务组合和处理器映射。在任务划分阶段通过域分解方法将中文分词问题划分为一些小的计算任务,以开拓算法的并行性和满足可扩放性;在通信分析阶段分析了各并行任务之间的通信要求和通信成本;在任务组合阶段对算法的通信成本和总体执行时间进行了优化,同时进行必要的反复回溯;在处理器映射阶段将经过优化的算法指派到各处理器去执行,着重考虑各进程问的负载均衡。
文章的最后部分以电子病历系统从海量的病历文档中挖掘疾病特征信息的分词过程为例来说明基于并行计算的中文分词系统的分词效果。它在保证分词切分精度的同时最大限度地提高了分词的切分速率,使得对大规模真实文本的分词处理实现成为了可能。