基于并行计算的中文分词系统的研究与实现

来源 :广东工业大学 | 被引量 : 0次 | 上传用户:timeman
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
当前随着计算机和互联网技术的普及,人们已经进入了信息呈指数级爆炸式增长的信息时代,每个人在实际生活中每时每刻都在不断地与信息打交道:接收信息、加工信息和利用信息。面对各种海量信息,人们试图引入计算机来帮助我们进行信息管理,并取得不错的效果,然而这种管理通常局限于小部分的可用数据库系统管理的结构化信息,在IT应用中除了结构化信息外,还存在有非结构化信息,如文本档案、电子邮件、声音、影片、图像等。非结构化信息隐含了许多有价值的关键信息,但由于非结构化信息的割裂性和不可操作性使得对这部分信息的提取很困难,目前人们已经着力于各种技术的研究,以期在非结构化信息提取中取得突破,中文信息处理技术就是其中一种,目前中文信息技术已经呈现海量、自动化和智能化的特征,并逐渐融合包括音频、视频在内的多媒体技术特性。中文信息处理以词作为加工的基本单位,可以说中文分词是中文信息处理的必备条件,分词的处理效率将直接制约中文信息处理的效果。   本文通过对目前存在的多种中文分词技术,如基于机械匹配的分词方法、基于统计的分词方法及基于人工智能技术的分词方法等的深入研究,发现目前的并行分词算法大多都存在一个特点:在单处理机上进行并行处理。另一方面,各种并行计算机的研究已经从理论模型研究阶段进入了商用阶段,各种并行算法也如雨后春笋般迅速普及,并行计算的应用已经成为了可能。本论文将并行计算技术引入到中文分词领域,设计出了一种基于并行计算的中文分词系统,使用该系统对大规模批量文本文件进行中文分词处理分词性能得到了显著的提升。该系统从现有的基于词典的机械匹配分词算法出发,通过一系列步骤,最终设计出一个能展示并发性、可扩展性的并行分词系统。此过程可分为四步,即任务划分、通信分析、任务组合和处理器映射。在任务划分阶段通过域分解方法将中文分词问题划分为一些小的计算任务,以开拓算法的并行性和满足可扩放性;在通信分析阶段分析了各并行任务之间的通信要求和通信成本;在任务组合阶段对算法的通信成本和总体执行时间进行了优化,同时进行必要的反复回溯;在处理器映射阶段将经过优化的算法指派到各处理器去执行,着重考虑各进程问的负载均衡。   文章的最后部分以电子病历系统从海量的病历文档中挖掘疾病特征信息的分词过程为例来说明基于并行计算的中文分词系统的分词效果。它在保证分词切分精度的同时最大限度地提高了分词的切分速率,使得对大规模真实文本的分词处理实现成为了可能。
其他文献
随着Internet、数码相机技术和扫描技术的迅速发展,网络上的图像信息以爆炸性的速度不断丰富和扩展。然而由于Web数据具有多样性、复杂性和无规则性,如何快速有效地从海量数
伴随着互联网技术的不断发展,电子商务也取得了巨大的发展。人们在享受电子商务带来便捷的同时,也不得不面对电子商务站点上的商品不断增加,要找到自己所需商品越来越困难。
实时数据库是数据和事务都有定时性限制的一类特殊数据库,主要针对各种时间关键型应用。过程控制是实时数据库的一个非常重要的应用场合,它主要处理生产装置、生产过程的控制
Ad Hoc网络实现了在没有基础设施环境下的移动节点自由互联,在军事领域及民用服务领域都有广泛的应用前景,因而受到了学术界广泛关注。其中,对Ad Hoc网络中可靠传输协议TCP性能
随着社会经济的快速发展,国家及各级地方政府对教育行业的投入越来越大,教育采购的规模也逐年扩大,这样需要一套信息化的措施来提高政府采购的执行效率。政府采购过程涉及单
波达方向(Direction Of Arrival,DOA)估计技术起初由空域滤波和时域谱估计发展而来,其参数估计性能优越,应用前景宽广,例如雷达、声纳、电子对抗和无线定位等技术,目前已成为
粒子群优化算法(Particle Swarm Optimization, PSO)是人工生命与群体智能理论的结合下提出的一种启发式算法,最早是由Eberhart和Kennedy于九十年代中期提出的,是在鸟群、鱼群和
考试是教学过程中的重要环节,在信息化社会中,建立计算机管理系统来管理高校的考试题库成为各高校考试管理走向现代化、规范化、科学化的必然途径。为深化教学改革,提高教学
计算机自动伴奏是计算机自动作曲研究的一个分支,是计算机技术和音乐理论相互交融的产物。目前计算机自动伴奏研究虽然取得了一定的成果,但这些研究基本上是建立在西洋大小调
笔迹既包含着书写者先天的生理特征,又受后天学习的影响,能在一定程度上反映书写者的书写习惯和生物特征。从笔迹中提取的信息可以用来判断书写者的性别、年龄和使用右手或者