论文部分内容阅读
摘要:医院信息系统HIS实现了联机事务处理功能,对系统中数据的应用大多局限于查询统计,应用于辅助决策尚未完善。随着HIS应用水平的不断提高和数据挖掘技术的不断进步,将数据挖掘技术应用于医院信息系统已成为热门话题。文章以数据挖掘在HIS中的应用为目标,介绍了数据挖掘技术的定义、HIS数据的特点、数据挖掘的步骤及任务。
关键字:数据挖掘;HIS;特点;任务
1 引言
近年来,随着电子信息技术的迅速发展,医院信息系统(HIS)、数字医疗设备和医药企事业单位信息系统的广泛应用,各医疗卫生单位计算机中的数据容量不断膨胀。数据库技术的发展在不断地解决海量数据的存储和数据检索的效率问题,但无法改变“数据爆炸但只是贫乏”的现象,如何充分应用这些宝贵的医学数据资源来为疾病的诊断和治疗提供科学的决策,促进医学研究,已成为人们关注的焦点。
数据挖掘(Data Mining,DM)是一个近些年才发展起来的信息处理技术,它是从大量数据中提取出可信的、新颖的、有效的并最终能被人理解的信息模式处理过程,它涉及数据库、人工智能、统计学、模式识别、可视化技术、并行计算等众多领域知识。医学数据挖掘是一门涉及面广.技术难度大的新兴交叉学科,它需要从事智能信息处理、计算机、应用数学的科研人员与医务工作者通力合作,将数据挖掘技术应用到医学数据库中,用以发现其中的医学诊断规则和模式,从而辅助医生进行疾病诊断,帮助管理者发现并创造新的管理方法和手段。
2 数据挖掘的定义
从商用角度来看,数据挖掘可定义为一种类深层次的数据分析方法,是按照企业既定业务目标,对大量企业数据进行探索和分析,揭示隐藏的、未知的或验证已知的规律性,为企业决策提供真正有价值的信息,并进而获取利润的一种模型化的先进方法。
从技术角度来看,数据挖掘是从大量的、不完全的、有噪声的、模糊的、随机的实际应用数据中,提取隐含在其中的、人们事先不知道的、但又有潜在有用的信息和知识的过程。
由定义可看出,数据挖掘与传统数据分析(如查询、报表、联机应用分析等)的本质区别在于数据挖掘是在没有明确假设的前提下挖掘信息、发现知识,换言之,数据挖掘所得到的信息应当具有预知未知、有效和可实用3个特征。
3 数据挖掘技术在医院信息系统中的应用
数据挖掘技术的产生时间不长,但其在商业、产业、电信等领域的应用已相当广泛,并取得了客观的经济和社会效益。由于医疗卫生系统本身具有的复杂和时变的特性,导致数据挖掘技术在医疗卫生领域的应用尚处于起步阶段。但医学技术作为一门验证性的科学,因此在该领域的数据挖掘具有较强的实用价值和广阔的应用前景。
3.1 医院信息系统的数据特点
医院信息系统中包含了医疗过程和医患活动的全部数据资源,既有临床医疗信息,又有医院管理的相关信息。这些信息反映了医学的独特性。
3.1.1 多态性
医院信息系统中的数据包括纯数据(如体征参数、检验结果等)、影像(如CT、B超等)、信号(如ECG、EEG等)、文字(如患者检查检验结果、病历记录等)等,因此其具有模式的多态性,这也是其区别于其他领域的显著特征。
3.1.2 不完整性
医院信息系统中的数据是在对患者进行诊疗的过程中收集的,是以对患者进行诊断并最终治愈为目的,并非以研究为目的,再加之人为因素也可导致数据记录的偏差和缺失,因此搜集的数据具有疾病信息的客观不完整性和描述疾病的主观不完整性。
3.1.3 冗余性
医院信息系统是一个特殊的系统,系统中的某些数据关乎患者的健康安全,如发药信息、检查检验结果数据等,为进行数据校验,保证数据的正确性,系统会保存大量重复的、甚至是相互矛盾的数据记录。
3.1.4 隐私性
医院信息系统中保存了患者的所有信息,包括身份信息、诊疗信息、费用信息等,也不可避免地会涉及到患者的隐私,一旦这些隐私信息被暴露,并对患者的日常生活造成侵扰,就会涉及到较多的伦理、法律等问题。
3.2 医院信息系统数据挖掘的步骤
数据挖掘可分为预处理和挖掘分析两个阶段如图l所示。由于医学数据具有前文所介绍诸多特性,需要对带挖掘数据进行筛选、清洗、匿名化、标识转换等操作,因此通常需要花费较多时间,通常约占总时间的60%。
3.3 医院信息系统数据挖掘的任务
3.3.1 分类
分类是指根据一个可预测属性将事例分为多个类别,是最常见的数据挖掘任务之一。医生根据望闻切诊以及辅助检查对患者进行疾病诊断,实际就是一个疾病分类的过程,即根据患者的疾病特征,将其划分为某个疾病或某类疾病。典型的分类算法有决策树、神经网络和贝叶斯算法。
3.3.2 聚类
聚类也称细分,是基于一组特定的属性对事例进行分组的数据挖掘方法。利用聚类分析工具分析患者的疾病诊断数据,进行探索性的数据分析,生成聚类结果,并考察其意义。例如,对糖尿病患者,可按照年龄、性别、体重和血压指数等产生聚类模式,得到糖尿病患者典型分型,在临床上具有重要意义。
3.3.3 关联
关联规则最典型的商用案例就是一家连锁店通过数据挖掘发现了尿片与啤酒之间有着惊人的联系。使用关联规则,可以发现临床数据间的关联性,通过病历系统中患者的诊断信息、用药情况等,可以挖掘出某种疾病的常规用药方案,并形成临床路径。
3.3.4 预测
预测是医学数据挖掘最重要的—项任务。预测技术使用的是时间序列数据集,即有时序关系的一组观察值,而患者的诊疗过程所记录的数据也是具备时序性的,应用预测技术对这些诊疗数据进行分析,可预测患者疾病的发展趋势甚至预后情况,并根据预测结果对诊疗方案进行修正,以获得最佳的疗效和预后。
4 结语
将数据挖掘技术应用于医院信息系统是一项困难的但又具有广阔前景和巨大价值的课题,它将传统统计学、现代计算机技术、人工智能以及现代医学相融合,从整个医学信息库中提取知识,为医疗服务提供决策依据。由于挖掘对象所具有的独特性、算法要求的高效性、提取知识及决策建议的更高准确性等诸多因素,需要统计学、计算机以及广大医务工作者共同努力,相互协作,才能取得更大的突破。相信随着数据挖掘技术的不断发展、挖掘算法的不断改进,数据挖掘技术在医学领域的应用必将更加广泛,从而带来更大的社会和经济效益。
关键字:数据挖掘;HIS;特点;任务
1 引言
近年来,随着电子信息技术的迅速发展,医院信息系统(HIS)、数字医疗设备和医药企事业单位信息系统的广泛应用,各医疗卫生单位计算机中的数据容量不断膨胀。数据库技术的发展在不断地解决海量数据的存储和数据检索的效率问题,但无法改变“数据爆炸但只是贫乏”的现象,如何充分应用这些宝贵的医学数据资源来为疾病的诊断和治疗提供科学的决策,促进医学研究,已成为人们关注的焦点。
数据挖掘(Data Mining,DM)是一个近些年才发展起来的信息处理技术,它是从大量数据中提取出可信的、新颖的、有效的并最终能被人理解的信息模式处理过程,它涉及数据库、人工智能、统计学、模式识别、可视化技术、并行计算等众多领域知识。医学数据挖掘是一门涉及面广.技术难度大的新兴交叉学科,它需要从事智能信息处理、计算机、应用数学的科研人员与医务工作者通力合作,将数据挖掘技术应用到医学数据库中,用以发现其中的医学诊断规则和模式,从而辅助医生进行疾病诊断,帮助管理者发现并创造新的管理方法和手段。
2 数据挖掘的定义
从商用角度来看,数据挖掘可定义为一种类深层次的数据分析方法,是按照企业既定业务目标,对大量企业数据进行探索和分析,揭示隐藏的、未知的或验证已知的规律性,为企业决策提供真正有价值的信息,并进而获取利润的一种模型化的先进方法。
从技术角度来看,数据挖掘是从大量的、不完全的、有噪声的、模糊的、随机的实际应用数据中,提取隐含在其中的、人们事先不知道的、但又有潜在有用的信息和知识的过程。
由定义可看出,数据挖掘与传统数据分析(如查询、报表、联机应用分析等)的本质区别在于数据挖掘是在没有明确假设的前提下挖掘信息、发现知识,换言之,数据挖掘所得到的信息应当具有预知未知、有效和可实用3个特征。
3 数据挖掘技术在医院信息系统中的应用
数据挖掘技术的产生时间不长,但其在商业、产业、电信等领域的应用已相当广泛,并取得了客观的经济和社会效益。由于医疗卫生系统本身具有的复杂和时变的特性,导致数据挖掘技术在医疗卫生领域的应用尚处于起步阶段。但医学技术作为一门验证性的科学,因此在该领域的数据挖掘具有较强的实用价值和广阔的应用前景。
3.1 医院信息系统的数据特点
医院信息系统中包含了医疗过程和医患活动的全部数据资源,既有临床医疗信息,又有医院管理的相关信息。这些信息反映了医学的独特性。
3.1.1 多态性
医院信息系统中的数据包括纯数据(如体征参数、检验结果等)、影像(如CT、B超等)、信号(如ECG、EEG等)、文字(如患者检查检验结果、病历记录等)等,因此其具有模式的多态性,这也是其区别于其他领域的显著特征。
3.1.2 不完整性
医院信息系统中的数据是在对患者进行诊疗的过程中收集的,是以对患者进行诊断并最终治愈为目的,并非以研究为目的,再加之人为因素也可导致数据记录的偏差和缺失,因此搜集的数据具有疾病信息的客观不完整性和描述疾病的主观不完整性。
3.1.3 冗余性
医院信息系统是一个特殊的系统,系统中的某些数据关乎患者的健康安全,如发药信息、检查检验结果数据等,为进行数据校验,保证数据的正确性,系统会保存大量重复的、甚至是相互矛盾的数据记录。
3.1.4 隐私性
医院信息系统中保存了患者的所有信息,包括身份信息、诊疗信息、费用信息等,也不可避免地会涉及到患者的隐私,一旦这些隐私信息被暴露,并对患者的日常生活造成侵扰,就会涉及到较多的伦理、法律等问题。
3.2 医院信息系统数据挖掘的步骤
数据挖掘可分为预处理和挖掘分析两个阶段如图l所示。由于医学数据具有前文所介绍诸多特性,需要对带挖掘数据进行筛选、清洗、匿名化、标识转换等操作,因此通常需要花费较多时间,通常约占总时间的60%。
3.3 医院信息系统数据挖掘的任务
3.3.1 分类
分类是指根据一个可预测属性将事例分为多个类别,是最常见的数据挖掘任务之一。医生根据望闻切诊以及辅助检查对患者进行疾病诊断,实际就是一个疾病分类的过程,即根据患者的疾病特征,将其划分为某个疾病或某类疾病。典型的分类算法有决策树、神经网络和贝叶斯算法。
3.3.2 聚类
聚类也称细分,是基于一组特定的属性对事例进行分组的数据挖掘方法。利用聚类分析工具分析患者的疾病诊断数据,进行探索性的数据分析,生成聚类结果,并考察其意义。例如,对糖尿病患者,可按照年龄、性别、体重和血压指数等产生聚类模式,得到糖尿病患者典型分型,在临床上具有重要意义。
3.3.3 关联
关联规则最典型的商用案例就是一家连锁店通过数据挖掘发现了尿片与啤酒之间有着惊人的联系。使用关联规则,可以发现临床数据间的关联性,通过病历系统中患者的诊断信息、用药情况等,可以挖掘出某种疾病的常规用药方案,并形成临床路径。
3.3.4 预测
预测是医学数据挖掘最重要的—项任务。预测技术使用的是时间序列数据集,即有时序关系的一组观察值,而患者的诊疗过程所记录的数据也是具备时序性的,应用预测技术对这些诊疗数据进行分析,可预测患者疾病的发展趋势甚至预后情况,并根据预测结果对诊疗方案进行修正,以获得最佳的疗效和预后。
4 结语
将数据挖掘技术应用于医院信息系统是一项困难的但又具有广阔前景和巨大价值的课题,它将传统统计学、现代计算机技术、人工智能以及现代医学相融合,从整个医学信息库中提取知识,为医疗服务提供决策依据。由于挖掘对象所具有的独特性、算法要求的高效性、提取知识及决策建议的更高准确性等诸多因素,需要统计学、计算机以及广大医务工作者共同努力,相互协作,才能取得更大的突破。相信随着数据挖掘技术的不断发展、挖掘算法的不断改进,数据挖掘技术在医学领域的应用必将更加广泛,从而带来更大的社会和经济效益。