论文部分内容阅读
在当今信息爆炸的社会,生物医学作为21世纪的重点研究领域,其文献增长速度惊人。但面对数量庞大的文献,人们不再满足于对数据库中的数据进行检索存取等简单操作,而是希望计算机自动智能地分析数据库中的大量数据,以揭示隐藏在这些数据中的更重要信息,即关于这些数据整体特征的描述及对其发展趋势的预测。本研究尝试使用关联规则方法对哮喘相关文献挖掘其近年的研究热点,目的在于寻求一种效果比较理想的计算机处理文献方法分析特定专题领域的研究热点,解决依靠人工阅读工作量过大和人工分析具有主观性的问题。
本研究以PubMed数据库中2004-2008年发表的以哮喘为主题的文献作为研究对象。下载文献的XML题录,提取各篇文献的主题词和对应副主题词,并统计主题词/副主题词出现的频次,截取频次大于100的主题词作为高频主题词。高频主题词和各篇文献形成词篇矩阵,利用SPSS Clementine软件做关联规则挖掘,生成规则800余条。构建高频主题词共现矩阵,利用SPSS统计软件对矩阵做层次聚类。分析出哮喘研究热点的6大领域。然后依据聚类树状图最底层两两合并的主题词,在各自作为前件的关联规则中找出高置信度的共同后件,组成形如(主题词A/主题词B)→主题词C的“共同关联规则”。通过“共同关联规则”分析各领域的研究热点。
哮喘的研究热点集中在6大领域:(1)哮喘免疫学发病机制;(2)哮喘诱因及流行病学;(3)气道重塑;(4)哮喘诊断与评估;(5)哮喘治疗;(6)职业性哮喘。通过“共同关联规则”分析得到的各领域的研究热点详见文内。检索SCI影响因子大于3.8的呼吸系统核心期刊2004-2008期间发表的哮喘相关文献,通过人工阅读文摘对文献主题内容提取并分类,结果发现90%以上的文献的主题内容在本研究总结的研究热点中出现。
本研究利用关联规则分析方法对哮喘相关文献进行研究热点挖掘分析,具有较好的准确度,为计算机处理文献分析特定专题领域的研究热点做出了一个新的尝试。相对于成熟的共词聚类分析方法,本研究在其基础上能赋予更多的主题词之间关系,能更加具体地分析研究热点。