论文部分内容阅读
社交媒体是收集自然和科技灾害信息的重要来源。然而,由于信息的非结构化特性,很难有效收集与特定灾害相关的信息。现阶段的数据采集方法有很大的局限性,实际应用效果甚微。因此,研究者不得不手动选择关键词来收集有效信息。我们的研究结合最新的灾害管理技术与计算机语言,构造一种复合法来筛选事件相关的标签,从而达到信息有效收集的目的。 首先利用灾害数据库信息,预估灾害影响范围,并使用地名从该范围内筛选出数据的初始集。然后利用语言模型将该初始集过滤,筛选出与灾害主题相关的文本信息。再从筛选过的数据库中,提取出标签,并应用多种诱导法筛除非灾害信息标签。最终利用筛选出的与事件高度相关的标签检索推特全数据集,从而得到与特定事件相关的完整推特数据。 这种方法的设计是基于人们对于标签的选择,但是全面自动检索可以提取比手动检索更全面的初始集,这样可以使得研究数据的范围更广泛,从而减少潜在的数据偏移。以台风海燕为例,研究显示很多台风海燕研究人员未找到某些关键标签,导致与此关键标签相关的社会群体反应没有被纳入研究范围,这可能导致研究不够彻底,研究结果与事实相偏移。 该研究的第二阶段就是分析收集到的与海燕台风相关的数据,以确定灾害信息在全世界的分布情况。依据社交图谱的拓扑信息,把所有信息分成数个集合,并发现每个集合的中心节点分别与不同的传统媒体相关联。大多数集合都可以关联到特定的国家或地理区域,这种关联性可以通过推特用户地理编码数据空间分布及不同国家的用户的新闻偏好来证实。