论文部分内容阅读
将短文本信息流中的信息根据其所属的会话分检到多个队列,是网络聊天、微博等文本数据挖掘的重要组成部分.现有的会话抽取技术主要对基于文本相似度的聚类方法进行改进,无法应对短文本信息流的特征稀疏性、奇异性和动态性等挑战.针对这些挑战,本文首先利用信息流的时序特征,基于信息产生频率检测会话边界;其次定义了信息间的上下文相关度,采用基于实例的机器学习方法计算此相关度;最后提出了基于时序特征和上下文相关度的在线会话抽取算法SPpc.真实数据集上的实验表明,SPpc算法相比已有的基于文本相似度的改进方法,F1评测指标提高了30%.