无监督和有监督的短文本相似度研究及应用

来源 :南京邮电大学 | 被引量 : 0次 | 上传用户:qwedddessf
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
随着搜索引擎、社交网络以及聊天机器人等应用场景的发展和普及,短文本相似度计算在信息检索、文本分类、智能问答和机器翻译等研究和应用中发挥着重要的作用。传统的文本向量化方法更加适用于长文本,对于稀疏、高噪音的短文本不能达到满意的效果。近年来,随着神经网络语言模型的广泛应用,文本信息处理方式可以从传统的高维稀疏向量空间转化成低维词向量空间,这为短文本相似度计算提供新的思路。本文提出了一种无监督的短文本相似度计算方法,将Earth Mover’s Distance(EMD)求解线性规划中运输问题的最优解应用于度量两个短文本的相似度,用Word2Vec度量单词的语义距离,提出了词序位置相似度的概念,即在EMD模型单词移动中考虑单词的相对位置关系,使得最终的短文本相似度计算模型在k近邻文本分类任务中具有较高的准确率、召回率和F1值。同时提出了一种有监督的短文本相似度计算方法,构建两个垂直方向完全一样的Convolutional Neural Networks(CNN)模型,将基于Word2Vec短文本语义扩展矩阵作为CNN输入,经过全连接层处理产生高级语义向量,最后激活层采用Sigmoid输出属于某类的概率,用于判别短文本是否相似。并将短文本相似度计算模型应用于“Quora Question Pairs”数据集上,取得了较好的实验效果。本文将短文本相似度计算方法应用于运营商网络故障工单质检任务中,设计了基于短文本相似度计算的工单质检流程,开发了基于BS架构的工单智能质检系统。实际的运行结果表明本系统的性能可以较好地满足运营商日常的质检需求。
其他文献
动态目标检测与跟踪是智能监控系统的重要组成部分,它融合了图像处理、模式识别、自动控制及计算机应用等相关领域的先进技术和研究成果,是计算机视觉和图像编码研究领域的一个
随着网络的飞速发展,互联网上信息资源的数量急剧增加,为了从海量的数据中挖掘出有用信息,搜索引擎作为网络信息检索的主要工具迅速产生并发展起来。然而,任何一个搜索引擎都
随着Internet的发展,网上的信息量在飞速的增长。同时,信息的内容也逐渐多样化,各式各样的内容涌现到网民面前,其中不免有些不良和不安全信息的存在。如何有效的从众多的信息
支持向量机(SVM)是建立在统计学习理论(SLT)的VC维理论和结构风险最小原理基础上的一种新的通用学习方法,它根据有限的样本信息在模型的复杂性和学习能力之间寻求最佳折衷,以
随着数码照相机、计算机、平板、智能手机等设备的全面普及,在我们的日常生活和工作中常常与大量的多媒体影像、图像打交道,时常需要对其进行抠图处理,人们对于抠图方式的简
蛋白质的生物功能是由它们的空间折叠结构决定的,理解蛋白质的折叠过程是生物信息学领域中极具挑战性的问题之一。近年来,许多研究者从事蛋白质简化模型的研究,这些模型基于
本文对基于旋转平台的物体表面三维重建方法进行了研究。我们的测量装置由一个旋转平台和一台固定的摄像机组成,物体可随旋转平台旋转运动,摄像机固定不动。对该系统进行研究,具
入侵检测作为一种积极主动的安全防护技术,它不仅能检测未经授权的对象对系统的入侵,而且也能监视授权对象对系统资源的非法使用。随着因特网应用的日益普及,基于网络的入侵
随着信息技术的不断发展,软件复用和软件构件化越来越受到业界的广泛关注。当前的构件技术还是存在许多需要进一步改善的地方,譬如传统的构件描述与检索方式,由于缺乏丰富的构件
支持向量机(Support Vector Machine, SVM)作为近年来发展迅速的一种新型的、基于机器学习的一种模式识别算法,具有很好的推广能力,使其应用于多个不同的领域中。目前,SVM分