【摘 要】
:
微博平台数据中含有大量反映用户情感喜恶的信息,对于涉及博文倾向性分析的应用尤为重要.现有的分析方法往往聚焦在博文情感的简单分类上,无法分析特定类型实体的微博倾向性.为解决微博倾向性分析问题,实现博文立场判定,采用半监督学习的方法,通过协同训练和主动学习,训练实体识别模型,并构建基于主成分分析的情感规则,提取句子的主成分,将口语化的文本规范化为指定格式.再利用指向性实体的正负面性、情感词的褒贬义及情感词充当的句子成分,实现情感分类的更深层次分析——立场判定.针对实际问题进行立场判定实验,在不同规模数据集上的
【机 构】
:
中国科学院信息工程研究所,北京 100193;国家计算机网络应急技术处理协调中心,北京 100085
论文部分内容阅读
微博平台数据中含有大量反映用户情感喜恶的信息,对于涉及博文倾向性分析的应用尤为重要.现有的分析方法往往聚焦在博文情感的简单分类上,无法分析特定类型实体的微博倾向性.为解决微博倾向性分析问题,实现博文立场判定,采用半监督学习的方法,通过协同训练和主动学习,训练实体识别模型,并构建基于主成分分析的情感规则,提取句子的主成分,将口语化的文本规范化为指定格式.再利用指向性实体的正负面性、情感词的褒贬义及情感词充当的句子成分,实现情感分类的更深层次分析——立场判定.针对实际问题进行立场判定实验,在不同规模数据集上的自对比实验和他比实验显示,随着标注实体的博文数量增加,模型对博文立场判断的正确率持续提升,而且所提方法判断博文立场的正确率显著高于对比方法,相较已有研究方法分别提高了2.79%和10.00%.
其他文献
通过将信息化管理手段合理应用到高校大学生日常管理中,不但能提升高校学生的管理水平,而且还能有效降低高校大学生日常管理的成本.本文通过具体论述信息化管理手段用于高校大学生日常管理中的便捷性,并根据实际情况提出信息化管理手段在高校大学生日常管理中的应用途径,全面提升高校大学生的日常管理水平.
随着网络社交媒体的快速发展,对舆情信息的传播模式进行分析成为研究热点.针对网络舆情传播模式分类任务中,小样本数据多路径生成分类正确率低的问题,提出了舆情传播领域知识图谱结构定义,建立了基于微博数据的舆情传播知识图谱与舆情传播分析任务数据集,使用GraphDIVA模型进行舆情传播模式分类,并在自建数据集中进行了舆情传播模式分类25样本测试实验.结果表明:模型在经过20轮训练后,分类正确率从76%提升到89.4%,说明GraphDIVA模型在减少训练次数、提升分类正确率方面具有更优的效果.
针对Android恶意软件检测特征选择中,对类间具有相同频率分布的特征过度关注而导致特征冗余问题,提出了一种Android恶意软件检测低冗余特征选择方法.利用Mann-Whitney检验方法选择出存在频率分布偏差的特征;通过外观比率间隔算法量化偏差程度和特征出现频率剔除低偏差和整体软件中低频使用的特征;结合粒子群优化算法和分类器检测效果得到最优特征子集.使用公开数据集DREBIN和AMD进行实验,实验结果显示,在AMD数据集上选择出了294维特征,进行特征选择后6种分类器的检测准确率提高了1% ~5%,在
模糊测试作为当前最有效的漏洞挖掘方法,不仅比其他漏洞挖掘技术更能应对复杂的程序,而且可扩展性很强.在数据量相对较大的测试中,模糊测试输入样本集存在质量低、冗余性高和可用性弱等问题.因此,对模糊测试输入样本集进行研究,提出了启发式遗传算法,借助0-1矩阵,通过启发式遗传算法对样本的执行路径进行选取和压缩,从而获得优化后兼顾样本质量的样本集最小样本集合,进而加快模糊测试的效率.实验结果表明:在没有损失的情况下,样本集精简后模糊测试的时间比精简前降低了22%,压缩率相比传统方案提升约40%.
不同场景下数据类型和脱敏需求的差异,使得传统的数据脱敏方法难以满足大数据背景下的用户隐私保护需求.如何实现异构大数据中敏感信息的精准定向、高效脱敏,从而更好地确保数据安全、可信和可用,是本领域的研究难点.提出了一种在异构大数据环境下,基于文本、图片、音频和数据库等异构数据的脱敏模型,并对4个关键模块进行了描述.通过脱敏数据预处理,实现不同应用场景下敏感数据的自动标注和分级设置.采用数据预脱敏处理方法,并从数据可用性、数据关联性、隐私保护度、时间和空间复杂度等5个维度进行脱敏效果评价,实现定制化脱敏策略.经
恶意代码对网络安全、信息安全造成了严重威胁.如何快速检测恶意代码,阻止和降低恶意代码产生的危害一直是亟需解决的问题.通过获取恶意应用的动态信息、构造异质信息网络(HIN),提出了描述恶意代码动态特征的方法,实现了恶意代码检测与分类.构建了FILE、API、DLL三类对象的4种元图,刻画了恶意代码HIN的网络模式.经过改进的随机游走策略,尽可能多地获取元图中对象节点的上下文信息,将其作为连续词包(CBOW)模型的输入,从而得到词向量的网络嵌入.通过投票方法改进主角度分析模型,得到多元图特征融合的分类结果.在
对需要存储在服务器端的用户文档进行加密是对用户隐私保护的根本方法.采用不同的保序加密算法对加密文档排序结果有着不同的影响,寻找排序结果最优的保序加密算法是亟待解决的问题.提出了基于鉴别信息的保序加密算法选择的标准,比较了2种保序加密算法下对加密文档排序的性能.在通过保序加密算法得到的密文分布接近明文分布的情况下,排序得到的结果更接近明文检索的情况.所提出的选择标准具有理论上的意义,同时也可以指导在相同安全条件下保序加密算法的选择,以达到最优的检索结果.
恶意代码克隆检测已经成为恶意代码同源分析及高级持续性威胁(APT)攻击溯源的有效方式.从公共威胁情报中收集了不同APT组织的样本,并提出了一种基于深度学习的恶意代码克隆检测框架,目的是检测新发现的恶意代码中的函数与已知APT组织资源库中的恶意代码的相似性,以此高效地对恶意软件进行分析,进而快速判别APT攻击来源.通过反汇编技术对恶意代码进行静态分析,并利用其关键系统函数调用图及反汇编代码作为该恶意代码的特征.根据神经网络模型对APT组织资源库中的恶意代码进行分类.通过广泛评估和与MCrab模型的对比可知,
随着智能电网的普及和大数据技术的发展,利用用电数据分析用户的用电行为越来越受到关注,现存的能源分解方法无法满足实际应用中对分辨率和分解准确率的高要求,以及聚类分析方法过于粗糙没有充分挖掘每类电器的用电特点.提出了基于能源分解的用户用电行为分析方法.在判别式稀疏编码算法模型的基础上,针对L0正则项不易求解、L1正则项稀疏约束效果不理想的问题,提出用L1/2正则项稀疏约束进行能源分解,并且把用户之间的同质性作为正则项加入基础模型来修正模型的性能.基于能源分解的结果,使用用户单类电器的用电特征代替总用电特征精细
针对智能电网嵌入式设备由于计算、存储资源有限而造成的对网络攻击行为应对不足,安全评估手段薄弱等问题,提出了面向智能电网嵌入式设备的网络攻击行为动态评估方法.使用安全控制模块对实际嵌入式设备通信数据流进行解析与判别,利用组件动态可信度量分析方法在嵌入式系统模拟机中对攻击行为安全影响进行安全检测评估,通过对平台配置属性、平台运行属性及用户认证属性3个方面属性进行全过程动态综合度量,得出最终网络攻击行为安全评估结果.通过在配电自动化及用电信息采集系统真实环境下进行测试,针对嵌入式设备常见的攻击行为,检测方法的准