基于Gensim的LDA主题模型分析在商品评价中的应用

来源 :电脑知识与技术 | 被引量 : 0次 | 上传用户:zz121961437
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
  摘要:目前在网上购物已成为大多数人的首选,避免购物途中的劳累并且也节约时间。文章基于LDA主题模型对电商平台商品的评论数据进行分析,得出用户正面评价和负面评价分别主要集中在哪些方面,并提出针对性的改进建议,从而提高商品的质量和用户体验。
  关键词:Gemsim;LDA;文本分析;主题模型;评价
  中图分类号:G642        文献标识码:A
  文章编号:1009-3044(2021)30-0017-03
  开放科学(资源服务)标识码(OSID):
  1引言
  随着信息技术的不断发展革新,线下物流业的蓬勃发展,人们在电商平台购物已成为生活的一部分。2020年中国网上零售额达11.76万亿元,同比增长10.9%,实物商品网上零售额达9.76万亿元,同比增长14.8%[1]。面对如此庞大用户群体、如此庞大的交易额,商家如何高效准确地获取客户反馈对提高销售量、提升客户满意度及提高服务质量显得尤为重要。因此课题从电商平台着手,获取海量用户对某一产品的评价,如好评、差评等,接着进行文本主题分析,得到该产品有哪些方面的优点和缺点,进而提供相关的改进建议。
  2 LDA主题模型
  2.1 文本分析
  文本分析是指对文本的表示及其特征项的选取,它把从文本中抽取出的特征词进行量化来表示文本信息。课题用数学的方法进行选取,找出最具分类信息的特征,这是一种比较精确的方法,尤其适合于文本自动分类挖掘系统的应用[2]。
  2.2 LDA的概念和方法
  LDA(Latent Dirichlet Allocation)是一种文档主题生成模型,也称为三层贝叶斯概率模型,包含词、主题和文档三层结构。LDA是一种非监督机器学习技术,可以用来识别大规模文档集或语料库中潜藏的主题信息,它采用了词袋的方法,这种方法将每一篇文档视为一个词频向量,从而将文本信息转化为了易于建模的数字信息[3]。课题主要应用Gensim库中的LDA模型。Gensim是一款开源的第三方Python工具包,用于从原始的非结构化的文本中,无监督地学习到文本隐藏层的主题向量表达。它支持包括TF-IDF,LSA,LDA,和word2vec在内的多种主题模型算法,支持流式训练,并提供了诸如相似度计算,信息检索等一些常用任务的API接口。
  3抓取笔记本电脑用户评论
  我们选取电商平台上一款销售量较高的笔记本电脑产品,查看“商品评论”可以看到分为好评、中评以及差评。在评论数据包含用户ID、商品名称、评论内容以及评论时间等。在数据抓取中我们可以使用“requests”库或者“Scrapy”爬虫框架来实现。
  我们编写程序抓取“好评”评论,对每条记录标记为“pos”,抓取“差评”,对每条记录标记为“neg”。抓取评论页数设置为50页。最终获取正面评论500条,负面评论360条。
  4 数据处理分析及LDA模型构建
  4.1 语料处理
  第一步是进行数据去重和删除笔记本电脑名称等无关词组。抓取到的数据是比较完整的,里面存在诸如商品名、商品型号等重复数据,我们需要对这些数据进行删除,保留能反映商品优缺点的评论内容。
  第二步是进行分词、删除标点符号和停用词。中文分词是中文文本处理的一个基础步骤,也是中文人机自然语言交互的基础模块,在进行中文自然语言处理时,通常需要先进行分词。在项目中我们引入jieba库,jieba分词算法使用了基于前綴词典实现高效的词图扫描,生成句子中汉字所有可能生成词情况所构成的有向无环图(DAG),再采用了动态规划查找最大概率路径,找出基于词频的最大切分组合。对于未登录词,采用了基于汉字成词能力的HMM模型,使用了Viterbi算法。下一步是去除停用词(Stop Words)。停用词被译为“电脑检索中的虚字、非检索用字”。在SEO 搜索引擎中,为节省存储空间和提高搜索效率,搜索引擎在索引页面或处理搜索请求时会自动忽略某些词,这些字或词即被称为停用词。停用词一定程度上相当于过滤词(Filter Words),区别是过滤词的范围更大一些,包含敏感信息的关键词都会被视作过滤词加以处理,停用词本身则没有这个限制。通常意义上,停用词大致可分为如下两类:一类是使用十分广泛,甚至是过于频繁的一些单词。另一类是文本中出现频率很高,但实际意义又不大的词。主要包括了语气助词、副词、介词、连词等,通常自身并无明确意义,只有将其放入一个完整的句子中才有一定作用的词语。经过分词后,评论由一个字符串的形式变为多个由文字或词语组成的字符串的形式,可判断评论中词语是否为停用词。根据上述停用词的定义整理出停用词库,对评论数据进行处理。
  最后一步是合并评论ID、评论中词的ID、词、词性以及评论类型成一张表,提取含有名词类的评论,最后将语料处理结果写入数据文件。
  4.2 文本情感分析
  情感倾向也称为情感极性。在商品评论中,情感倾向可以理解为用户对该商品表达自身观点所持的态度是支持、反对还是中立,即通常所指的正面情感、负面情感、中性情感。由于课题主要是对产品的优缺点进行分析,所以只要确定用户评论信息中的情感倾向方向分析即可,不需要分析每一评论的情感程度。
  首先我们建立负面评价词语、负面情感词语、正面评价词语以及正面情感词语四个文本库,用于我们进行目标文本分析的时候用于计算情感值。即正面评价词和正面情感词分值为1,负面评价词和负面情感词分值为-1;然后是根据否定词或双重否定对情感值进行修正;最后是去掉情感值为0的评论,并分别得到正面和负面的评论信息关键词。通过实验表明,在使用原始的正面负面文本库的情况下,假设不存在“好评”中给差评,和“差评”中给好评的情况,根据文本情感分析的正确率为0.8763326226012793,此时交叉矩阵如表3所示。   经过查看文本数据,发现较多正面评价词语被归到负面,或者一些情感词没有被归类到相应的类别,因此需要进行修正,即添加正面或负面评价词语到相应的文本库中,再次运行并得到正确率提高到0.955,此时交叉矩阵如表4所示。
  4.3 主题数寻优
  在这里我们引入Gensim库,使用doc2bow方法分别将每个正面评论或负面评论生成一个n维向量即语料库。应用基于相似度的自适应最优LDA 模型选择方法,确定主题数并进行主题分析。具体步骤如下:
  (1)选择初始主题数k 值,得到初始模型,计算各主题之间的相似度(平均余弦距离)。
  (2)增加或减少k 值,重新训练模型,再次计算各主题之间的相似度。
  (3)重复步骤2 直到得到最优k 值。
  利用各主题间的余弦相似度来度量主题间的相似程度。从词频入手,计算它们的相似度,用词越相似,则内容越相近。
  对正面评论和负面评论分别执行划分2~10个主题并计算计算主题平均余弦相似度,生成折线图如图1、2所示,从而确定最佳的主题数。
  从以图1和图2我们可以看出,对于正面、负面评论主题数我们分别选1个和2个较为合适。
  4.4 LDA主题模型分析结论
  根据主题数寻优结果,进行基于LDA的主题分析,打印前10个词组,正面评论生成1个主题,结果见表5,负面评论生成2个主题,结果见表6。
  通过主题分析我们可以看出,对于正面评论,相对是比较集中在运行速度快、外观等方面;负面评论有两个方面,首先是对产品总体评价差、开机慢、卡顿等,其次是客服、售后服务质量差,也存在散热等问题。
  5 结语
  课题通过对电商平台上一款笔记本电脑的正面评论和负面评论进行主题分析,得出相应的结论,具体指出用户正面评价、负面评价主要体现哪些方面,从而为产品制造商、电商平台服务等提出针对性的建议,从而提高产品的质量和平台的服务质量。
  参考文献:
  [1] 2020年全年网络零售市场发展情况[EB/OL].http://www.mofcom.gov.cn/article/i/jyjl/j/202101/20210103033716.shtml.
  [2] 曾祥坤,张俊辉,石拓,邵可佳. 基于主题提取模型的交通违法行为文本数据的挖掘[J].电子技术应用,2019(6):47-51.
  [3] 程元堃,蒋言,程光. 基于word2vec的网站主题分类研究[J]. 计算机与数字工程,2019(1):174-178.
  [4]张厚栋,徐爱民.基于LDA模型的电商用户评价分析[J].浙江万里学院学报,2020,33(6):91-96.
  [5] 张心悦. 生鲜农产品在线评论文本内容对消费者满意度的影响研究[D].哈尔滨工业大学,2020.
  [6] 陈俊宇. 基于文本挖掘的在線评论应用研究[D].湖北工业大学,2020.
  【通联编辑:王力】
其他文献
在去中心化的互联网时代背景下,媒体传播面临复杂情况。如何引导新兴媒体健康发展,实现传统电视媒体转型,平衡传播内容的主流价值、艺术诉求与娱乐功能,创作出让人民群众喜闻乐见的优质内容,成为影视行业面临的新课题。由顾亚奇所著的《视听传媒的内容生产与传播》一书从宏观观察、内容生产、融合传媒、制播新态四个部分,详细追踪了传媒发展从电视传播到全媒体时代的动态轨迹,揭示了媒体融合业态变革的内在逻辑,具有重要的理
期刊
随着媒体融合向纵深发展、网络空间日见清朗,传统媒体和自媒体、社交媒体的协同合作日见成效,新型主流媒体建设呈现更大的可为空间。特别在重大突发事件信息传播中,多元声音融合互动增强,网上网下多元主体的善治力量正在成为危机危急时刻城市管理者可以依赖的重要社会资源。在近期重大突发事件中,主流媒体的主力军作用与社交媒体和自媒体等相互呼应,争取到了全社会最广大的理解和支持,并且营造了建设性的舆论氛围,为救灾防灾
期刊
摄影作为一种科学与艺术相结合,且具有极高审美价值的艺术形式,是创造和记录的艺术。随着数字成像技术和现代技术的出现,以及文化观念的革新,摄影初始的艺术价值正在发生变化,摄影的意义和结构虽然受到越来越多的质疑,但是有关摄影理论的探索也丰富起来。由安妮·莱顿·马索尼、马尼·欣德曼所著的《当代摄影中的影像构建》一书对当代摄影中影像构建的发展历程进行了梳理和思考,从不同角度探讨了当代摄影中影像构建的方法。全
期刊
近年来,VR(Virtual Reality)作为互联网技术和多媒体技术融合发展的技术产物,已经成为自然科学领域和社会科学领域探讨的热门话题。学界关于VR的研究主要集中在传媒行业的应用前景上,以及警惕VR技术背后引发的伦理问题等。由刘宏宇、袁子涵所著的《未来已来:VR的商业开发与媒介传播》一书正是立足于这一研究基础,以VR技术的实质为根源,研究其发展脉络、媒介应用、商业前景、叙事特征。  基于媒介
期刊
伴随着世界各地孔子学院规模的不断壮大以及“一带一路”建设的高效推进,我国已逐步建成覆盖海外主要国家和地区的中华文化传播推广体系。中西方传播学思想的交流交融对于中华文化海外传播新视野的开创大有助益,因此我们应当结合华夏传播学和西方传播学相关理念,通过东西互鉴构建中西传播学对话情境。由谢清果等所著的《中华文化海外传播的新境界:中西传播思想的分野与对话》一书,在借鉴西方传播学成熟的学科分类基础上对中国文
期刊
摘要:高校智库是中国特色新型智库体系的重要组成部分,为政府决策和发展规划提供了精神动力与智力支撑。本文探析了融媒时代给新型高校智库发展带来的挑战,明确了高校智库影响决策、启迪大众的核心价值,提出了“学者+记者”“资源+数据”的智库研究创新方法,指明了研究热点与政府需求相结合、人才培养与多元应用情境相结合的智库人才培养路径,以期为新型高校智库建设提供借鉴。  关键词:媒体深度融合 高校智库 区域经济
摘要:在媒介融合时代,传播方式日益多样化,传媒产业融合转型加速,融合型传媒人才成为促进产业转型升级的重要支撑与保障。本文在分析融合型人才是传媒产业链重要支撑元素的基础上,基于“政校企”多元协同育人的视角,提出融合型传媒人才培养的实施路径。  关键词:融合型传媒人才 政校企合作 协同育人 培养路径  为紧扣国家软实力建设和文化繁荣发展需求、借势新一轮科技革命和传媒产业变革,以“多元共育、融合共赢”为
摘要:针对用户在养殖家庭植物因缺乏养殖经验而频频失败等问题,采用平台最新的机器学习技术,设计并实现一款基于平台集植物识别、健康检测、疾病预防多功能一体的App。通过大量植物图片数据集的训练,机器学习训练准确性达到73%,训练有效性达到65%,测试准确性达到72%,总体识别精准率在70%左右。系统能准确并高效地实现植物分类识别、植物相关信息获取以及植物健康检测功能,帮助用户更好地认识身边的植物,成为
摘要:家庭是孩子最直接受教育的地方,父母需要懂得深厚的知识和道理来为孩子的前程掌好舵,准父母有必要获得“合格父母”上岗证。该文旨在设计与实现了一个专为父母人群提供付费视频学习、试题测验等能帮助其获得“合格父母”认证的学习平台。该平台前端使用Vue.js搭建,后端使用Spring Boot+Spring Cloud+Mybatis-Plus等技术进行开发,从系统调试和试运行情况看,平台具有实用、可维
摘要:当数据中心云平台架构面临老化升级时,需要考虑资源利旧、兼容性、成本、效率等诸多因素,对整体架构重新进行设计。这里以甲骨文信息处理教育部重点实验室的数据中心为例,对已有的微软的SystemCenter架构问题和需求进行梳理,并与现有主流的VMware vSphere架构、微软Azure Stack架构以及超融合架构之间的兼容性、可拓展性、可行性等进行分析,对云平台架构的升级和多云架构管理提供一