论文部分内容阅读
摘要:目前重复来电工单的识别主要采用人工逐条识别的方式进行,由于信息量巨大,内容非结构化等原因,造成效率低下、准确度低下,无法满足对热点、重点用电问题的识别需求,难以做出快速、准确的用电信息反馈,影响用电优质服务。本文通过提出基于重复来电工单文本的语义向量分析方法,实现自动化获取话务内容,高效、准确地识别重复来电工单,对准确有效地提高客服的服务质量具有重要意义。
关键词:重复来电工单;向量分析;人工神经网络模型;相似度模型。
随着电力行业的迅速发展带来的用电户的持续增加以及电力信息化系统建设的不断深入,电力客户话务服务已经是提升服务质量、精益化服务的重要方式。电力客户话务服务中,话务工单以文本的方式记录了用电户反映地数量庞大、内容复杂多样的用电信息。其中,尤以重复来电、多次反复反映同一用电问题的工单蕴含了重要的、用电户急需要解决的用电信息。因此,如何在工单文本中进行客户重复来电的识别及分析,准确理解反应地热点、重点用电问题是提高服务质量的关键。针对上述问题,本文对工单文本语义向量分析方法进行研究,实现自动化获取话务内容,高效、准确地识别重复来电工单。
1 重复来电工单业务描述
重复来电工单是同一户号或者同一电话号码对同一事件重复来电两次及以上的工单。同一事件是指工单受理内容字段中表述为相同事件或者相同事件所引发的一系列事件。根据不同的统计周期,不同统计类型,通过对工单受理内容的大数据挖掘分析,按重复事项、重复工单数、重复电话数、不同地域、以及不同来电原因进行统计挖掘分析。
2 工单文本语义向量分析研究
本文在对重复来电工单受理内容的分析过程中,首先进行数据清洗和预处理,剔除工单受理内容的文本为空或者格式不正确的工单。其次对工单内容进行向量分析,包括以下步骤:
(1)对客服来电进行语音识别,获取结构化工单文本信息,形成工单文本记录;
(2)将结构化工单文本记录存储到数据库,形成工单文本集合;
(3)从关系型数据库提取工单文本,对工单文本信息进行清洗、转换;
(4)对工单文本集合建立语义向量空间,进行工单文本向量化表示;
(5)对向量化后的工单建立相似度计算模型,进行相似度计算,根据计算结构确定重复来电工单;
(6)将计算确定后的工单结果进行可视展示及分析。
所述步骤(1)中,获取结构化工单文本信息包括(但不限于):客户编号、联系电话、供电公司、用电信息,以及用电户反映的其他信息。
所述步骤(2)中,数据库可以是关系型数据库,也可以是非关系型数据库。
优选地,关系型数据为Oracle关系型数据。
优选地,非关系型数据库为NoSQL非关系型数据。
所述步骤(3)中,对工单文本信息进行清洗方法是对无故挂断来电、测试来电和12345异常来电等工单文本进行删除;对工单文本信息进行转换方法是按照特定字段转换规则,对工单文本信息中相应字段进行转换。例如,对于“联系电话”字段中区号与电话号码信息以“区号-电话号码”形式规则进行转换。
所述步骤(4)中,工单文本向量化定义为:对工单文本集合S中的任意工单文本d,指定一个固定长度l的实值向量
称为工单文本d的向量化,l为文本向量的长度。本发明中特殊指定的经验值为l=35。
所述步骤(4)中,对工单文本信息建立语义向量化空间的方法包括:
(1)对工单文本信息进行切词处理,形成工单文本词袋模型;
(2)对切词后的文本信息中每个词w,将Context(w)取值为w前n-1个词的统计个数,则Context(w)构成一个训练样本。本发明中特殊指定的经验值为n=5;
(3)建立含有隐藏层的人工神经网络模型,隐藏层规模为(n-1)*l。
(4)实用含有隐藏层的人工神经网络模型对训练数据进行训练,得到训练工单文本向量
yw = (yw1,yw2,...,yw1)
(5)对工单文本向量进行softmax归一化
所述步骤(5)中,工单建立相似度计算模型为工单文本向量的夹角余弦表示
本发明中特殊指定的经验阈值cos(yw,yw)=0.85。
所述步骤(6)中,可视化展示方式包括(但不限于):大屏可视化展示化方式、PC端可视化展示方式、智能移动端可视化展示方式。
优选地,可视化展示方式为大屏可视化展示化方式。
3 有益效果
(1)通过语音识别自动获取工单文本,提高工单文本信息准确度,解决了人工录入工单文本造成的的信息丢失;
(2)利用自然语言处理技术,自动提取工单文本语义信息,能够反映用电户的用电问题及用电信息;
(3)通过工单向量化,构建重复工单计算方法,从海量工单文本中自动获取重复来电工单,计算时间短、分析效率高,为提升用电户满意度提供有效技术方法支撑。
4 结论
本文利用基于语义向量分析方法术,结合业务需求,对重复来电工单进行研究,缩短了分析计算时间,提高了分析效率。通过应用,提高了客服部门的工作效率,为客服管理人员作出决策提供技术支持,提高了用户的满意度。
(作者單位:山东鲁能软件技术有限公司1 国网宁夏电力公司运监中心2)
关键词:重复来电工单;向量分析;人工神经网络模型;相似度模型。
随着电力行业的迅速发展带来的用电户的持续增加以及电力信息化系统建设的不断深入,电力客户话务服务已经是提升服务质量、精益化服务的重要方式。电力客户话务服务中,话务工单以文本的方式记录了用电户反映地数量庞大、内容复杂多样的用电信息。其中,尤以重复来电、多次反复反映同一用电问题的工单蕴含了重要的、用电户急需要解决的用电信息。因此,如何在工单文本中进行客户重复来电的识别及分析,准确理解反应地热点、重点用电问题是提高服务质量的关键。针对上述问题,本文对工单文本语义向量分析方法进行研究,实现自动化获取话务内容,高效、准确地识别重复来电工单。
1 重复来电工单业务描述
重复来电工单是同一户号或者同一电话号码对同一事件重复来电两次及以上的工单。同一事件是指工单受理内容字段中表述为相同事件或者相同事件所引发的一系列事件。根据不同的统计周期,不同统计类型,通过对工单受理内容的大数据挖掘分析,按重复事项、重复工单数、重复电话数、不同地域、以及不同来电原因进行统计挖掘分析。
2 工单文本语义向量分析研究
本文在对重复来电工单受理内容的分析过程中,首先进行数据清洗和预处理,剔除工单受理内容的文本为空或者格式不正确的工单。其次对工单内容进行向量分析,包括以下步骤:
(1)对客服来电进行语音识别,获取结构化工单文本信息,形成工单文本记录;
(2)将结构化工单文本记录存储到数据库,形成工单文本集合;
(3)从关系型数据库提取工单文本,对工单文本信息进行清洗、转换;
(4)对工单文本集合建立语义向量空间,进行工单文本向量化表示;
(5)对向量化后的工单建立相似度计算模型,进行相似度计算,根据计算结构确定重复来电工单;
(6)将计算确定后的工单结果进行可视展示及分析。
所述步骤(1)中,获取结构化工单文本信息包括(但不限于):客户编号、联系电话、供电公司、用电信息,以及用电户反映的其他信息。
所述步骤(2)中,数据库可以是关系型数据库,也可以是非关系型数据库。
优选地,关系型数据为Oracle关系型数据。
优选地,非关系型数据库为NoSQL非关系型数据。
所述步骤(3)中,对工单文本信息进行清洗方法是对无故挂断来电、测试来电和12345异常来电等工单文本进行删除;对工单文本信息进行转换方法是按照特定字段转换规则,对工单文本信息中相应字段进行转换。例如,对于“联系电话”字段中区号与电话号码信息以“区号-电话号码”形式规则进行转换。
所述步骤(4)中,工单文本向量化定义为:对工单文本集合S中的任意工单文本d,指定一个固定长度l的实值向量
称为工单文本d的向量化,l为文本向量的长度。本发明中特殊指定的经验值为l=35。
所述步骤(4)中,对工单文本信息建立语义向量化空间的方法包括:
(1)对工单文本信息进行切词处理,形成工单文本词袋模型;
(2)对切词后的文本信息中每个词w,将Context(w)取值为w前n-1个词的统计个数,则Context(w)构成一个训练样本。本发明中特殊指定的经验值为n=5;
(3)建立含有隐藏层的人工神经网络模型,隐藏层规模为(n-1)*l。
(4)实用含有隐藏层的人工神经网络模型对训练数据进行训练,得到训练工单文本向量
yw = (yw1,yw2,...,yw1)
(5)对工单文本向量进行softmax归一化
所述步骤(5)中,工单建立相似度计算模型为工单文本向量的夹角余弦表示
本发明中特殊指定的经验阈值cos(yw,yw)=0.85。
所述步骤(6)中,可视化展示方式包括(但不限于):大屏可视化展示化方式、PC端可视化展示方式、智能移动端可视化展示方式。
优选地,可视化展示方式为大屏可视化展示化方式。
3 有益效果
(1)通过语音识别自动获取工单文本,提高工单文本信息准确度,解决了人工录入工单文本造成的的信息丢失;
(2)利用自然语言处理技术,自动提取工单文本语义信息,能够反映用电户的用电问题及用电信息;
(3)通过工单向量化,构建重复工单计算方法,从海量工单文本中自动获取重复来电工单,计算时间短、分析效率高,为提升用电户满意度提供有效技术方法支撑。
4 结论
本文利用基于语义向量分析方法术,结合业务需求,对重复来电工单进行研究,缩短了分析计算时间,提高了分析效率。通过应用,提高了客服部门的工作效率,为客服管理人员作出决策提供技术支持,提高了用户的满意度。
(作者單位:山东鲁能软件技术有限公司1 国网宁夏电力公司运监中心2)