数据变化场景下的跨语言代码摘要任务研究

来源 :武汉理工大学 | 被引量 : 0次 | 上传用户:chenww275245962
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
源代码摘要旨在生成自然语言文本,用于描述代码的语义。该任务目前已是软件工程领域不可或缺的部分。尽管现存的方法以能很好地完成此项任务,但是此类模型主要受限于数据充足的背景,而缺乏对于小样本数据和跨语言场景下的讨论。这些模型在实际应用中存在2个问题:(a)训练样本需求大。大多数主流方法中都采用编码器-解码器结构,而此种结构严重依赖于大规模数据训练。而且在现实世界中,获取大样本的优质标记数据集的成本是难以接受的。这些现象通常导致训练数据不足以生成优质的模型。(b)模型泛化能力弱。在某个数据分布上训练的模型只能在具有相同数据分的数据集上得到较好的结果,而在不同数据分布上会得到不尽人意的结果。例如,如果在Python数据集上训练并在Ruby数据集上测试,得到的模型性能会远弱于直接在Ruby数据集上的模型。在本文中,致力于讨论数据变化场景下,跨语言代码摘要任务的研究。
  在大样本场景下,训练数据充足。模型能够在该数据集上训练并达到很好的性能,但是仍然面临问题(b)。为了解决该问题,提出一种多模态序列到序列模型(MM2Seq)。根据在大样本数据集Ruby-Full上的实验结果,MM2Seq在单语言任务中优于基线模型——在CIDER指标上有着优于最优基线模型65.36%的提升。而且,将MM2Seq作为基础模型,并利用微调(FT)和深度迁移强化学习(DTRL)作用于跨语言代码摘要任务。实验结果表面,在跨语言场景下,FT和DTRL优于基线模型和MM2Seq,但是差距不显著。
  在小样本跨语言代码摘要任务中,问题(a)和(b)同时存在,上述迁移学习模型在此场景下是不可行的。因此,通过结合模型无关的元学习(MAML)和MM2Seq,1)构造一个元学习器用于学习隐藏在其他数据中的共享知识;2)通过若干梯度下降后,使元学习器适应未知目标数据集。此种方法本质是通过引入多种外部数据量,增加模型的泛化能力。相较于一些最新的方案,元学习模型在此场景下仍能生成更优质的注释。在小样本数据集Ruby-1%上,MAML相较于FT和DTRL在CIDER指标上有着37.46%和18.62%的提升。此外,实验结果的样例分析和人为检验也能体现元学习在此种场景下的优势。为了进一步支持我们的观点,还在不同训练集比例的Ruby-X%数据集上运行实验,并发现:在训练数据变化的过程中,MAML模型在性能上始终优于其他方案。
  
其他文献
交通领域中的智能驾驶越发重要,对于减少交通事故,防止人员生命财产的损失具有重要意义。但是,传统的车辆智能行车系统存在着效率过慢,并且精度较低的问题。随着深度学习的落地,前方防碰撞预警系统(FCWS)可以在前方车辆距离过近时,及时发出警报,从而避免发生事故。前方防碰撞预警系统主要目的是实时检测前方车辆的距离,由两个重要的技术支撑:车辆检测与深度估计。车辆检测用于识别监测前方车辆,而深度估计负责计算与
学位
双边拍卖作为一种高效的资源分配机制,已经被股票市场、期货市场广泛使用,同时也被用于云计算等领域解决资源分配问题。当前一般存在多个双边拍卖市场相互竞争,市场通过制定高效的机制来提高分配效率吸引交易者进入市场交易。双边拍卖中市场定价策略对交易者的收益有着重要的影响,通过影响交易者的市场选择和报价策略从而影响市场竞争结果,所以市场定价策略在双边拍卖中有着较为重要的地位。又因为市场定价策略和交易策略相互影
学位
随着在线流媒体服务需求的飞速增长,如今视频流媒体平台变得越来越流行,用户对低延迟和高质量服务的需求越来越大。高度多样化的内容使得在边缘服务器缓存空间有限的情况下不可能将所有需要的内容都存储在边缘。因此,如何分配缓存资源来服务尽可能多的请求,同时进一步减少传递延迟和带宽使用量,并提高用户体验质量,成为亟待解决的问题。边缘服务器有限的覆盖范围、用户移动性和请求模式的高度不确定也给服务部署带来了新的挑战
近年来,物联网、云计算、边缘计算等技术发展迅速,越来越多的资源受限智能终端设备出现在人们的日常生活中,并被广泛应用在交通、能源、物流、医疗、智慧城市、娱乐和社交媒体等场景中。通过应用区块链技术,可以有效保障这些存在资源受限设备的场景中数据的安全性与隐私性。但区块链技术本身对资源有较大的需求,而资源受限设备上的计算、存储、带宽等资源并不丰富,难以负担区块链共识过程以及存储区块链账本所带来的开销,这就
水泥工业的智能化对水泥生产尤其是水泥熟料生产至关重要,由此将水泥熟料生产领域的知识信息化,构建一个水泥熟料生产领域的知识图谱是一个亟待解决的问题。由于水泥熟料生产领域的知识量巨大且涉及范围很广,在广泛研究、项目积累以及与领域专家讨论基础上,构建术语库并搜集水泥熟料生产领域的数据。结合搜集的水泥熟料生产领域的数据,进行实体识别和实体关系抽取来提取数据中的知识信息,再将提取的知识构建成水泥熟料生产领域
图像生成技术作为艺术创作的重要组成部分,一直以来是计算机视觉的研究热点。传统的非真实感绘制技术利用计算机图形学、图像滤波等方法自动或者半自动地完成图像生成任务,这类方法只能生成简单粗略的图像,在生成图像的细节上做得不够准确。随着深度学习的迅猛发展,神经网络给该领域带来了革命性的改变。得益于更充足的数据量、更复杂的数学模型和更深层的网络结构,基于深度学习的图像生成算法不仅能够生成更复杂逼真的自然图像
共享单车作为一种绿色低碳的出行方式,给人们的出行带来便利。然而,人们自由使用单车给共享单车的维护带来许多问题(例如单车损坏、运送到指定位置等)。因此,共享单车平台可能需要雇佣用户去完成单车维护任务,同时平台需要给予用户合理的报酬以激励用户完成任务。当存在多个用户竞争时,用户可能谎报任务完成成本或者任务完成概率等信息来获得更高的报酬,从而导致平台不能高效的分发单车维护任务。本文主要从两个方面解决此问
小麦是现今世界范围内的主要粮食作物之一。为了提高小麦产量,育种专家致力于发掘其基因型和表型之间的联系。现有的表型提取方法多依赖于手工方式,采集的数据量有限且效率低下。三维CT(Computed Tomography)成像具有成像精细、动态范围高和无损探测内部结构等优点,可以快速且无损地提取小麦的高通量表型。CT扫描出的三维图像具有数据量大且内容高度稀疏化的特点,给图像处理工作带来了不小的挑战。本文
随着无线通信技术的日益成熟以及智能终端的普及,基于位置服务的应用(LBS)得到了全面的发展。用户在进行位置服务相关的查询时,需要向LBS服务提供商提供用户自身的请求内容以及位置信息,因此用户的隐私存在泄漏的风险。基于位置服务的隐私保护问题已经成为学者们研究的一个热点。当前主流的位置隐私保护模型所存在的缺陷包含:点对点分布式模型结构(P2P)用户之间存在不可信任的问题,响应时间较长,反馈结果不精确;
学位
拼车出行作为一种经济的出行方式,吸引了越来越多的乘客使用。如何有效地将乘客的订单分配给合适的司机成为了关键问题。为了给予司机更加合理的报酬,激励司机提供拼车出行服务,本文将对拼车出行中订单分配和司机定价的机制进行研究。在拼车出行中,司机是理性的,且具有异质性(例如不同的司机具有不同的成本信息),并会通过策略性行为(例如虚假地揭露自己的成本信息)去获得更多的利润。司机的策略性行为会造成平台和司机的社
学位