SQL到SPARK查询优化机制研究

来源 :东南大学 | 被引量 : 7次 | 上传用户:hll10
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
随着互联网的飞速发展以及各类新型互联网应用的普及,企业与研究机构面临的数据规模已经高速膨胀到了TB级乃至PB级。近些年来,伴随着内存价格的下降,为了进一步提升大数据处理性能,基于内存的存储与计算逐步成为新的热点。Spark作为其中的代表,以弹性分布式数据集RDD为核心,实现了一个轻量高速可拓展的分布式内存计算框架。然而当前Spark上层的高级查询工具Spark SQL的查询翻译没有针对多查询进行优化,批处理提交SQL查询语句被翻译为不同的Spark作业,作业之间无法共享数据,无法充分发挥Spark内存计算的优势。本文针对Spark SQL存在的问题,对SQL到Spark作业查询优化机制进行了研究。本文深入分析了Spark SQL的工作流程,结合SQL查询的特点,在底层持久化文件系统与Spark核心间加入存储中间层以解决查询间输入数据的共享问题,并在复用现有分布式文件系统设计的基础上,通过合理的内存资源分配、高效的数据存储结构、低消耗的容错恢复设计优化查询数据的输入过程。在此基础上,引入多查询任务数据管理模块对存储中间层进行管理,通过介入查询任务,实现数据的一次载入、多次使用、及时释放,并针对数据载入存储中间层时面临的数据载入节点选择问题,提出了基于代价模型的数据载入节点选择策略,建立了Spark作业执行代价的数学模型,对查询作业的耗费进行预估,基于代价模型选择适当的数据载入节点,实现集群资源的高效利用,提高系统运行的效率,加快查询任务的执行速度。本文在现有Spark SQL的基础上进行改进,开发了SQL2Spark系统,实现了上述功能。通过搭建实验平台,使用基准测试工具TPC-H生成测试数据,与现有的Spark SQL就查询性能进行分析比较。实验结果表明,改进后的SQL2Spark系统能够有效提高查询速度,减少磁盘I/O开销,降低内存占用,具有明显的优势。
其他文献
伴随着Web2.0的不断发展,互联网上论坛、社区、博客、评论专栏等互动平台中的评论信息迅速增长,这些网络评论反映了人们对于特定产品,事件、政策的态度,其社会影响力越来越大。研
随着视频电话等多媒体应用的增多和无线通讯设备的推广,在无线Ad Hoc网络上传输多媒体业务具有良好的应用前景。传输多媒体业务需要网络提供服务质量(QoS)保证,要求在网络中
随着图像处理技术迅猛发展,人们能够更好治疗某些疾病以及愈后恢复情况的及时监控,从而使得诊疗水平得到极大的改善。图像计算机系统的建立,可以对眼底很多组织进行定量测量
随着Web服务的发展和网络上的数据量呈几何式的增长,人们认识到将关系数据库和信息检索的技术融合到一起可以给用户提供更高效的信息检索服务。论文讨论了在关系数据库上进行
基于系统工程方法,使用数据挖掘聚类方法,对大学生心理健康做详细的分析和研究。本文阐述了聚类分析算法的发展和应用,应用了聚类分析中常用的距离公式和聚类的准则函数,并对
随着习近平主席“一带一路”战略构想的提出,与此同时,国内电子商务迅猛发展,我国的物流产业也随之进入高速发展期。但是目前物流的组织化程度低、配送路径不佳等直接关系到
在基于构件开发的软件工程 (CBSE)中,许多大型的、复杂的软件系统是在一个基本系统的基础上,通过组装机制将构件插入到基本系统中的。这样的开发模式大大提高了软件的生产效率
人类进入信息社会以后,信息技术迅猛发展,电子商务和电子政务自诞生之日起就发挥了重要作用。如今,电子商务和电子政务的发展方兴未艾,他们的开发框架也在不断地革命和更新。
在网络和数据库飞速发展的今天,数据的查找愈来愈频繁,数据量亦愈来愈大,采用一种有效的结构来处理这些数据也就显得非常的迫切。在数据表示方面,树型结构因具有分支性和层次
ESB平台己被广泛应用于企业信息化集成中,现有的监控系统却未能同步发展,不能同时监控服务层、服务器层和硬件层,不能实现监控规则动态部署机制,且不能对运行异常场景进行实