基于Spark的机器学习平台设计与实现

被引量 : 0次 | 上传用户:wangxinyi808
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
随着云计算与分布式集群技术的发展,大数据概念在容量、价值等方面都有了更广的扩展和延伸,机器学习技术近年来也得到了前所未有的重视。本文主要针对传统数据挖掘算法无法处理海量数据,近年来比较流行的MapReduce对机器学习算法不能有效并行化运行等问题,提出基于Spark来构建一个用于大规模机器学习的平台,该平台不仅能够兼容Hadoop集群利用现有计算资源灵活高效地处理海量数据,而且还具有良好的可扩展性,能够满足各类机器学习任务场景的需求。本文完成了如下几个方面的工作:论文主要针对机器学习任务中的常见场景,基于Spark平台设计和实现了其中经典的算法,包括并行化的线性回归、支持向量机、KMeans聚类算法,基于图计算模型抽象的矩阵分解、PageRank算法,以及数据流KMeans聚类算法。算法工作均以大规模机器学习的相关基础理论为有效支持,充分体现平台的运行效率和可扩展性;在算法设计过程中,本文针对大数据场景对经典算法进行一些改进优化工作。例如,基于集成学习理论方法,采用Bagging策略来提高模型的稳定性;为了提升计算效率,引入了基于采样的子梯度模型优化方法;为适应海量数据下评分数据矩阵特别稀疏的问题,提出基于图计算模型的矩阵分解算法。另外,在实现经典机器学习算法时,采用面向对象的设计思路,利用工厂和策略等设计模式来层次封装,方便平台扩展更多的功能和算法。平台遵循Lambda架构设计,分成三个层次,分别是:批量数据层、服务层以及数据流层。批量数据层主要采用Spark和Hadoop混合设计,完成对大批数据的批量建模;服务层对批量数据层的模型进行索引,以应对实时的并发请求;数据流层主要针对流式数据场景,完成数据的实时建模。请求将结合对数据的批量建模和实时建模,合并输出最终结果。最后,在平台的实验结果评估中,论文就本文工作分别对比了串行算法、基于Hadoop平台实现的算法,在运行时间、加速比以及吞吐量等实验中都有着突出的性能表现,证明了本文工作的有效性与实用性。
其他文献
本文以D公司浙江分公司2007年——2013年公布的交强险财务数据及中国保险行业协会公布的同期交强险财务数据为基础,采用统计分析的方法,从近年来D公司浙江分公司交强险业务的
党的十七大明确提出了“把城乡社区建设成为管理有序、服务完善、文明祥和的社会生活共同体”的目标要求,随着改革开放和社会主义市场经济的深入发展,社会经济成分、组织形式
鄂尔多斯盆地北部塔巴庙地区上古生界致密砂岩气藏的低孔、低压、低渗特点给开发带来了相当大的难度。天然裂缝的存在对致密砂岩气藏经济开发意义重大,致密砂岩中裂缝发育层
偏航控制系统作为水平轴式风力发电机组中必要的组成部分之一,不仅能提供必要的锁紧力矩,有效保障了风力发电机组在对风动作后的安全定位运行,而且可以使风力发电机组的风轮
随着社会经济地快速发展,为了迎合现代都市商业化,并且更好地表达出城市的文化底蕴,很多城市的商业街都开始按照中式古典风格进行仿造。但是由于在改造过程中,没有较为统一的
2006年9月8日,我国首个金融期货交易所——中国金融期货交易所,简称中金所,在我国的东方明珠正式挂牌成立,次月,以沪深300指数为标的的沪深300指数期货仿真交易随即推出。沪
企业全面质量管理能够使地铁企业运营成本大幅度降低,服务质量大为提升,员工满意度得以提升和自主化管理意识增强。其基本思路是以顾客为中心,围绕顾客服务的目标,建立以全面
董事勤勉义务判断标准是判断董事是否勤勉尽责的标准,是勤勉义务制度的核心。而勤勉义务判断标准主要分为两个部分:勤勉义务内容和勤勉义务行为标准,其中前者为后者的逻辑前提
目的观察复方苦参注射液联合氟他胺治疗晚期前列腺癌的疗效、NK细胞活性和生活质量。方法将50例前列腺癌患者随机分为对照组和观察组,每组各25例。两组患者均采用氟他胺治疗,
进入二十一世纪,互联网正在悄悄的改变着我们所处的这个世界,它已经无所不在的渗入我们的生活,改变着我们的行为方式,也改变着商业的规则。任何一个行业,都不可避免的或多或