论文部分内容阅读
在数据大爆炸的时代,随着数据量的激增,如何更快速地处理、使用这些规模大、复杂度高的数据成为迫在眉睫的问题。阐述了Spark的五大组件,研究了Spark数据处理应用和运行架构。Spark通过优化传统的MapReduce模型来满足之前HDFS以及MapReduce无法解决的问题,大大提高了效率,为处理流式数据以及其他需求提供了捷径。