Spark计算模型RDD

RDD概念及特征: RDD(Resilient Distributed Daraset)叫做弹性分布式数据集,是spark中最基本的数据抽象,它代表一个不可变、可分区,里面的元素可并行计算的集合。RDD具有数据流模型的特点:自动容错,位置感知性调度和可伸缩性。RDD允许用户在执行多个查询时显示地将数据还存在内存中,后续的查询能够重用这些数据,这极大的提升了查询速度。 弹性分布式数据集合,并且是sp
相关文章
相关标签/搜索