spark中RDD的宽依赖和窄依赖

宽依赖与窄依赖 窄依赖是指父RDD的每个分区只被子RDD的一个分区所使用,子RDD一般对应父RDD的一个或者多个分区。(与数据规模无关)不会产生shuffle。 下面的join也是窄依赖,虽然有两个父RDD,但是两个 RDD中每个分区都被一个子RDD的分区使用,即使父RDD的分区里面的内容并没有让子RDD的一个分区使用。 宽依赖指父RDD的多个分区可能被子RDD的一个分区所使用,子RDD分区通常对
相关文章
相关标签/搜索