Spark性能优化:Shuffle性能优化

new SparkConf().set(“spark.shuffle.consolidateFiles”, “true”)web

spark.shuffle.consolidateFiles:是否开启shuffle block file的合并,默认为false缓存

spark.reducer.maxSizeInFlight:reduce task的拉取缓存,默认48msvg

spark.shuffle.file.buffer:map task的写磁盘缓存,默认32k性能

spark.shuffle.io.maxRetries:拉取失败的最大重试次数,默认3次spa

spark.shuffle.io.retryWait:拉取失败的重试间隔,默认5sxml

spark.shuffle.memoryFraction:用于reduce端聚合的内存比例,默认0.2,超过比例就会溢出到磁盘上blog

原理图:

开启consolidation机制以后对磁盘io性能的提高的原理内存


没有开启consolidation机制的性能低下的原理剖析it