Spark Streaming 调优指南

时间 2019-11-08

标签 spark streaming 指南栏目 Spark 繁體版

原文原文链接

SparkStreaming是架构在SparkCore上的一个“应用”，SparkStreaming主要由DStreamGraph、Job的生成、数据的接收和导入以及容错四大模块组成，咱们今天就从这四大模块入手，看看每一个模块都有什么样的调优方式缓存

1 DStreamGraph

其实这部分主要是算子的使用优化，这个跟Spark调优的内容是相同，在这一部分能够优化的内容有架构

重复使用的rdd进行cache
使用高性能的算子代替性能差的算子
- reduceByKey\aggregateByKey代替groupByKey
- 使用mappartition代替map
- 使用foreachpartition代替foreach
使用Kryo序列化代替Java序列化
filter以后使用coalesce减小小任务

2 Job的生成

这一部分主要涉及到的调优是batchInternal的调整，为了程序不延迟地执行，合理的batchInternal是必要的app

3 数据的接收和导入

这一部分主要是针对数据的接受速度进行调优，若是接收速度大于处理数据，那么程序会走向无限延迟最后崩溃的道路,因此主要的调优在于限速框架

对于receiver和direct approach 方式都通用的
spark.streaming.backpressure.enabled=true; sparkstreaming框架会自动地计算处理速度来控制数据的接受速度，建议开启性能
receiver方式
- spark.streaming.receiver.maxRate 来进行限速
- spark.streaming.blockInternal 设置缓存在内存块的大小，防止内存被撑爆
direct approach方式
- spark.streaming.kafka.maxRatePartition来对每一个分区进行限速

4 容错

主要是数据的容错方式选择优化

热备：默认开启数据备份数为2
冷备：开启WAL，将log保存到HDFS上，executor挂掉后能够从hdfs上进行数据的恢复
重放：对于数据源自己支持重放有效，如Kafka，失效后能够经过offset值进行恢复

相关文章

相关标签/搜索

streaming+redis

streaming+kafka

Java性能优化指南

网站建设指南

每日一句

每一个你不满意的现在，都有一个你没有努力的曾经。

最新文章

本站公众号

欢迎关注本站公众号,获取更多信息

相关文章

>>更多相关文章<<