20【在线日志分析】之记录一次Spark Streaming+Spark SQL的数据倾斜

时间 2021-01-09

原文原文链接

1.现象三台机器都有产生executor，每台都会产生tasks，但是其中只有一台的task有input数据，其他机器的tasks都没有数据。 2.猜想 2.1是不是数据倾斜? 是 2.2是数据量过大，group by时，导致key分布不均? 比如key1 有98万，key2有2万,那么shuffle时，肯定数据倾斜。但是我刚开始数据量不是很大，所以pass （就算数据量大，也很简单处理，一般

>>阅读原文<<