Spark广播变量和累加器详解

1、概述 在spark程序中,当一个传递给Spark操做(例如map和reduce)的函数在远程节点上面运行时,Spark操做实际上操做的是这个函数所用变量的一个独立副本。这些变量会被复制到每台机器上,而且这些变量在远程机器上的全部更新都不会传递回驱动程序。一般跨任务的读写变量是低效的,可是,Spark仍是为两种常见的使用模式提供了两种有限的共享变量:广播变(broadcast variable)
相关文章
相关标签/搜索