强-大数据第九讲

Spark基础oop

第一节:什么是Spark?Spark的特色和结构
一、什么是Spark?
Spark是一个针对大规模数据处理的快速通用引擎。
相似MapReduce,都进行数据的处理

二、Spark的特色:
(1)基于Scala语言、Spark基于内存的计算
(2)快:基于内存
(3)易用:支持Scala、Java、Python
(4)通用:Spark Core、Spark SQL、Spark Streaming
MLlib、Graphx
(5)兼容性:彻底兼容Hadoopspa

三、Spark体系结构:主从结构
(1)主节点:Master
(2)从节点:Workerblog

第二节:搭建Spark的伪分布模式环境
一、解压:tar -zxvf spark-2.1.0-bin-hadoop2.4.tgz -C ~/training/
二、配置参数文件: conf/spark-env.sh
export JAVA_HOME=/root/training/jdk1.7.0_75
export SPARK_MASTER_HOST=bigdata11
export SPARK_MASTER_PORT=7077

conf/slaves ----> 从节点的主机信息
bigdata11

三、启动Spark伪分布环境
sbin/start-all.sh

Spark Web Console: http://192.168.88.11:8080内存

 

示例图:hadoop

 

相关文章
相关标签/搜索