强-大数据第九讲

时间 2019-12-10

标签数据第九繁體版

原文原文链接

Spark基础oop

第一节：什么是Spark？Spark的特色和结构
一、什么是Spark？
Spark是一个针对大规模数据处理的快速通用引擎。
相似MapReduce，都进行数据的处理

二、Spark的特色：
（1）基于Scala语言、Spark基于内存的计算
（2）快：基于内存
（3）易用：支持Scala、Java、Python
（4）通用：Spark Core、Spark SQL、Spark Streaming
MLlib、Graphx
（5）兼容性：彻底兼容Hadoopspa

三、Spark体系结构：主从结构
（1）主节点：Master
（2）从节点：Workerblog

第二节：搭建Spark的伪分布模式环境
一、解压：tar -zxvf spark-2.1.0-bin-hadoop2.4.tgz -C ~/training/
二、配置参数文件: conf/spark-env.sh
export JAVA_HOME=/root/training/jdk1.7.0_75
export SPARK_MASTER_HOST=bigdata11
export SPARK_MASTER_PORT=7077

conf/slaves ----> 从节点的主机信息
bigdata11

三、启动Spark伪分布环境
sbin/start-all.sh

Spark Web Console: http://192.168.88.11:8080内存

示例图：hadoop