本章将介绍为何要学习大数据、如何学好大数据、如何快速转型大数据岗位、本项目实战课程的内容安排、本项目实战课程的前置内容介绍、开发环境介绍。同时为你们介绍项目中涉及的Hadoop、Hive相关的知识html
Spark做为近几年最火爆的大数据处理技术,是成为大数据工程师必备的技能之一。本章将从以下几个方面对Spark进行一个宏观上的介绍:Spark产生背景、特色、发展史、Databricks官方调查结果、Spark与Hadoop的对比、Spark开发语言及运行模式介绍 ...编程
工欲善其事必先利其器,本章讲述Spark源码编译、Spark Local模式运行、Spark Standalone模式运行架构
Spark SQL面世已来,它不只接过了Shark的接力棒,继续为Spark用户提供高性能SQL on Hadoop解决方案,还为Spark带来了通用、高效、多元一体的结构化数据处理能力。本章将从Spark SQL前世此生、SQL on Hadoop框架、Spark SQL概述、愿景、架构,这几个角度进行展开讲解...框架
Hive是SQL-on-Hadoop的解决方案和默认的标准,如何将数据处理从Hive过渡到Spark SQL上来是咱们必需要掌握的。本章咱们将讲解在Spark中操做Hive中的数据几种方式oop
DataFrame&Dataset是Spark2.x中最核心的编程对象,Spark2.x中的子框架可以使用DataFrame或Dataset来进行数据的交互操做。本章将从DataFrame的产生背景、DataFrame对比RDD、DataFrame API操做等方面对DataFrame作详细的编程开发讲解性能
Spark SQL中的核心功能,可使用外部数据源很是方便的对存储在不一样系统上的不一样格式的数据进行操做。本章将讲解如何使用外部数据源来操做Hive、Parquet、MySQL中的数据以及综合使用学习
本章将讲解Spark的愿景:写更少的代码、读更少的数据、让优化器自动优化程序大数据
本章使用Spark SQL对慕课网主站的访问日志进行各个维度的统计分析操做,涉及到的过程有:数据清洗、数据统计、统计结果入库、数据的可视化、调优及Spark on YARN。经过本实战项目将Spark SQL中的知识点融会贯通,达到触类旁通的效果 ...优化
本章将列举Spark SQL在工做中常常用到的方方方面的总结spa