Spark on Yarn 学习(一)

最近看到明风的关于数据挖掘平台下实用Spark和Yarn来作推荐的PPT,感受很赞,如今基于大数据和快速计算方面技术的发展很快,随着Apache基金会上发布的一个个项目,感受真的新技术将会不断出如今你们的面前.算法

做为技术发烧友,做为一个看客,来围观下,不过从PPT中列出来的技术来看,将来的发展趋势仍是说是有的,并且仍是颇有发展前景的. 如今Spark和Yarn也就发布2年多的时间,随着社区力量的跟上,不断的将以前的项目都放到一个更好的资源架构的整合上来实现.特别是放到内存上来实现,在速度和效率上仍是确实有区别于以前的其余技术.因此做为巨头之一的淘宝,就跟上的技术发展的趋势了.可是做为小公司而言,没有这样的大规模的机器部署的状况下,如何用利用好这些技术呢?编程

下面是PPT中记录的一些笔记和插图.算是对整个架构有一个出不的了解,接下来有时间就努力的去尝试下.架构

插上翅膀的大象 基于Spark on Yarn的淘宝数据挖掘平台并发

为何选择Spark On Yarn Spark On Yarn的原理和框架 淘宝在Spark On Yarn上作的工做 基于Spark On Yarn的数据挖掘平台架构框架

案例性能机器学习

Hadoop在数据挖掘遇到的问题 屡次迭代 
中介数据的序列化和反序列化 
简单的MR模式 vs 复杂的机器学习算法 
OO编程 vs 函数式风格 
图计算能力函数

Why Spark 
RDD 
内存计算 
快速迭代 
DAGoop

Scala 
FP编程 
Actor编程 
并发能力性能

Hadoop 
MapReduce 
HDFS访问学习

Spark的生态圈 Shark(Hive),Streaming(Storm),Mllib(Mahout),Graphx(GraphLab) 
Spark (MapReduce) 
Local Standalone Mesos Yarn HDFS HBASE

Yarn版本0.23.7 目前淘宝部署了 5000 * 2 的架构

Spark On Yarn 的框架 
Spark的生态圈 
image

Spark On Yarn的实现流程 
image

推荐系统的具体架构 
image

总结 粗略的了解下技术架构,接下来有时间的话,深刻的实际尝试下,搭建系统跑下svm等,体会下这个系统!

相关文章
相关标签/搜索