离线和实时大数据开发实战 笔记二

1.HDFS 优势:(1) 处理超大文件(2)运行于廉价的商用机器集群上(3)高容错性和高可靠性,通过副本机制实现。(4)流式的访问数据,HDFS的设计建立在更多地响应」次写人、多次读写”任务的基础上,这意味着一个数据集一由数据源生成,就会被复制分发到不同的存储节点中,然后响应各种各样的数据分析任务请求。在多数情况下,分析任务都会涉及数据集的大部分数据,也就是说,对HDFS来说,请求读取整个数据集
相关文章
相关标签/搜索