大数据文件格式梳理:Parquet、Avro、ORC

扫描优化的列存储格式,默认是parquet 写优化的行格式,默认是avro Parquet、Avro、ORC格式 相同点 基于Hadoop文件系统优化出的存储结构 提供高效的压缩 二进制存储格式 文件可分割,具有很强的伸缩性和并行处理能力 使用schema进行自我描述 属于线上格式,可以在Hadoop节点之间传递数据   不同点 行式存储or列式存储:Parquet和ORC都以列的形式存储数据,而
相关文章
相关标签/搜索