Hive实践分享之存储和压缩的坑

大家都知道,由于集群资源有限,我们一般都会针对数据文件的「存储结构」和「压缩形式」进行配置优化。在我实际查看以后,发现集群的文件存储格式为Parquet,一种列式存储引擎,类似的还有ORC。而文件的压缩形式为Snappy。具体的操作形式如下: ① 创建Parquet结构的表(Hive 0.13 and later): CREATE TABLE CRM.DEMO(A INT) STORED AS P
相关文章
相关标签/搜索