速度快，性能好！压缩神器 zstd

时间 2021-02-28

标签 html git github 算法并发 app 工具 post 性能学习栏目系统性能繁體版

原文原文链接

工具介绍

主要介绍 zstd 工具的做用和性能测试html

咱们称 Zstandard 或 Zstd 是一种快速的无损压缩算法，是针对 zlib 级别的实时压缩方案，以及更好的压缩比。它由一个很是快的熵阶段，由 Huff0 和 FSE 库提供。这个项目是做为开源的 BSD 许可收费的库，以及一个生成和解码 .zst 格式。git

性能测试对比

Zstd 还能够压缩速度为代价提供更强的压缩比，Speed vs Rtrade 能够经过小增量进行配置。在全部设置中，解压速度保持不变，并在全部 LZ压缩算法( 好比 zlib 或者lzma) 共享的属性中保持不变。github

之前的压缩方式，都是适用于典型文件和二进制的压缩方案( MB/GB)的状况。然而，要压缩的数据量越小，压缩就越困难。这是全部压缩算法都存在的问题，缘由是压缩算法从过去的数据中学习如何压缩将来的数据。可是在一个新的数据集的开始，没有“过去”能够参考。算法

为了解决这种状况，Zstd 提供了一种新的训练模式，可使用这种模式对所选数据类型的算法进行调优。训练 Zstandard 是经过提供一些样本(每一个样本一个文件)来实现的，训练的结果存储在称为“字典”的文件中，该文件必须在压缩和解压缩以前加载。使用此字典，能够在小数据上实现的压缩率大大提升。并发

如下示例，使用由 github 公共 API 建立的 github 用户示例集。它由大约 10K 条记录组成，每条记录 1KB 左右。app

小数据压缩的案例

若是在一组小的数据样本中存在某种相关性，那么训练就是有效的。一个字典的数据越具体，它的效率就越高(没有通用字典)。所以，为每种类型的数据部署一个字典将带来最大的好处。字典增益在前几个 KB 中最有效。而后，压缩算法将逐步使用先前解码的内容，以更好地压缩文件的其他部分。工具

字典压缩使用示例

# 训练字典
$ zstd --train FullPathToTrainingSet/* -o dictionaryName
# 用字典压缩
$ zstd -D dictionaryName FILE
# 用字典解压缩
$ zstd -D dictionaryName --decompress FILE.zst

提供客户端工具

参数命令

主要介绍 zstd 工具的安装和所有的参数命令post

安装方式

# Ubuntu
$ apt install zstd
# CentOS
$ yum install zstd
# 编译安装
$ git clone https://github.com/facebook/zstd.git
$ cd zstd; make; sudo make install

参数性能

$ zstd --help
使用方式 :
      zstd [args] [FILE(s)] [-o file]

参数选项 :
 -#     : 压缩级别(1-19，默认值为3)
 -d     : 解压
 -D file: 使用文件做为字典
 -o file: 结果存储在文件中
 -f     : 在没有提示的状况下覆盖输出并(解压)压缩连接
--rm    : 成功解压缩后删除源文件
 -k     : 保存源文件(默认)
 -h/-H  : 显示帮助/长帮助并退出

高级选项 :
 -V     : 显示版本号并退出
 -v     : 详细模式
 -q     : 静默输出
 -c     : 强制写入标准输出
 -l     : 输出zstd压缩包中的信息
--ultra : 启用超过19级，最多22级(须要更多内存)
 -T#    : 使用几个线程进行压缩(默认值:1个)
 -r     : 递归地操做目录
--format=gzip : 将文件压缩为.gz格式
 -M#    : 为解压设置内存使用限制

字典生成器 :学习

--train ## : 从一组训练文件中建立一个字典
--train-cover[=k=#,d=#,steps=#] : 使用带有可选参数的cover算法
--train-legacy[=s=#] : 有选择性地使用遗留算法(默认值:9)
 -o file : “file”是字典名(默认:字典)
--maxdict=# : 将字典限制为指定大小(默认值:112640)
--dictID=# : 强制字典ID为指定值(默认:随机)

性能测试参数 :

-b#    : 基准测试文件，使用#压缩级别(默认为1)
 -e#    : 测试从-bX到#的全部压缩级别(默认值:1)
 -i#    : 最小计算时间(秒)(默认为3s)
 -B#    : 将文件切成大小为#个独立块(默认:无块)
--priority=rt : 将进程优先级设置为实时

使用技巧

主要介绍一些关于 zstd 工具的使用示例和参数解释

简单使用

# 将一个文件压缩成一个后缀为.zst的新文件
# 若是命令后面没有文件或文件为-的话，则读取标准输入
$ zstd file
# 在压缩操做后删除源文件
# 默认状况下，源文件在成功压缩或解压缩后不会被删除
$ zstd --rm file
# 解压zst压缩包
$ zstd -d file.zst
# 解压zst压缩包到标准输出
$ zstd -dc file.zst
# 查看zst压缩包
$ zstd -l file.zst
$ zstdcat file.zst

高级用法

# 输出详细信息
$ zstd -v file
$ zstd -v -d file.zst
# 压缩一个文件同时指定压缩级别(19最高，0最低，3为默认)
$ zstd -level file
$ zstd -9 file
# 使用更多的内存(压缩和解压时)以达到更高的压缩比
$ zstd --ultra -level file
# 解压缩为单进程
# 多个进程并发执行压缩过程(0表示自动使用全部CPU核心)
$ zstd -T0 file
$ zstd -T4 file
$ zstd -T4 -d file.zst

做者: Escape 连接: https://www.escapelife.site/p...
版权声明: 本博客全部文章除特別声明外，均采用 CC BY 4.0 许可协议。