就象咱们在上一节里展现的那样,查询规划器须要估计一个查询检索的行的数目,这样才能选择正确的查询规划。 本节就系统用于这些估计的统计进行一些描述。php
统计的一个部分就是每一个表和索引中的记录总数,以及每一个表和索引占据的磁盘块数。 这个信息保存在 pg_class 的 reltuples 和 relpages 字段中。咱们能够用相似下面的查询检索这些信息:html
relname LIKE 'tenk1%'; relname | relkind | reltuples | relpages ----------------------+---------+-----------+---------- tenk1 | r | 10000 | 358 tenk1_hundred | i | 10000 | 30 tenk1_thous_tenthous | i | 10000 | 30 tenk1_unique1 | i | 10000 | 30 tenk1_unique2 | i | 10000 | 30 (5 rows)
咱们在这里能够看到 tenk1 有 10000 行, 它的索引也有这么多行,可是索引远比表小得多(很正常)。数组
出于效率考虑,reltuples 和 relpages 不是实时更新的, 所以它们一般包含可能有些过期的数值。 它们被 VACUUM,ANALYZE,和几个 DDL 命令,好比 CREATE INDEX 更新。一个独立的 ANALYZE, 也就是没有和 VACUUM 在一块儿的, 生成一个reltuples 的近似数值, 由于它并无读取表里的每一行。规划器将把 pg_class 表里面的数值调整为和当前的物理表尺寸匹配,以此获取一个更接近的近似值。spa
大多数查询只是检索表中行的一部分,由于它们有限制待查行的 WHERE 子句。 所以规划器须要对WHERE子句的选择性(selectivity)进行评估, 选择性也就是符合WHERE子句中每一个条件的部分。 用于这个目的的信息存储在 pg_statistic 系统表中。 在 pg_statistic 中的记录是由 ANALYZE 和 VACUUM ANALYZE 命令更新的, 而且老是近似值,即便刚刚更新完也不例外。设计
除了直接查看 pg_statistic 以外, 咱们手工检查统计的时候最好查看它的视图 pg_stats。 pg_stats 设计成更具可读性。 并且,pg_stats 是全部人均可以读取的, 而 pg_statistic只能由超级用户读取。 (这样就能够避免非特权用户从统计信息中获取一些和其余人的表内容相关的信息。 pg_stats 视图是受约束的,只显示当前用户可读的表。) 好比,咱们能够∶code
SELECT attname, n_distinct, most_common_vals FROM pg_stats WHERE tablename = 'road'; attname | n_distinct | most_common_vals ---------+------------+------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- name | -0.467008 | {"I- 580 Ramp","I- 880 Ramp","Sp Railroad ","I- 580 ","I- 680 Ramp","I- 80 Ramp","14th St ","5th St ","Mission Blvd","I- 880 "} thepath | 20 | {"[(-122.089,37.71),(-122.0886,37.711)]"} (2 rows)
pg_stats 在 Section 42.43 里详细描述。orm
在 pg_statistic 李存储的信息的数量,特别是 给每一个字段用的 most_common_vals 和 histogram_bounds 数组上的最大记录数目能够用 ALTER TABLE SET STATISTICS 命令设置, 或者是用运行时参数 default_statistics_target 进行全局设置。 目前缺省的限制是 10 个记录。 提高该限制应该能够作出更准确的规划器估计,特别是对那些有不规则数据分布的字段而言, 付出的代价是在 pg_statistic 里使用了更多空间,而且须要略微多一些的时间计算估计数值。 相比之下,比较低的限制可能更适合那些数据分布比较简单的字段htm