Python优雅的合并两个Dict

时间 2019-11-16

标签 python 优雅合并两个 dict 栏目 Python 繁體版

原文原文链接

一行代码合并两个dict

假设有两个dict x和y，合并成一个新的dict，不改变 x和y的值，例如html

x = {'a': 1, 'b': 2}
 y = {'b': 3, 'c': 4}

指望获得一个新的结果Z，若是key相同，则y覆盖x。指望的结果是python

>>> z
{'a': 1, 'b': 3, 'c': 4}

在PEP448中，有个新的语法能够实现，而且在python3.5中支持了该语法，合并代码以下git

z = {**x, **y}

妥妥的一行代码。
因为如今不少人还在用python2，对于python2和python3.0-python3.4的人来讲，有一个比较优雅的方法，可是须要两行代码。函数

z = x.copy()
z.update(y)

上面的方法，y都会覆盖x里的内容，因此最终结果b=3.性能

不使用python3.5如何一行完成了

若是您尚未使用Python 3.5，或者须要编写向后兼容的代码，而且您但愿在单个表达式中运行，则最有效的方法是将其放在一个函数中：测试

def merge_two_dicts(x, y):
    """Given two dicts, merge them into a new dict as a shallow copy."""
    z = x.copy()
    z.update(y)
    return z

而后一行代码完成调用:ui

z = merge_two_dicts(x, y)

你也能够定义一个函数，合并多个dict，例如code

def merge_dicts(*dict_args):
    """
    Given any number of dicts, shallow copy and merge into a new dict,
    precedence goes to key value pairs in latter dicts.
    """
    result = {}
    for dictionary in dict_args:
        result.update(dictionary)
    return result

而后能够这样使用htm

z = merge_dicts(a, b, c, d, e, f, g)

全部这些里面，相同的key，都是后面的覆盖前面的。对象

一些不够优雅的示范

items

有些人会使用这种方法：

z = dict(x.items() + y.items())

这其实就是在内存中建立两个列表，再建立第三个列表，拷贝完成后，建立新的dict，删除掉前三个列表。这个方法耗费性能，并且对于python3，这个没法成功执行，由于items()返回是个对象。

>>> c = dict(a.items() + b.items())
Traceback (most recent call last):
  File "<stdin>", line 1, in <module>
TypeError: unsupported operand type(s) for +: 'dict_items' and 
'dict_items'

你必须明确的把它强制转换成list，z = dict(list(x.items()) + list(y.items()))，这太浪费性能了。
另外，想以来于items()返回的list作并集的方法对于python3来讲也会失败，并且，并集的方法，致使了重复的key在取值时的不肯定，因此，若是你对两个dict合并有优先级的要求，这个方法就完全不合适了。

>>> x = {'a': []}
>>> y = {'b': []}
>>> dict(x.items() | y.items())
Traceback (most recent call last):
  File "<stdin>", line 1, in <module>
TypeError: unhashable type: 'list'

这里有一个例子，其中y应该具备优先权，可是因为任意的集合顺序，x的值被保留：

>>> x = {'a': 2}
>>> y = {'a': 1}
>>> dict(x.items() | y.items())
{'a': 2}

构造函数

也有人会这么用

z = dict(x, **y)

这样用很好，比前面的两步的方法高效多了，可是可阅读性差，不够pythonic，若是当key不是字符串的时候，python3中仍是运行失败

>>> c = dict(a, **b)
Traceback (most recent call last):
  File "<stdin>", line 1, in <module>
TypeError: keyword arguments must be strings

Guido van Rossum 大神说了：宣告dict（{}， {1：3}）是非法的，由于毕竟是滥用机制。虽然这个方法比较hacker，可是太投机取巧了。

一些性能较差可是比较优雅的方法

下面这些方法，虽然性能差，但也比items方法好多了。而且支持优先级。

{k: v for d in dicts for k, v in d.items()}

python2.6中能够这样

dict((k, v) for d in dicts for k, v in d.items())

itertools.chain:

import itertools
z = dict(itertools.chain(x.iteritems(), y.iteritems()))

性能测试

如下是在Ubuntu 14.04上完成的，在Python 2.7（系统Python）中：

>>> min(timeit.repeat(lambda: merge_two_dicts(x, y)))
0.5726828575134277
>>> min(timeit.repeat(lambda: {k: v for d in (x, y) for k, v in d.items()} ))
1.163769006729126
>>> min(timeit.repeat(lambda: dict(itertools.chain(x.iteritems(),y.iteritems()))))
1.1614501476287842
>>> min(timeit.repeat(lambda: dict((k, v) for d in (x, y) for k, v in d.items())))
2.2345519065856934

在python3.5中

>>> min(timeit.repeat(lambda: {**x, **y}))
0.4094954460160807
>>> min(timeit.repeat(lambda: merge_two_dicts(x, y)))
0.7881555100320838
>>> min(timeit.repeat(lambda: {k: v for d in (x, y) for k, v in d.items()} ))
1.4525277839857154
>>> min(timeit.repeat(lambda: dict(itertools.chain(x.items(), y.items()))))
2.3143140770262107
>>> min(timeit.repeat(lambda: dict((k, v) for d in (x, y) for k, v in d.items())))
3.2069112799945287