Gzip模块为python的压缩和解压缩模块,读写gzip 文件python
1、使用gzip模块压缩文件:url
1 import gzip #导入python gzip模块,注意名字为全小写 2 g = gzip.GzipFile(filename="", mode="wb", compresslevel=9, fileobj=open('sitemap.log.gz', 'wb'))#filename参数是压缩文件内文件的名字,为空也能够。fileobj是生成的压缩文件对象 3 g.write(open('d:\\test\\sitemap.xml').read()) 4 g.close()
2、使用gzip解压缩文件:spa
代码以下:code
g = gzip.GzipFile(mode="rb", fileobj=open('d:\\test\\sitemap.log.gz', 'rb')) # python gzip 解压 open(r"d:\\haha.xml", "wb").write(g.read())
3、实际应用xml
在实际应用中,例如在爬取网页的过程当中,咱们检查网页源代码的head头部信息发现,是结果gzip压缩处理的,因此在显示过程当中显示不彻底,例如:对象
咱们要抓取指定url的源代码blog
#-*-coding:utf8 -*- import urllib2 from lxml import etree request = urllib2.Request('http://outofmemory.cn/') response = urllib2.urlopen(request) print data.text()
发现显示出的源代码是通过压缩的数据ip
此时咱们须要对齐进行解压操做,最终代码入下:内存
#-*-coding:utf8 -*- import urllib2 from lxml import etree from StringIO import StringIO #StringIO模块就是在内存中读写str import gzip #加压缩文件 request = urllib2.Request('http://outofmemory.cn/') request.add_header('Accept-encoding', 'gzip') #添加头信息 response = urllib2.urlopen(request) if response.info().get('Content-Encoding') == 'gzip': buf = StringIO( response.read()) #将读取的response信息做为stringIO方便后面做为文件写入 f = gzip.GzipFile(fileobj=buf) #解压缩response data = f.read() print data