今天给你们分享一个小网站的数据采集,并写到excel里面!python
目标网站是“小咪购”,这里有天猫全部的含有购物券的商品信息,咱们今天就来抓它吧!ajax
随便找一段文字,而后点击右键查看网页源代码,看看是否存在该文字,若是存在,那么这个网页就是静态网站了!很幸运,这个网站竟然是静态的。json
那就简单了,不须要去分析ajax加载数据或者找json包了,直接获取网页源代码==>>匹配相关内容==>>保存数据便可!多线程
Windows+python3.6app
import randomdom
import time函数
import requests工具
from lxml import etree网站
import xlwt线程
用这几个库就能够搞定了!注意xlwt和xlrd这2个库都是操做excel的,一个是保存数据,一个是读取数据,不要搞混了。
首先写一个函数,将全部的爬虫工做写到函数里,以下图
注意第33行,列表构成的时候,用+链接会将全部列表中的元素放入一个列表,好比:【1,2,3】+【4,5】=【1,2,3,4,5】,而用append()函数则会将后面的内容做为一个元素加入列表中,好比:[1,2,3].append([4,5])=[1,2,3,[4,5]]
下来就是写入excel了,首先是新建excel表格,并写入第一行数据
后面的数据,依次按格式写入并最后用wb.save(路径)的方式保存便可!完整代码及效果以下
因为网站更新的很快(官方说是10分钟。。。),因此也没有抓取那么多,全部的页面有大约600多页,一页100条信息,也就是说一共有6万多条商品信息,若是不用多线程的话会很慢!
代码在上传的过程当中会有压缩,若是实在看不清楚的话,你们能够私信我获取源码!