scrapy shell 命令css
1.scrapy shell url #url指你所须要爬的网址python
2.有些网址数据的爬取须要user-agent,scrapy shell中能够直接添加头文件,正则表达式
第①种方法shell
scrapy shell -s USER_AGENT="Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/59.0.3071.86 Safari/537.36" url #url指你所须要爬的网址scrapy
第②种方法 fetch
scrapy shellurl
from scrapy import Requestcode
req=Request("url",headers={'User-Agent':"Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/59.0.3071.86 Safari/537.36"})utf-8
resp=fetch(req)it
3.对于爬取到的网址的数据,但愿将其保存到本地文件中,
with open("e:/python/text.txt",'w') as f:
f.write(response.body.decode('utf-8'))
4.scrapy shell对于检验正则表达式和css以及xpath是很方便的用法,
scrapy shell -s USER_AGENT="Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/59.0.3071.86 Safari/537.36" url #该步骤以后将获得一个页面请求的回答信息response
response.css(".job-name::attr(title)") #使用css提取到具体数据
未完待续。。。