今日概要python
今日详情web
一.什么是Scrapy?并发
Scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架,很是出名,很是强悍。所谓的框架就是一个已经被集成了各类功能(高性能异步下载,队列,分布式,解析,持久化等)的具备很强通用性的项目模板。对于框架的学习,重点是要学习其框架的特性、各个功能的用法便可。app
二.安装框架
Linux:
dom
pip3 install scrapy
异步
Windows:
scrapy
a. pip3 install wheel
分布式
b. 下载twisted http:
/
/
www.lfd.uci.edu
/
~gohlke
/
pythonlibs
/
#twisted
ide
c. 进入下载目录,执行 pip3 install Twisted‑
17.1
.
0
‑cp35‑cp35m‑win_amd64.whl
d. pip3 install pywin32
e.
pip3 install scrapy
三.基础使用
1.建立项目:scrapy startproject 项目名称
项目结构:
2.建立爬虫应用程序:
cd project_name(进入项目目录)
scrapy genspider 应用名称 爬取网页的起始url (例如:scrapy genspider qiubai www.qiushibaike.com)
3.编写爬虫文件:在步骤2执行完毕后,会在项目的spiders中生成一个应用名的py爬虫文件,文件源码以下:
4.设置修改settings.py配置文件相关配置:
5.执行爬虫程序:scrapy crawl 应用名称
四.小试牛刀:将糗百首页中段子的内容和标题进行爬取
执行爬虫程序: