1. 项目背景html
在Python即时网络爬虫项目启动说明中咱们讨论一个数字:程序员浪费在调测内容提取规则上的时间太多了(见上图),从而咱们发起了这个项目,把程序员从繁琐的调测规则中解放出来,投入到更高端的数据处理工做中。
这个项目推出之后受到很大关注,由于开放源码,你们能够在现成源码基础上进一步开发。然而,Python3和Python2是有区别的,《Python即时网络爬虫项目: 内容提取器的定义》 一文的源码没法在Python2.7下使用,本文将发布一个Python2.7的内容提取器。
2. 解决方案python
为了解决这个问题,咱们把影响通用性和工做效率的提取器隔离出来,描述了以下的数据处理流程图:git
图中“可插拔提取器”必须很强的模块化,那么关键的接口有:
程序员
3. 提取器代码github
可插拔提取器是即时网络爬虫项目的核心组件,定义成一个类: GsExtractor
适用python2.7的源代码文件及其说明文档请从 github 下载
使用模式是这样的:
api
下面是这个GsExtractor类的源代码(适用于Python2.7)网络
4. 用法示例dom
下面是一个示例程序,演示怎样使用GsExtractor类提取豆瓣讨论组话题。本示例有以下特征:
python2.7
下面是源代码,均可从 github 下载模块化
提取结果以下图所示:
5. 接下来阅读
本文已经说明了提取器的价值和用法,可是没有说怎样生成它,只有快速生成提取器才能达到节省开发者时间的目的,这个问题将在其余文章讲解,请看《1分钟快速生成用于网页内容提取的xslt模板》
6. 集搜客GooSeeker开源代码下载源
1. GooSeeker开源Python网络爬虫GitHub源
7. 文档修改历史
2016-08-05:V1.0,Python2.7下的内容提取器类首次发布