Python即时网络爬虫项目启动说明

clipboard.png

做为酷爱编程的老程序员,实在按耐不下这个冲动,Python真的是太火了,不断撩拨个人心。php

我是对Python存有戒备之心的,想当年我基于Drupal作的系统,使用php语言,当语言升级了,推翻了老版本不少东西,不得不花费不少时间和精力去移植和升级,至今还有一些隐藏在某处的代码埋着雷。我估计Python也避免不了这个问题(其实这种声音已经很多,好比Python 3 正在毁灭 Python)。python

可是,我仍是启动了这个Python即时网络爬虫项目。我用C++、Java和Javascript编写爬虫相关程序超过10年,要追求高性能,非C++莫属,同时有完善的标准体系,让你和你的系统十分自信,只要充分测试,就能按照预期的方式运行。在GooSeeker项目中,咱们不断向一个方向努力——“收割数据”,并且让广大用户(不只是专业的数据采集用户)都能体验到收割互联网数据的快感。“收割”的一个重要含义就是大批量。如今,我要启动“即时网络爬虫”,目的是要补充“收割”没有覆盖的场景,我看到的是:程序员

  • 在系统层面:“即时”表明快速部署数据应用系统正则表达式

  • 在数据流层面:“即时”表明采集数据到数据使用是即时的,单个数据 对象能够独自全流程处理,不用等待一批存入数据库,而后从数据库中拿出来用数据库

  • “即时”另外一个含义就是网络爬虫是一个嵌入模块,跟整个信息处理系统集成在一块儿编程

图片描述

一众程序员都在玩Python网络爬虫,我拟定了一个计划:创建一个模块化更强的软件部件,专门解决最耗费精力的内容提取问题(有人总结说大数据和数据分析整个链条上,数据准备占了80%工做量,咱们不妨延展一下,网络数据抓取的工做量有80%是在为各类网站的各类数据结构编写抓取规则)。segmentfault

我把他想象成一个小机器(见上图),输入的是原始网页,输出的是提取出来的结构化的内容,这个小机器还有一个可替换部件:将输入转化成输出结构的一个指令块,咱们成为“提取器”,让你们再也不为调试正则表达式或者XPath而苦恼。网络

这是一个开放的项目,两年前启动了一个手机上的即时网络爬虫项目,由于是给某商业集团开发的,因此不便开放,一样的思想和方法将开放到这个项目中,并且用当前最热的python来作,但愿你们能共同参与。在执行过程当中,咱们会开放全部资料和成果、已经遇到的坑。数据结构

近期作的实验是:模块化

相关文章
相关标签/搜索