百度爬虫这个词语,通常出现的都是python相关的资料。node
py也有不少爬虫框架,好比scrapy,Portia,Crawley等。python
以前我我的更喜欢用C#作爬虫。git
随着对nodejs的熟悉。发现作这种事情仍是用脚本语言适合多了,至少不用写那么多的实体类。并且脚本通常使用比较简单。 github
在github上搜索node+spider,排名第一的就是node-crawler npm
github:https://github.com/bda-research/node-crawler
并发
npm 安装:框架
npm install crawler
new一个crawler对象scrapy
var c = new Crawler({ // 在每一个请求处理完毕后将调用此回调函数 callback : function (error, res, done) { if(error){ console.log(error); }else{ var $ = res.$; // $ 默认为 Cheerio 解析器 // 它是核心jQuery的精简实现,能够按照jQuery选择器语法快速提取DOM元素 console.log($("title").text()); } done(); } });
而后往crawler队列里面不停的加url就好了,ide
// 将一个URL加入请求队列,并使用默认回调函数 c.queue('http://www.amazon.com'); // 将多个URL加入请求队列 c.queue(['http://www.google.com/','http://www.yahoo.com']);
爬虫框架通常都是同时去爬多个页面,可是速度过快会触发目标网站的反爬虫机制,也同时影响别人网站的性能。函数
var c = new Crawler({ // 最大并发数默认为10 maxConnections : 1, callback : function (error, res, done) { if(error){ console.log(error); }else{ var $ = res.$; console.log($("title").text()); } done(); } });
使用参数 rateLimit
启用慢速模式,两次请求之间会闲置 rateLimit
毫秒,而 maxConnections
将被强行修改成 1 。
var c = new Crawler({ // `maxConnections` 将被强制修改成 1 maxConnections : 10, // 两次请求之间将闲置1000ms rateLimit: 1000, callback : function (error, res, done) { if(error){ console.log(error); }else{ var $ = res.$; console.log($("title").text()); } done(); } });
var c = new Crawler({ encoding:null, jQuery:false,// set false to suppress warning message. callback:function(err, res, done){ if(err){ console.error(err.stack); }else{ fs.createWriteStream(res.options.filename).write(res.body); } done(); } }); c.queue({ uri:"https://nodejs.org/static/images/logos/nodejs-1920x1200.png", filename:"nodejs-1920x1200.png" });