基于node.js的爬虫框架 node-crawler简单尝试

时间 2019-11-08

标签基于 node.js node 爬虫框架 crawler 简单尝试栏目 Node.js 繁體版

原文原文链接

百度爬虫这个词语，通常出现的都是python相关的资料。node

py也有不少爬虫框架，好比scrapy，Portia，Crawley等。python

以前我我的更喜欢用C#作爬虫。git

随着对nodejs的熟悉。发现作这种事情仍是用脚本语言适合多了，至少不用写那么多的实体类。并且脚本通常使用比较简单。　　github

在github上搜索node+spider，排名第一的就是node-crawler npm

github:https://github.com/bda-research/node-crawler
并发

简单使用

npm 安装：框架

npm install crawler

new一个crawler对象scrapy

var c = new Crawler({
    // 在每一个请求处理完毕后将调用此回调函数
    callback : function (error, res, done) {
        if(error){
            console.log(error);
        }else{
            var $ = res.$;
            // $ 默认为 Cheerio 解析器
            // 它是核心jQuery的精简实现，能够按照jQuery选择器语法快速提取DOM元素
            console.log($("title").text());
        }
        done();
    }
});

而后往crawler队列里面不停的加url就好了，ide

// 将一个URL加入请求队列，并使用默认回调函数
c.queue('http://www.amazon.com');

// 将多个URL加入请求队列
c.queue(['http://www.google.com/','http://www.yahoo.com']);

控制并发速度

爬虫框架通常都是同时去爬多个页面，可是速度过快会触发目标网站的反爬虫机制，也同时影响别人网站的性能。函数

控制最大的并发数量

var c = new Crawler({
    // 最大并发数默认为10
    maxConnections : 1,

    callback : function (error, res, done) {
        if(error){
            console.log(error);
        }else{
            var $ = res.$;
            console.log($("title").text());
        }
        done();
    }
});

使用慢速模式

使用参数 rateLimit 启用慢速模式，两次请求之间会闲置 rateLimit 毫秒，而 maxConnections 将被强行修改成 1 。

var c = new Crawler({
    // `maxConnections` 将被强制修改成 1
    maxConnections : 10,

    // 两次请求之间将闲置1000ms
    rateLimit: 1000,

    callback : function (error, res, done) {
        if(error){
            console.log(error);
        }else{
            var $ = res.$;
            console.log($("title").text());
        }
        done();
    }
});

下载图片等静态文件

var c = new Crawler({
    encoding:null,
    jQuery:false,// set false to suppress warning message.
    callback:function(err, res, done){
        if(err){
            console.error(err.stack);
        }else{
            fs.createWriteStream(res.options.filename).write(res.body);
        }
        
        done();
    }
});

c.queue({
    uri:"https://nodejs.org/static/images/logos/nodejs-1920x1200.png",
    filename:"nodejs-1920x1200.png"
});