Python爬虫简单实现之Q乐园图片下载

时间 2019-11-18

标签 python 爬虫简单实现乐园图片下载栏目 Python 繁體版

原文原文链接

根据需求写代码实现。然而跟我并无什么关系，我只是打开电脑望着屏幕想着去干点什么，因而有了这个所谓的“需求”。html

终于，我发现了Q乐园——究竟是我老了仍是我小了，这是什么神奇的网站，没听过啊，就是下面酱紫儿——正则表达式

（虽然小广告有点多，一度觉得这并非什么“正经”的网站...）编程

我并非二次元，只是以为动漫图片还算是“老小皆宜”（“少儿不宜”多尴尬），就决定爬一下动漫图片好了。就是下面那个样子：浏览器

鼠标右键——查看源代码，别问我用得什么浏览器。网页大概就是下面这个样：框架

我好像看到了图集名称，“窗外繁华怒放”（窗内我一口老血），“你已经有别的小朋友了我本身回家就好啦”（说好的老小皆宜，已经隐隐感觉了到了早*的味道）socket

点开一个图集，看下“窗外繁华怒放”吧，还算美~函数

而后咱们仍是右键查看源代码（说了不告诉你我用的什么浏览器）——网站

里面的“http://略略略略略略.jpg”就是图集中图片对应的地址了，好比http://v1.qzone.cc/pic/201709/27/14/13/59cb41a204354684.jpeg!600x600.jpg，直接复制到浏览器中打开就是图片了——不信试试！url

因此，咱们要下载图片，其实也就是要拿到这些网址。怎么拿？正则表达式，华丽登场！spa

就好比，咱们若是打开了图集“窗外繁华怒放”，那就能够直接爬取图集中图片的地址了，这一个图集就搞定了。若是咱们贪得无厌，想要下载更多图集的图片怎么办？（请依次打开图集，而后把鼠标放在图片上，右键图片另存为——啊，固然是开玩笑的了，毕竟我这么懒！）

因此呢，咱们还要获取全部图集的网址。基本思路就是：打开一个图集网址——获取图片连接——图片下载——打开下一个图集网址——（这不是废话吗？）

那么，如何获取全部图集网址呢？

其实，咱们第一次查看源代码的时候提到，好像已经看到了图集的名称，是的，图集的名称，再回头去看看，里面的确已经包含了图集的网址和名称了。举个栗子：

<h5><a href="/haokan/dongman/1349139.html" target="_blank">窗外繁花怒放</a></h5>

这一行里，/haokan/dongman/1349139.html这部分对应的就是网址，名称本身看。

好了，和获取图片网址同样，爬呗，反正咱们有个不怕累的虫子（啊？虫子又是什么？我是谁？我在哪里？我在干什么？）

如今咱们看到的是第一页，若是咱们还想下载第二页、第三页、...全部页面的图集怎么办？（下载了有啥用？大概有病）

看来咱们只好手动一个一个页面的打开，而后“放虫咬图”！（pi~）

好吧，仍是偷懒一下好了。反正咱们就是下载Q乐园（高端大气上档次！）中的动漫图片，咱们发现它的网页都是有规律的：好比第一页的网址：http://www.qzone.cc/haokan/dongman/，第二页的网址：http://www.qzone.cc/haokan/dongman/list_2.html。我猜第三页的网址是：http://www.qzone.cc/haokan/dongman/list_3.html（麻德，我好聪明怎么办？！）

因而网址咱们能够经过列表的方式构造了。（列表！终于听到了一个正常的词儿，但其实我，根本没用到好吗啊啊啊啊）

因此，思路很简单了，咱们先构造全部页面的网址集合，对每一个页面网址爬取该页面上图集的网址，而后从图集的网址上爬取该图集包含的图片的网址，而后下载图片。（感受好轻松！其实就是好轻松）

有几个小tips：

1.我不想把全部图片都扔到一个文件夹中，我想按照图集的名称分别建立文件夹，而后分别保存。怎么办？爬取图集名称建立文件夹呗~

2.图集名称中包含特殊字符，建立文件夹时极可能会因命名问题出错，那么怎么办？随便吧。。。我就随便一搞，差很少就行。

3.我发现页面源代码中没有包含一共多少页面，那么咱们怎么判断一共要抓去多少页面呢？我猜大概不会出现http://www.qzone.cc/haokan/dongman/list_10000.html，一万页，这渣网，下到啥时候啊。嗯，仍是随便吧，我就是随便一搞，真的差很少就行

4.若是有一张图片，或者有一个网页卡了，就是下载不下来或者打不开了怎么办？随便搞搞吧，定个时间，没反应劳资还不看了，跳过！

5.若是图集重复了，我想下载到同一个文件夹中，还不想覆盖原有的图片怎么办？我猜你确定知道随便搞搞就行，你比我聪明！

6.我忘记了...

看我“自由派”的代码吧，大概会编程的人都受不了，框架结构什么的随便了，反正我乐意（斜眼）。直接跳过V1.0，V2.0，看V3.0吧！（建议V3.0也不用看，啥用啊）

V1.0

#Q乐园图片下载

#载入模块：路径设置、爬虫、正则表达式
import os
import urllib
import re

#定义函数
#页面抓取函数
def getHTML(url, dec):
    html = urllib.request.urlopen(url).read()
    html = html.decode(dec)
    return html

#网页列表获取
def HtmlToList(html, s):
    pat = re.compile(s)
    ToList = pat.findall(html)
    return ToList
    
#页面执行函数（图片下载）
def getIMG(url, path, name):
    imgpath = path+name+'.jpg'
    print('    正在下载第%s张照片...'%name)
    urllib.request.urlretrieve(url, imgpath)



#自定义建立文件夹的函数
def makeDir(path, name):
    topath = path+name
    flag = False
    if not os.path.isdir(topath):
        os.mkdir(topath)
        print('建立文件夹:%s!'%name)
    else:
        flag = True
    topath = topath+'\\'
    return topath,flag

#初始页面（第一页）网址
url = r'http://www.qzone.cc/haokan/dongman/'

#正则表达式：匹配每页上的图集网址
SetS = r'<h5><a href="/.+?/.+?/(.+?.html)" target="_blank">(.+?)</a></h5>'

#获取页面上图集网址集合
html = getHTML(url, 'UTF-8')
PicSetlist = HtmlToList(html, SetS)

#文件夹准备
path = 'D:\\QLeYuan\\'
name = 'PicSet'

#正则表达式：在图集网页中匹配图片
PicS = r'original="(http://.+?/.+?/.+?/.+?/.+?/.+?/.+?.jpg)" class="lazy"'
#第一页图集下载
for bit,dirname in PicSetlist:
    #建立图集路径文件夹
    dirname.replace('?','')
    dirpath = path+name+'\\'
    filepath,flag = makeDir(dirpath, dirname)
    #组合图集url
    seturl = url+bit
    #获取图片列表
    html = getHTML(seturl, 'UTF-8')
    PicList = HtmlToList(html, PicS)
    #图片名称
    imgname = 0
    for PicUrl in PicList:
        #若是获取的图集名称重复，那么下载到同一文件夹中并重命名，避免出现同名文件没法建立的问题
        if flag:
            picname = '1-'+str(imgname)
        else:
            picname = str(imgname)
        #获取图片
        getIMG(PicUrl, filepath, picname)
        imgname = imgname+1

V2.0

#Q乐园图片下载

#载入模块：路径设置、爬虫、正则表达式
import os
import urllib
import re

#设置超时处理
import socket

#定义函数
#页面抓取函数
def getHTML(url, dec):
    html = urllib.request.urlopen(url).read()
    html = html.decode(dec)
    return html

#网页列表获取
def HtmlToList(html, s):
    pat = re.compile(s)
    ToList = pat.findall(html)
    return ToList
    
#页面执行函数（图片下载）
def getIMG(url, path, name):
    imgpath = path+name+'.jpg'
    urllib.request.urlretrieve(url, imgpath)
    
#自定义建立文件夹的函数
def makeDir(path, name):
    topath = path+name
    flag = False
    if not os.path.isdir(topath):
        print('建立文件夹:%s!'%dirname)
        os.mkdir(topath)
    else:
        flag = True
    topath = topath+'\\'
    return topath,flag

#初始页面（第一页）网址
url_1 = r'http://www.qzone.cc/haokan/dongman/'

#文件夹准备
path = 'D:\\QLeYuan\\'
name = 'PicSet'
#正则表达式：匹配每页上的图集网址 
SetS = r'<h5><a href="/.+?/.+?/(.+?.html)" target="_blank">(.+?)</a></h5>' 
#正则表达式：匹配全部页面网址 
UrlS = r'<a href="/.+?/.+?/(.+?.html)">.</a></li>' 
#获取页面网址 
html = getHTML(url_1, 'UTF-8') 
UrlList = HtmlToList(html, UrlS) 
#构造第一页的网址 
UrlList.insert(0,'') 
for root in UrlList: 
    url = url_1+root 
    #获取页面上图集网址集合 
    html = getHTML(url, 'UTF-8') 
    PicSetList = HtmlToList(html, SetS) 
    #正则表达式：在图集网页中匹配图片 
    PicS = r'original="(http://.+?/.+?/.+?/.+?/.+?/.+?/.+?.jpg)" class="lazy"' 
    #第一页图集下载 
    for bit,dirname in PicSetList: 
        #建立图集路径文件夹 
        dirname = dirname.replace('?','') 
        dirname = dirname.replace('\\','') 
        dirpath = path+name+'\\' 
        filepath,flag = makeDir(dirpath, dirname) 
        #组合图集url 
        seturl = url_1+bit 
        #获取图片列表 
        html = getHTML(seturl, 'UTF-8') 
        PicList = HtmlToList(html, PicS) 
        #图片名称 
        imgname = 0 
        for PicUrl in PicList: 
            #若是获取的图集名称重复，那么下载到同一文件夹中并重命名，避免出现同名文件没法建立的问题 
            if flag: 
                picname = '1-'+str(imgname) 
            else: 
                picname = str(imgname) 
                #获取图片：若是遇到下载异常会提示 
            try: 
                #下载超时会报错跳过该异常下载其余 
                socket.setdefaulttimeout(5.0) 
                print(' 正在下载第%s张照片...'%picname) 
                getIMG(PicUrl, filepath, picname) 
            except: 
                print('图片%d下载异常'%imgname) 
                imgname = imgname+1 
                print('下载完成！')

V3.0

#Q乐园图片下载

#载入模块：路径设置、爬虫、正则表达式
import os
import urllib
import re

#设置超时处理
import socket

#定义函数
#页面抓取函数
def getHTML(url, dec):
    html = urllib.request.urlopen(url).read()
    html = html.decode(dec)
    return html

#网页列表获取
def HtmlToList(html, s):
    pat = re.compile(s)
    ToList = pat.findall(html)
    return ToList
    
#页面执行函数（图片下载）
def getIMG(url, path, name):
    imgpath = path+name+'.jpg'
    urllib.request.urlretrieve(url, imgpath)
    
#自定义建立文件夹的函数
def makeDir(path, name):
    topath = path+name
    flag = False
    if not os.path.isdir(topath):
        print('建立文件夹:%s!'%dirname)
        os.mkdir(topath)
    else:
        flag = True
    topath = topath+'\\'
    return topath,flag

#检查文件夹名是否合法
def checkDirName(name=None):
    if name is None:
        print('name is None.')
    s = r'[;\\/:*?"<>|\r\n]+'
    pat = re.compile(s)
    bug = pat.findall(name)
    if bug:
        for char in bug:
            name = name.replace(char, '_')    
    return name
    
#初始页面（第一页）网址
url_1 = r'http://www.qzone.cc/haokan/dongman/'
url = url_1

#文件夹准备
path = 'D:\\QLeYuan\\'
name = 'PicSet'
#正则表达式：匹配每页上的图集网址
SetS = r'<h5><a href="/.+?/.+?/(.+?.html)" target="_blank">(.+?)</a></h5>'

#图集名称重复下载到同一文件夹
namesame = 1

label = True
root = 2

while label:
    try:
    #获取页面上图集网址集合
        html = getHTML(url, 'UTF-8')
        PicSetList = HtmlToList(html, SetS)
    except:
        print('下载全部页面已下载完成！或者打开网址出错！')
        break
    #正则表达式：在图集网页中匹配图片
    PicS = r'original="(http://.+?/.+?/.+?/.+?/.+?/.+?/.+?.jpg)" class="lazy"'
    #第一页图集下载
    print('正在下载第%d页图集：'%(root-1))
    for bit,dirname in PicSetList:
        #建立图集路径文件夹
        dirname = checkDirName(dirname)
        dirpath = path+name+'\\'
        filepath,flag = makeDir(dirpath, dirname)
        #组合图集url
        seturl = url_1+bit
        #获取图片列表
        html = getHTML(seturl, 'UTF-8')
        PicList = HtmlToList(html, PicS)
        #图片名称
        imgname = 0
        if flag:
            prename = str(namesame)+'_'
            namesame = namesame+1
        else:
            namesame = 1
            prename = ''
                
        for PicUrl in PicList:
            #若是获取的图集名称重复，那么下载到同一文件夹中并重命名，避免出现同名文件没法建立的问题 
            picname = prename+str(imgname)
                #获取图片：若是遇到下载异常会提示 
            try:
                #下载超时会报错跳过该异常下载其余 
                socket.setdefaulttimeout(5.0)
                print(' 正在下载第%s张照片...'%picname)
                getIMG(PicUrl, filepath, picname)
            except:
                print('图片%d下载异常'%imgname)
                
            
            imgname = imgname+1
    #更新网址
    url = url_1+'list_'+str(root)+'.html'
    root = root+1

（能够搞一搞，不止下载动漫图片，下载全部的类型的图片，不难实现。实在没有什么意思了...）

那么，下载了图集长什么样子呢？

先看下下载过程大概长什么样子（其实根本没有过程）：

下载后部分文件夹：

看看“窗外繁华怒放”，图片是什么样子：

我没有实际运行到最后结束（毕竟渣网速）。我尝试不实际下载图片，只看共有多少个图集，大概有两三千不是问题，平均一个图集5张图片的话，一万张图片都是妥妥的。

好像压根没有说到正则表达式是什么，爬虫是什么，实现技巧是什么...别问我，反正我也不知道是什么。还有，别问我是什么浏览器，由于这并不重要，反正什么浏览器都行（白眼）

千万不要把这当作是教程，这大概只是理科生的一篇“随笔”，吐槽一下近期的部分心情（强调是部分！）。开心就好啊~

最后，正经说一句：若有侵权，请联系删除！（麻德，我侵了谁的权，惊恐）