python爬虫之『入门基础』

HTTP请求

1.首先须要了解一下http请求,当用户在地址栏中输入网址,发送网络请求的过程是什么?html

能够参考我以前学习的时候转载的一篇文章一次完整的HTTP事务过程–超详细web

2.还须要了解一下http的请求方式浏览器

有兴趣的同窗能够去查一下http的八种请求方法,这里呢主要说下get请求和post请求,这两种在之后学习中会用到的比较多。安全

get请求:GET方法用于使用给定的URI从给定服务器中检索信息,即从指定资源中请求数据。咱们输入网址访问网站通常就是get请求。[作运维的小年轻]使用GET方法的请求应该只是检索数据,而且不该对数据产生其余影响。
优势:比较便捷
缺点:因为是明文传输,因此安全性比较低,另外参数长度有限制。服务器

post请求:POST请求一般是使用来提交HTML的表单,表单中的数据传输到服务器,由服务器对这些数据处理。咱们日常执行登陆操做的那一下基本上都是post请求。
关于get请求和post请求区别优缺点这里推荐一篇博文:http GET 和 POST 请求的优缺点、区别以及误区网络

下面说一下Headers中的Request Headers(请求头信息),并发

Accept:指定客户端可以接收的内容类型,图中text/html表示要请求返回文本格式的数据运维

Accept-Encoding:指定浏览器能够支持的web服务器返回内容压缩编码类型,图中gzip表示支持gzip格式的压缩文件post

Accept-Language:浏览器可接受的语言 图中 zh-CN表示接受中文学习

Connection:表示是否须要持久链接。(HTTP 1.1默认进行持久链接)图中keep-alive意为保持长连接

Cookie:是服务器发送到浏览器并保存在本地的一小块数据,存储在header中,它会在浏览器下次向同一服务器再发起请求时被携带并发送到服务器上,一般,它用于告知服务端两个请求是否来自同一浏览器,如保持用户的登陆状态。

Host:指定请求的服务器的域名和端口号,图中是www.baidu.com也就是我在地址栏中请求的网址

User-Agent:包含的是发出请求的用户信息,客户机的软件环境浏览器类型等

Response Header 和Request Headers对应,以下图

 

了解完这些呢,就来看下爬虫吧

关于爬虫

爬虫通俗来讲,就是使用代码模拟用户,批量发送网络请求,批量的获取数据

爬虫的的分类

1.通用爬虫:搜索引擎的爬虫

优点:开放性很好,速度比较快

劣势:目标不明确,举个例子哈,例如我在百度搜索图片,搜索结果以下图,我想要的是图片,可是看下图红色方框所圈的内容并非咱们所要找的图片资源,这就是我所说[作运维的小年轻]的目标不明确,致使的结果呢就是返回的不少内容并非用户所须要的。

 


2.聚焦爬虫:全称聚焦网络爬虫,又称为主题网络爬虫
优势:目标明确,对用户的需求很是精准,返回内容很固定,好比我就请求一张图片,那么就返回一张图片。

关于爬虫的分类其实在之后愈来愈深刻的学习中,会天然而然的理解,如今只需有个大概了解就好了关于网络爬虫分类日百度百科中讲的比较详细,点击传送门去了解。

 

原文出处:https://www.cnblogs.com/cx55887/p/10625477.html

相关文章
相关标签/搜索