python爬虫之反爬虫(随机user-agent,获取代理ip,检测代理ip可用性)

本人对于Python学习建立了一个小小的学习圈子,为各位提供了一个平台,你们一块儿来讨论学习Python。欢迎各位到来Python学习群:960410445一块儿讨论视频分享学习。Python是将来的发展方向,正在挑战咱们的分析能力及对世界的认知方式,所以,咱们与时俱进,迎接变化,并不断的成长,掌握Python核心技术,才是掌握真正的价值所在。
html

随机User-Agent
正则表达式

fake_useragent库,假装请求头学习



获取代理ip网站

在免费的代理网站爬取代理ip,免费代理的采集也很简单,无非就是:访问页面页面 —> 正则/xpath提取 —> 保存.net

代理ip网站代理

有代理:https://www.youdaili.net/Daili/guonei/cdn

66代理:http://www.66ip.cn/6.html视频

西刺代理:https://www.xicidaili.com/htm

快代理:https://www.kuaidaili.com/free/
blog

根据网页结果,适用正则表达式匹配

这种方法适合翻页的网页



先获取特定标签

解析



检测代理ip可用性

第一种方法:经过返回的状态码判断





第二种方法:使用requests包来进行验证





第三种方法:使用telnet

相关文章
相关标签/搜索