python爬虫必知的数据结构(关于python打造爬虫代理池过程解析)
python爬虫必知的数据结构(关于python打造爬虫代理池过程解析)图一和图二是一起的:实际操作 一定义了http_proxy_pool和https_proxy_pool两个list变量,用于存储http类型和https类型的代理。 使用PyQuery根据css伪选择器提取出ip,端口和http类型信息,并按照http:// ip port的方式组合成一个字符串,存储在已经定义好的http_proxy_tool和https_proxy_pool变量中。爬取swei360网站代理的方法就不贴出来了,原理和爬取xicidaili网站是一样的。一个代理在使用之前要判断是否可用,我们使用request的get请求的返回代码判断代理是否可用,返回200,就说明代理可用,返回其他的代码就表示代理不可用,代码如下:
首先介绍下爬取xicidaili网站的过程, 要先定义一个方法用于抓取xicidaili网站的,参数有两个,一个是url,另外一个是要爬取代理网页的页数,也就是要爬几页,方法如下:
实际操作图1
图一和图二是一起的:
实际操作图2
定义了http_proxy_pool和https_proxy_pool两个list变量,用于存储http类型和https类型的代理。 使用PyQuery根据css伪选择器提取出ip,端口和http类型信息,并按照http:// ip port的方式组合成一个字符串,存储在已经定义好的http_proxy_tool和https_proxy_pool变量中。
爬取swei360网站代理的方法就不贴出来了,原理和爬取xicidaili网站是一样的。
一个代理在使用之前要判断是否可用,我们使用request的get请求的返回代码判断代理是否可用,返回200,就说明代理可用,返回其他的代码就表示代理不可用,代码如下:
实际操作 一
图一和图二是一起的:
实际操作 二
定义了detect_proxy方法用于检测代理是否可用,有三个参数,分别是测试网址,代理类型(http和https)和代理IP。当requests的请求返回200代码时,就表示该代理可用,返回True,否则就是不可用,返回False。当遇到request异常或者其他的错误也认为代理不可用,返回False。对于不可用的代理,要从代理池中删除。
从代理池中获取代理时,我们使用的是从代理池中随机返回一个代理,这样就避免经常使用一个代理,从而遭到拒绝访问。代码如下:
为了保证代理的可用,当检测到一个代理不可用时,要及时的清理掉。就是从http_proxy_pool和https_proxy_pool列表中删除。
一个简单的爬虫代理池已经搭建好 总结下爬虫代理池搭建的过程:
- 从免费的代理网站上爬取代理信息,存放在列表中。
- 提供从代理池中随机获取代理的方法。http类型的网站要使用http类型的代理,https类型的网站要使用https类型的代理,因此分别提供获取http和https类型代理的方法。
- 提供检测代理是否可用的方法,代理可用返回True,不可用返回False。
- 提供删除代理的方法。
这个代理池其实相当的简单,有一个弊端就是在检测代理是否可用时,如果返回的不是200代码就认为代理不可用,返回其他代码的情况有很多,例如网络不可用、测试网站不可访问等。比较好的做法是给每个代理设置一个分值,例如10分,如果检测到不可用就减1,当分数为0时,就确定该代理不可用,直接从代理池中移除。检测到代理可用,就将分数设为10分。
这种做法给每个检测到不可用代理一个改邪归正的机会,不至于一刀切的抛弃掉。
以上就是这篇文章的全部内容了,希望本文的内容对大家的学习或者工作具有一定的参考学习价值,有错误的地方还望指出加以改正!
最后,小编想说一句话:我是一名python开发工程师,这里有我自己整理了一套最新的python系统学习教程,包括从基础的python脚本到web开发、爬虫、数据分析、数据可视化、机器学习等。想要这些资料的可以关注小编,并在后台私信小编:“07”即可领取