python解决反爬虫常见方法有哪些？-中华考试网

导航

优质课程直播间官网直达

网络开发

首页> python> python爬虫> 文章内容

python解决反爬虫常见方法有哪些？

来源 :中华考试网 2020-11-30

中

　　常见的反爬虫机制有：

　　分析用户请求的headers信息

　　检测用户行为，如短时间内同一个IP频繁访问

　　动态加载增加爬虫难度

　　验证码反爬虫

　　信息需要登录才能显示

　　常见的大家可能都见过，那么不常见的呢?

　　有的网站某些信息是加密的，可能浏览器上看到的是这样，我们复制出来看到的又不一样，这种需要解密;

　　有的网站会检测用户鼠标移动情况，爬虫肯定是没有鼠标移动的，那么肯定被干掉;

　　还有就是代理IP，我们都知道网上存在大量代理IP，通过一些网站我们可以拿到免费IP，但是别人网站页可以拿到的，别人拿到这些IP后直接BAN掉，所以失效，需使用更高效的ADSL拨号代理。

　　常见反爬机制

　　1、关于headers

　　常见的为浏览器加入headers，需要设置Requests Headers里面的内容

　　其中的每一个参数都有自己的作用，面对不同的网站时方法也不一样。

　　2、关于代理

　　简单方法就是购买，免费的和收费的相比还是差了不少。

　　3、关于Cookie

　　请求会返回多个Cookie，我们从其中找到最有效的Cookie，这回极大的提高效率

　　4、关于Selenium

　　Selenium可以完美解决反爬，因为它就是一个真实的浏览器在操作，网站没理由把它干掉。

　　但是也要看到Selenium的缺点，速度慢、效率低是最主要问题。自己写着玩玩可以，但是在真是的应用中，Selenium并不常见。

　　当然，你可以使用Selenium+Phantomjs，并对其进行优化，速度和别的爬虫还是没法比。

　　以上都是一些常见的应对反爬虫的解决措施。

分享到

网络开发

python解决反爬虫常见方法有哪些？

您可能感兴趣的文章

python解决反爬虫常见方法有哪些？

python分布式进程爬虫如何模拟？

celery如何在python爬虫中进行定时操作？

scrapy如何在python分布式爬虫中构建?

python分布式爬虫中spider_Worker节点是什么？

scrapy可以独立在python分布式爬虫内使用吗?

资讯

我的

网络开发

python解决反爬虫常见方法有哪些？

python课程免费送，限时领取

您可能感兴趣的文章

python解决反爬虫常见方法有哪些？

python分布式进程爬虫如何模拟？

celery如何在python爬虫中进行定时操作？

scrapy如何在python分布式爬虫中构建?

python分布式爬虫中spider_Worker节点是什么？

scrapy可以独立在python分布式爬虫内使用吗?

资讯

我的