python爬虫之反爬与反反爬技术

反爬技术

1、headers请求头协议 可以在每个网页的这里找到:

这里的Request Headers就可以找到我们需要加上的请求头信息,使用requests模块一般情况下加上’User-Agent’就行了。下面对请求头信息里的几个部分做一个简单介绍 User-Agent 一种身份标识,服务器可以通过它了解到发起请求的是否是浏览器,为了绕过反爬我们通常将程序中的此参数改成对应浏览器的。比如我的google浏览器的:User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/88.0.4324.182 Safari/537.36 Cookie 网站存储在用户终端上的数据 Referer 一般情况下涉及页面跳转都会有Referer值 对于请求头的反爬技术,我们通常使用request模块手动加上就行了,像这样: 2、ip限制 有的网站会对同一用户访问的频率进行统计,频率太快就有可能被鉴别为爬虫,我们只需将程序访问速率变慢就行啦 3、验证码 暂不做介绍 4、动态页面 暂不做介绍

经验分享 程序员 微信小程序 职场和发展