关于TB的post秒杀原理 爬虫攻防参考

学了爬虫有一段时间了,花了几个月对某商城的下单流程进行模拟,下面手把手教学,并分析一些握手的原理。希望大家看完能得到一些对爬虫防范的启发与思考。

购物商场下单分为两个大流程,提交订单和确认订单。逐一分析:

提交订单

这边以淘宝商城为例进行分析。

商品链接:

打开chrome浏览器,进入 taobao.com,登录淘宝后进入商品链接,并按F12打开控制台,按图示完成两步操作。

然后点击立即购买,找到第一个html文件点击进行图示操作。

经过一波分析和不断地重复实践可得知提交订单需要一个URL及表单参数buy_param。首先是对URL的分析,我获取订单的URL:

经过切换不同的商品进行订单的提交可发现:

其中只有 发生了变化,由此可知URL组成: + +

此时回到商品详情页:

各参数如图所示:

对比订单所需参数 buy_param:600411925165_1_4647223169012,发现 其由店铺ID:600411925165 + 购买数量(推测得出) + 商品skuid:4647223169012 组成;通过这几个参数的组合可得到 buy_param。

而URL 中的 可直接搜索网页源代码找到,后面用正则匹配可以得出各参数值。如图:

这样通过py的request请求即可获取订单。因博主时间有限,暂不分析确认订单所需参数及方法,但完整源码+注释已完成,感兴趣的同学可直接加企鹅群带走源码进行测试。

企鹅: 610600351

其中已完成的部分包括,扫码登录,cookie 保持,滑块验证(失效),以及下单。

欢迎诸位带走测试,也希望能让大家通过阅读代码得到爬虫方面的攻防启发。

如下次有空再补坑。

经验分享 程序员 微信小程序 职场和发展