python 一只美好的爬虫
本次 我们要爬取的是一个漂亮mm的网站~
来来来 话不多说,直奔主题
首先 观察这个网站~: 哇,真好看 ,,咳咳
下边的页面有 16页之多。那么我们就先爬个10页的吧
第一步: 踩点
所谓兵马未动,粮草先行:
1 观察网站url 格式
多观察几页发现: http://blog.cuishuai.cc/meizi/page_1.html http://blog.cuishuai.cc/meizi/page_2.html http://blog.cuishuai.cc/meizi/page_3.html
发现 : 网页以1.2.3.4,5…划分: 我们在开看看底层
发现 : 确实,这个网页第几页第几页很简单,就一个数字1 那么访问不同页面的代码 就非常好写了
page_url = http://blog.cuishuai.cc/meizi/page_ + str(i) + .html
2:再来观察图片格式
图片以 /img src" 打头 以 .jpg结尾 那也很好识别了
