如何用爬虫爬取精美的图片!
起因: 因为要做和图像识别有关的东西,需要很多的图片,但我这个人很懒,又不想自己动手找。于是乎,我就打起了爬虫的主意。我开始找网上的各种爬虫教程和一些经典案例,但是我没有找到一个即简单又完整的爬虫程序。没办法,我只有自己动手啦。如果你和我一样,想快速学会爬虫,编写出易于理解、完整且简单的小爬,你可以继续往下看看。 准备工作: 1、爬取的网站:wallhaven: 【该网站的图片高清幽美、令人赞叹,两个字"极好"】 类似于下面这张图,是不是还不错? 2、涉及到的学习内容 编写语言:python 【】 python包: (1)BeautifulSoup:BeautifulSoup4和 lxml 一样,Beautiful Soup 也是一个HTML/XML的解析器,主要的功能也是如何解析和提取 HTML/XML 数据。 (2)requests:作为用户角色,请求页面。 分析爬取内容: 1、分析主页面 主界面可以使用搜索,若想筛选出有雾的图像,可直接在搜索框中查找"FOG" 跳转页面后观察规律,url = https://wallhaven.cc/search?q=FOG&page=%s"%(i)是这样的。q是查询的参数,page表示第几页。 2、分析源代码的形式 目的很明确,需要高清的图片,因此,需要点击对应的图片,跳转到高清的图片页面中,然后再提取高清图片。 3、获取代理对象 User-Agent:通过Headers找到。 下面通过具体的代码,来解释整个流程。
部分结果展示: 上面的过程较为简单,建议小伙伴们先测试一下,看效果,然后一步一步来理解。
若是有不理解的地方,可以在下方留言,我看到后会及时回复的。有问题咱一起解决,共同进步。
