Python爬取美女图片，看到了意想不到的场景_python爬虫爬取女生图片

作者：繁依Fanyi0 | 2024-03-13 18:57:40

踩

python爬虫爬取女生图片

最近使用Python，写了几个爬虫练练手，网上的教程有很多，但是有的已经不能爬了，主要是网站经常改，可是爬虫还是有通用的思路的，即下载数据、解析数据、保存数据。下面一一来讲。

python练手项目——爬取网页美女图片

1.下载数据
- 动态网页
- 下载数据的模块
2.解析数据
- 正则表达式说明
3.保存数据

1.下载数据

首先打开要爬的网站，分析URL，每打开一个网页看URL有什么变化，有可能带上上个网页的某个数据，例如xxID之类，那么我们就需要在上一个页面分析HTML，找到对应的数据。如果网页源码找不到，可能是ajax异步加载，去xhr里去找。在这里插入图片描述
有的网站做了反爬的处理，可以添加User-Agent ：判断浏览器

self.user_agent = 'Mozilla/4.0 (compatible; MSIE 5.5; Windows NT)'
# 初始化 headers
self.headers = {
   'User-Agent': self.user_agent}
1
2
3
4

如果不行，在Chrome上按F12分析请求头、请求体，看需不需要添加别的信息，例如有的网址添加了referer当前网页的来源，那么我们在请求的时候就可以带上。按Ctrl + Shift + C，可以定位元素在HTML上的位置

动态网页

有一些网页是动态网页，我们得到网页的时候，数据还没请求到呢，当然什么都提取不出来，用Python 解决这个问题只有两种途径：直接从JavaScript 代码里采集内容，或者用Python 的第三方库运行JavaScript，直接采集你在浏览器里看到的页面。

1.找请求，看返回的内容，网页的内容可能就在这里。然后可以复制请求，复杂的网址中，有些乱七八糟的可以删除，有意义的部分保留。切记删除一小部分后先尝试能不能打开网页，如果成功再删减，直到不能删减。

2.Selenium：是一个强大的网络数据采集工具（但是速度慢），其最初是为网站自动化测试而开发的。近几年，它还被广泛用于获取精确的网站快照，因为它们可以直接运行在浏览器上。Selenium 库是一个在WebDriver上调用的API。有点儿像可WebDriver以加载网站的浏览器，但是它也可以像BeautifulSoup对象一样用来查找页面元素，与页面上的元素进行交互（发送文本、点击等），以及执行其他动作来运行网络爬虫。

PhantomJS：是一个“无头”（headless）浏览器。它会把网站加载到内存并执行页面上的JavaScript，但是它不会向用户展示网页的图形界面。把Selenium和PhantomJS 结合在一起，就可以运行一个非常强大的网络爬虫了，可以处理cookie、JavaScript、header，以及任何你需要做的事情。

下载数据的模块

下载数据的模块有urllib、urllib2及Requests

Requests相比其他俩个的话，支持HTTP连接保持和连接池，支持使用cookie保持会话，支持文件上传，支持自动确定响应内容的编码，支持国际化的 URL 和 PO

声明：本文内容由网友自发贡献，不代表【wpsshop博客】立场，版权归原作者所有，本站不承担相应法律责任。如您发现有侵权的内容，请联系我们。转载请注明出处：https://www.wpsshop.cn/w/繁依Fanyi0/article/detail/230072