简介
上一篇写的时间有点长了,接下来继续把美空网的爬虫写完,这套教程中编写的爬虫在实际的工作中可能并不能给你增加多少有价值的技术点,因为它只是一套入门的教程,老鸟你自动绕过就可以了,或者带带我也行。
爬虫分析
首先,我们已经爬取到了N多的用户个人主页,我通过链接拼接获取到了
http://www.moko.cc/post/da39db43246047c79dcaef44c201492d/list.html
在这个页面中,咱们要找几个核心的关键点,发现平面拍摄
点击进入的是图片列表页面。
接下来开始代码走起。
获取所有列表页面
我通过上篇博客已经获取到了70000(实际测试50000+)用户数据,读取到python中。
这个地方,我使用了一个比较好用的python库pandas,大家如果不熟悉,先模仿我的代码就可以了,我把注释都写完整。
import pandas as pd
# 用户图片列表页模板
user_list_url