Python爬虫-什么是爬虫？

zoukankan html css js c++ java

Python爬虫-什么是爬虫？
百度百科是这样定义爬虫的：

网络爬虫（又被称为网页蜘蛛，网络机器人，在FOAF社区中间，更经常的称为网页追逐者），是一种按照一定的规则，自动地抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁、自动索引、模拟程序或者蠕虫。

通俗的解释：

　　打开一个网页，里面有网页内容吧，想象一下，有个工具，可以把网页上的内容获取下来，存到你想要的地方，这个工具就是我们今天的主角：爬虫。

　　打开浏览器（强烈建议谷歌浏览器），找到浏览器地址栏，然后在里敲网址https://music.163.com/，你会看到网页内容。

　　鼠标在页面上点击右键，然后点击查看网页源代码（view page source）。看到这些文字了吗？这才是网页本来的样子。

　　其实，所有的网页都是HTML+CSS+JavaScript代码，只不过浏览器将这些代码解析成了上面的网页，我们的小爬虫抓取的其实就是这些代码中的文本啦。
　　这不合理啊，难不成那些图片也是文本？

　　恭喜你，答对了。回到浏览器中有图的哪个tab页，鼠标右键，点击Inspect。会弹出一个面板，点击板左上角的箭头，点击虐狗图片，你会看到下面有红圈圈的地方，是图片的网络地址。图片可以通过该地址保存到本地哦。

　　没错，我们的小爬虫抓取的正是网页中的数据，但是前提是你要知道你想要抓取什么数据，你的目标网站是什么，才可以把想法变成现实的哦。

　　说了这么多，学习Python爬虫还是需要一定的基础知识呢？
　　注（参考）：https://www.cnblogs.com/Albert-Lee/p/6226699.html
查看全文

相关阅读:
linux基础学习-14.3-第四关考试题
 linux基础学习-14.2-命令补充(4)
linux基础学习-14.1-定时任务练习题
 引入jason依赖
 模糊查询sql语句
 多行删除操作
 分页助手依赖引入
 在web.xml文件中读取spring-security.xml配置文件
 spring-security框架引入依赖
 安全框架配置文件（spring-security.xml）

原文地址：https://www.cnblogs.com/MakeView660/p/9577175.html