zoukankan      html  css  js  c++  java
  • Python爬虫知识点——爬虫的基本原理

    爬虫的基本原理

    爬虫就是获取网页提取保存信息自动化程序

    获取网页:

    获取网页就是获取网页的源码,只要把源码获取下来,就可以从中提取想要的消息

    爬虫的流程:想网站的服务器发送一个请求,返回的响应体就是网页的源代码。

    >1,构造请求发送给服务器=>2.接受响应并解析

    提取信息:

    通过分析网页结构,提取网页信息。通常使用的解析库有:BeautifulSoup、lxml、pyquery,也可以使用正则,但是构造正则表达式比较复杂且易错

    保存数据:

    将提取的数据保存到某处以便后续利用。保存形式有:TXT、Json、数据库:MySQL、MongoDB、或远程服务器SFTP...

    自动化程序

    替人完成完成爬取工作的自动化程序,可以在抓取过程中进行异常处理……保证爬取的高效运行

    文章摘自崔庆才的《Python3网络爬虫开发实战》

  • 相关阅读:
    fmt命令
    wc命令
    grep命令
    head命令
    C/C++语法知识:typedef struct 用法详解
    邻接表无向图的介绍
    邻接矩阵无向图的介绍
    图的基本概念
    careercup-栈与队列 3.6
    careercup-栈与队列 3.5
  • 原文地址:https://www.cnblogs.com/nymrli/p/9387727.html
Copyright © 2011-2022 走看看