zoukankan      html  css  js  c++  java
  • python爬虫

    爬虫介绍爬虫定义爬虫基本流程

    爬虫介绍

    爬虫定义

    爬虫是请求网站并提取自己所需要数据的过程。通过我们的程序,可以代替我们向服务器发送请求,然后进行批量的数据下载。

    爬虫基本流程

    1. 发起请求
      通过url向服务器发送requests请求,请求可以包含额外的header信息。
      2.获取响应内容
      如果服务器正常响应,那么将受到一个response,response即为我们所请求的网页内容,可能包含htmljson二进制数据(图片、视频)等。
    2. 解析内容
      如果是html代码则可以使用网页解析器进行解析;如果是json数据则可以转换成json对象进行解析;如果是二进制数据则可以保存到文件进行进一步的处理。
    3. 保存数据
      可以保存到本地文件,也可以保存到数据库(mysql edismongodb等)。
    4. requests请求
      当我们通过浏览器向服务器发送requests请求时,这个request包含什么内容?可以通过chrome浏览器的开发人员工具(F12)查看。
    5. 请求方式
      最常用的请求方式包括get请求和post请求。
      post请求在开发中最常见的是通过表单进行提交,从用户角度来讲最常见的就是登陆验证。当你需要输入一些信息进行登陆的时候,这次请求就是post请求。
      get请求最常见的就是搜索回车之后,信息将以?间隔添加在url后面。类似于https://www.baidu.com/s?wd=python3%20requests。而且get请求是用来获取数据,是幂等的。
      其他还包括put请求(向服务端发送信息从而改变内容)和delete请求(删除资源)。
      对于资源的操作,其实都可以通过post/get完成,不需要用到put/delete,实际中put/delete也很少用。
    6. uri统一资源定位符
      一个网址、一个视频、一个图片都可以用uri去定义
    7. requests headers
      请求头,包括这次请求的类型,cookie信息以及浏览器类型等。
      请求头在我们进行网页抓取的时候,服务器会通过解析请求头来进行信息的审核,判断请求是否为合法请求。所以当我们通过程序伪装浏览器进行请求的时候可以设置请求头的信息。
    8. 请求体
      post请求会把用户信息包装在form-data里面进行提交,因此相比于get请求,post请求的Headers标签的内容会多出Form Data这个信息包。
      response
    • 响应状态
      通过Headers中的General可以看到status code,使用数字代码表示对于状态,200表示成功,301跳转,404找不到网页,502服务器错误等。

    • 响应头
      包括内容的类型,cookie信息等。

    • 响应体
      请求的目的就是为了得到响应体,包括html代码,json及二进制数据等。

    • requests模块
      安装使用pip install requests即可。
      通过requests进行网页请求

    import requests  
    response = requests.get('https://www.baidu.com')
    print(response.text) #输出结果为html,中文乱码
    response.encoding = 'utf-8' #修改编码
    print(response.text) #输出中文正常
    print(response.status_code) #输出状态码,200

    返回的response为文本时通过response.text读取;图片和视频等二进制文件通过response.content读取。

    通过添加请求头信息

    headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/49.0.2623.75 Safari/537.36'}
    response1 = requests.get('https://www.baidu.com', headers=headers)
    I am a slow walker,but I never walk backwards.
  • 相关阅读:
    数据访问(从数据库中访问数据)
    加载类、设计模式(单例模式和工厂模式)
    面向对象之静态
    面向对象三大特性之继承和多态
    面向对象三大特性之封装
    面向对象基础知识
    mysql下载与安装过程
    Idea添加依赖的步骤:
    Java JDBC 在IDEA环境下连接MySQL
    JAVA中集合HashMap嵌套联系
  • 原文地址:https://www.cnblogs.com/jiangshanwang/p/9181402.html
Copyright © 2011-2022 走看看