zoukankan      html  css  js  c++  java
  • python接口自动化29-requests-html支持JavaScript渲染页面

    前言

    requests虽好,但有个遗憾,它无法加载JavaScript,当访问一个url地址的时候,不能像selenium一样渲染整个html页面出来。
    requests-html终于可以支持JavaScript了,这就相当于是一个真正意义上的无界面浏览器了。
    中文文档地址:https://cncert.github.io/requests-html-doc-cn/#/

    JavaScript支持

    当第一次使用render() 渲染页面的时候,会自动下载chromium,但只会下载这一次,后面就不会下载了。

    from requests_html import HTMLSession
    session = HTMLSession()
    
    r = session.get('https://www.cnblogs.com/yoyoketang/')
    r.html.render()  # 首次使用,自动下载chromium
    

    render()渲染页面

    到底渲染html页面是个什么概念呢?可以请求之后对比抓包看下,不使用render()之前,只发一个请求

    使用render()之后,会发很多请求,类型于手工在浏览器上输入url后,浏览器渲染整个完整的页面,这正是我们想要的模拟浏览器发请求

    案例

    接下来访问我的博客地址后,抓取我的个人信息

    from requests_html import HTMLSession
    session = HTMLSession()
    
    r = session.get('https://www.cnblogs.com/yoyoketang/', verify=False)
    r.html.render()  # 首次使用,自动下载chromium
    # print(r.html.html)
    d = r.html.find("#profile_block", first=True)
    print(d.text)
    

    打印结果

    昵称:上海-悠悠
    园龄:2年4个月
    粉丝:1570
    关注:73
    +加关注
    

    困扰很久的问题终于找到了解决办法,更多强大的功能可以去requests-html的GitHub地址https://github.com/kennethreitz/requests-html

  • 相关阅读:
    vue动态组件
    服务端渲染和nuxt简单介绍
    nuxt Window 或 Document未定义解决方案
    知乎专栏开放性api
    小程序的一些坑
    搭建微服务器(续)
    调研pwa和sw
    mysql索引原理以及优化
    装饰器
    斐波那契数列和小青蛙跳跳跳问题
  • 原文地址:https://www.cnblogs.com/yoyoketang/p/10663392.html
Copyright © 2011-2022 走看看