zoukankan      html  css  js  c++  java
  • Python selenium get页面很慢时,处理办法

    Python selenium get页面很慢时,处理办法

    方法一:设置超时时间

    driver.get("url")等到页面全部加载渲染完成后才会执行后续的脚本。

    在执行脚本时,driver.get("url") ,如果当前的url页面内容较多加载特别慢,很费时间,但是我们需要操作的元素已经加载出来,可以将页面加载停掉,不影响后面的脚本执行,解决办法

    设置页面加载timeout,get操作: try get except 脚本window.stop(),  使用GeckoDriver上有效果,但是在ChromeDriver上还是会有问题,抛出异常timeout后续脚本不会继续执行

    from selenium import webdriver
    import re
     
    driver = webdriver.Firefox()
    #设定页面加载timeout时长,需要的元素能加载出来就行
    driver.set_page_load_timeout(20)
    driver.set_script_timeout(20)
    #try去get
    try:
        driver.get("http://tieba.baidu.com/p/5659969529?red_tag=w0852861182")
    except:
        print("加载页面太慢,停止加载,继续下一步操作")
        driver.execute_script("window.stop()")
    last_page_element = driver.find_element_by_css_selector("li.l_pager.pager_theme_4.pb_list_pager >a:nth-child(12)") #定位到元素尾页元素
    #获取尾页页码链接文本
    text = last_page_element.get_attribute("href")
    all_page_num = re.search("d+$",text).group() # 正则匹配到页码
    print("当前贴吧贴子总页数为:%s"%all_page_num)

    方法二:修改加载策略pageLoadStrategy(推荐)

    from selenium import webdriver
    from selenium.webdriver.common.desired_capabilities import DesiredCapabilities
    from selenium.webdriver.support.ui import WebDriverWait
    desired_capabilities
    = DesiredCapabilities.CHROME # 修改页面加载策略 desired_capabilities["pageLoadStrategy"] = "none" # 注释这两行会导致最后输出结果的延迟,即等待页面加载完成再输出 driver = webdriver.Chrome('browsers/chromedriver.exe') wait = WebDriverWait(driver, 10) #后面可以使用wait对特定元素进行等待 driver.get('http://qzone.qq.com/') # some code to work. print("Reach end.")

    将页面加载策略修改为none之后,页面即使在加载过程中,程序也可以继续执行。代码中的pageLoadStrategy属性可以设置为以下三种属性:

    normal:即正常情况下,selenium会等待整个界面加载完成(指对html和子资源的下载与解析,不包括ajax)

    eager:要等待整个dom树加载完成,即DOMContentLoaded这个事件完成,仅对html的内容进行下载解析

    none:当html下载完成之后,不等待解析完成,selenium会直接返回

    上面的代码用了最后一种解析方式——none,不作等待,直接返回,然后在后面的代码中可以用explicit_wait或者implicit_wait等方式来对特定元素进行等待捕获。 

    不建议使用eager模式,会导致browser没有生成,返回异常;

    使用none模式相当于生成了dom,但不加载其它文件(图片等)。

     

  • 相关阅读:
    2012年互联网教育行业观察
    SharePoint 2013的简单介绍
    让Node.js在Azure上运行3
    让Node.js在Azure上运行2
    有一个字符串 "I am a good man",设计一个函数,返回 "man good a am I"。
    json序列化与反序列化
    golang连接mysql数据库进行查询
    简单的WCF服务
    百钱买百鸡问题
    大叔程序员的第九天 @广播启动Activity
  • 原文地址:https://www.cnblogs.com/lizm166/p/13749899.html
Copyright © 2011-2022 走看看