zoukankan      html  css  js  c++  java
  • scrapy框架【爬虫的暂停和启动】

    Scrapy爬虫的暂停和启动

     

    scrapy的每一个爬虫,暂停时可以记录暂停状态以及爬取了哪些url,重启时可以从暂停状态开始爬取过的URL不在爬取

    实现暂停与重启记录状态

    方法一:

    复制代码
    1、首先cd进入到scrapy项目里(当然你也可以通过编写脚本Python文件直接在pycharm中运行)
    
    2、在scrapy项目里创建保存记录信息的文件夹
    
    3、执行命令:
    
      scrapy crawl 爬虫名称 -s JOBDIR=保存记录信息的路径
    
      如:scrapy crawl cnblogs -s JOBDIR=zant/001
    
      执行命令会启动指定爬虫,并且记录状态到指定目录
    
    爬虫已经启动,我们可以按键盘上的ctrl+c停止爬虫,停止后我们看一下记录文件夹,会多出3个文件,其中的requests.queue文件夹里的p0文件就是URL记录文件,这个文件存在就说明还有未完成的URL,当所有URL完成后会自动删除此文件
    
    当我们重新执行命令:scrapy crawl cnblogs -s JOBDIR=zant/001  时爬虫会根据p0文件从停止的地方开始继续爬取。
    复制代码

    方法二:

    在settings.py文件里加入下面的代码: 

    JOBDIR='sharejs.com'

    使用命令scrapy crawl 爬虫名,就会自动生成一个sharejs.com的目录,然后将工作列表放到这个文件夹里 

  • 相关阅读:
    c语言数组指针
    (4)activiti工作流引擎之uel表达式
    (3)activiti流程的挂起和激活
    (2)java程序走一遍工作流activiti
    (1)activiti认识以及数据库和插件配置
    linux 下路由配置
    lvs-dr+keepalived
    LVS-DR 配置测试
    简单认识TCP/IP协议
    mysql 主从同步-读写分离
  • 原文地址:https://www.cnblogs.com/youxiu123/p/11624511.html
Copyright © 2011-2022 走看看