基于scrapy-redis组件的分布式爬虫

zoukankan html css js c++ java

基于scrapy-redis组件的分布式爬虫
scrapy-redis组件安装

分布式实现流程

scrapy-redis组件安装

- 下载scrapy-redis组件：pip install scrapy-redis

- 更改redis配置文件：

注释该行：bind 127.0.0.1，表示可以让其他ip访问redis 将yes该为no：protected-mode no，表示可以让其他ip操作redis

- 基于scrapy-redis组件的分布式爬虫

      - scrapy-redis组件中为我们封装好了可以被多台机器共享的调度器和管道，我们可以直接使用并实现分布式数据爬取。

      - 实现方式：

          1.基于该组件的RedisSpider类

          2.基于该组件的RedisCrawlSpider类

分布式实现流程

- 修改爬虫文件中的相关代码

- 将爬虫类的父类修改成基于RedisSpider或者RedisCrawlSpider。
　　注意：如果原始爬虫文件是基于Spider的，则应该将父类修改成RedisSpider，如果原始爬虫文件是基于CrawlSpider的，则应该将其父类修改成RedisCrawlSpider。 - 注释或者删除start_urls列表，切加入redis_key属性，属性值为scrpy-redis组件中调度器队列的名称

- 在配置文件中进行相关配置，开启使用scrapy-redis组件中封装好的管道

ITEM_PIPELINES = { 'scrapy_redis.pipelines.RedisPipeline': 400 }

- 在配置文件中进行相关配置，开启使用scrapy-redis组件中封装好的调度器

# 使用scrapy-redis组件的去重队列 DUPEFILTER_CLASS = "scrapy_redis.dupefilter.RFPDupeFilter" # 使用scrapy-redis组件自己的调度器 SCHEDULER = "scrapy_redis.scheduler.Scheduler" # 是否允许暂停 SCHEDULER_PERSIST = True

- 在配置文件中进行爬虫程序链接redis的配置

REDIS_HOST = 'redis服务的ip地址' REDIS_PORT = 6379 REDIS_ENCODING = ‘utf-8’ REDIS_PARAMS = {‘password’:’123456’}

- 开启redis服务器：redis-server 配置文件

- 开启redis客户端：redis-cli

-  运行爬虫文件：scrapy runspider SpiderFile

- 向调度器队列中扔入一个起始url（在redis客户端中操作）：lpush redis_key属性值起始url
查看全文

相关阅读:
【原】ios打包ipa的四种实用方法(.app转.ipa)
【原】Mac下统计任意文件夹中代码行数的工具——cloc
【原+转】用CMake代替makefile进行跨平台交叉编译
 【原】iOS设计模式之：建造者模式Builder Pattern,用于改进初始化参数
 【原】Github系列之一：一起做仿天气类应用中的实时模糊效果LiveBlur
【原】iOS：一种直接修改frame的某个属性的方法
 【原】iOS优秀开源项目总结
 【原】你真的懂iOS的autorelease吗？
【原】iOS容易造成循环引用的三种场景,就在你我身边!
Failure [DELETE_FAILED_INTERNAL_ERROR]之后rm apk卸载

原文地址：https://www.cnblogs.com/caodneg7/p/10252013.html

基于scrapy-redis组件的分布式爬虫

scrapy-redis组件安装

分布式实现流程