基于scrapy-redis两种形式的分布式爬虫
基于redis分布式部署
scrapy框架是否可以自己实现分布式?
- 不可以。原因有二。
其一:因为多台机器上部署的scrapy会各自拥有各自的调度器,这样就使得多台机器无法分配start_urls列表中的url。(多台机器无法共享同一个调度器)
其二:多台机器爬取到的数据无法通过同一个管道对数据进行统一的数据持久出存储。(多台机器无法共享同一个管道)
基于scrapy-redis组件的分布式爬虫
- scrapy-redis组件中为我们封装好了可以被多台机器共享的调度器和管道,我们可以直接使用并实现分布式数据爬取。
- 实现方式:
1.基于该组件的RedisSpider类
2.基于该组件的RedisCrawlSpider类
分布式实现流程:上述两种不同方式的分布式实现流程是统一的
- 3.1 下载scrapy-redis组件:pip install scrapy-redis
- 3.2 redis配置文件的配置:
3.3 修改爬虫文件中的相关代码:
- 将爬虫类的父类修改成基于RedisSpider或者RedisCrawlSpider。注意:如果原始爬虫文件是基于Spider的,则应该将父类修改成RedisSpider,如果原始爬虫文件是基于CrawlSpider的,则应该将其父类修改成RedisCrawlSpider。
- 注释或者删除start_urls列表,切加入redis_key属性,属性值为scrpy-redis组件中调度器队列的名称
3.4 在配置文件中进行相关配置,开启使用scrapy-redis组件中封装好的管道
3.5 在配置文件中进行相关配置,开启使用scrapy-redis组件中封装好的调度器
3.6 在配置文件中进行爬虫程序链接redis的配置:
3.7 开启redis服务器:redis-server 配置文件
3.8 开启redis客户端:redis-cli
3.9 运行爬虫文件:scrapy runspider SpiderFile
3.10 向调度器队列中扔入一个起始url(在redis客户端中操作):lpush redis_key属性值 起始url
总结
"""
分布式爬取步骤:
一、修改爬虫文件
1 导入模块 from scrapy_redis.spiders import RedisSpider
2 将当前爬虫类的父类修改为导入的类
3 将allowed_domains和start_urls进行删除
4 添加一个新的属性 redis_key = 'xxx' # 表示redis_key的属性值就是可以被共享的调度器队列的名称
二、进行配置文件的配置
1 保证爬虫文件发起的请求都会被提交到可以被共享的调度器的队列中
SCHEDULER = "scrapy_redis.scheduler.Scheduler"
2 保证爬虫文件提交的item可以存储在可以被共享的管道中
ITEM_PIPELINES = {
'scrapy_redis.pipelines.RedisPipeline': 400
}
3 配置最终数据存储的redis数据库
REDIS_HOST = 'redis服务的ip地址'
REDIS_PORT = 6379
REDIS_ENCODING = ‘utf-8’
REDIS_PARAMS = {‘password’:’123456’}
4 将redis数据库的配置文件进行配置:关闭保护模式和注释掉bind
5 开启redis服务和客户端
6 执行爬虫文件:
scrapy runspider xxx.py(爬虫文件源文件名称)
7 向调度器队列中放入一个起始的url
"""
""" 分布式爬取步骤: 一、修改爬虫文件 1 导入模块 from scrapy_redis.spiders import RedisSpider 2 将当前爬虫类的父类修改为导入的类 3 将allowed_domains和start_urls进行删除 4 添加一个新的属性 redis_key = 'xxx' # 表示redis_key的属性值就是可以被共享的调度器队列的名称 二、进行配置文件的配置 1 保证爬虫文件发起的请求都会被提交到可以被共享的调度器的队列中 SCHEDULER = "scrapy_redis.scheduler.Scheduler" 2 保证爬虫文件提交的item可以存储在可以被共享的管道中 ITEM_PIPELINES = { 'scrapy_redis.pipelines.RedisPipeline': 400 } 3 配置最终数据存储的redis数据库 REDIS_HOST = 'redis服务的ip地址' REDIS_PORT = 6379 REDIS_ENCODING = ‘utf-8’ REDIS_PARAMS = {‘password’:’123456’} 4 将redis数据库的配置文件进行配置:关闭保护模式和注释掉bind 5 开启redis服务和客户端 6 执行爬虫文件: scrapy runspider xxx.py(爬虫文件源文件名称) 7 向调度器队列中放入一个起始的url """
配置文件
# 使用scrapy-redis组件的去重队列 # 数据指纹(将所有爬取过的数据都做了数据指纹,实现了增量爬虫)
DUPEFILTER_CLASS = "scrapy_redis.dupefilter.RFPDupeFilter"
# 保证爬虫文件发起的请求都会被提交到可以被共享的调度器的队列中
SCHEDULER = "scrapy_redis.scheduler.Scheduler"
# 是否允许暂停
# 配置调度器是否要持久化,也就是当爬虫结束了,要不要清空redis中请求队列和去重指纹的set
# 如果是True,就表示要持久化存储,就不清空数据,否则清空数据
SCHEDULER_PERSIST = True
# """
# 增量式爬虫:
# 网站更新之后,爬过的数据就不爬类
# scrapy_redis自动实现了增量式爬虫
# """
# 使用scrapy_redis中封装好的可以被共享的管道
ITEM_PIPELINES = {
'scrapy_redis.pipelines.RedisPipeline': 400
}
# 配置redis
REDIS_HOST = '192.168.12.36'
REDIS_PORT = 6379
REDIS_ENCODING = "utf-8"
# REDIS_PARAMS = {"password": ""}
【ThinkingInC++】2、输入和输出流
Caused by: java.lang.ClassNotFoundException: javax.transaction.TransactionManager
SpringMVC注释启用
XML wsdl soap xslt xsl ide
一个解析RTSP 的URL函数
PHP:header()函数
jquery实现鼠标焦点十字效果
拼出漂亮的表格
Oracle中如何插入特殊字符:& 和 ' (多种解决方案)
- 最新文章
-
org.quartz.utils.UpdateChecker Checking for available updated version of Quartz..
Spring boot将配置属性注入到bean 专题
打赏功能的实现
学习SpringMVC——国际化+上传+下载
myBatis系列
Android studio aidl文件的创建使用
Android 使用AIDL调用外部服务
MyBatis学习总结(五)——实现关联表查询
Andriod界面设计适配和Android Studio中的资源
在eclipse中怎样给项目添加关联项目
- 热门文章
-
eclipse设置关联文件打开方式
微信公众平台高级群发接口
去掉chrome记住密码后自动填充表单的黄色背景
Java 5种字符串拼接方式性能比较。
CSS3添加属性选择: [attribute*=value] 、[attribute^=value] 和[attribute$=value]
接收一个IT招聘促销信息,试着想参加,有兴趣的可以携手并进,共同。
看德日进,凯文·凯利与Kurzweil老师?
SendRedirect和forward差分
hdu 3695 Computer Virus on Planet Pandora(AC自己主动机)
由于抽签HT For Web ComboBox下拉框组件