scrapy的去重机制 - 走看看

zoukankan html css js c++ java

scrapy的去重机制
scrapy是通过hashlib算法转成长度一致的url，然后再通过set集合去重的，有兴趣看源码

去重的中间件在scrapy 的 dupefilters.py文件中：

--> #去重器
RFDupeFilter()
-->有个函数叫
request_seen() #被scrapy/core/scheduler.py调用
这个是调度器
scheduler.py#文件中有个函数叫enqueue_request()的函数每来一个url就是通过这个函数来执行的
每次执行之前都会调用到 request_seen(request) 这个方法

这个方法就会生成一个指纹，指纹下面的掉用的就比较复杂了，简单的说就是要去执行 hashlib.sha1() 这个算法来生成一个固定长度的哈兮值

再然后就是在那个去重器中的
self.fingerprints = set()
就是通过上句代码执行了set集合来去重了
以上内容作为课堂笔记，如有雷同，请联系于我
查看全文

相关阅读:
Hadoop HDFS的Shell操作实例
 我来阿里的2年
 设计模式之迪米特原则（LoD）
设计模式之接口隔离原则
 设计模式之依赖倒置原则
 设计模式之里氏替换原则（LSP）
设计模式之单一职责原则（SRP）
Android开发系列之性能优化
 Android开发系列之屏幕密度和单位转换
 Android开发系列之ListView

原文地址：https://www.cnblogs.com/ArtisticMonk/p/9741350.html

Copyright © 2011-2022 走看看