zoukankan      html  css  js  c++  java
  • 基于Redis的爬虫平台的实现

    一、需求:

    1.数据抓取:目标数据的下载、解析、入库功能。

    2.数据服务:黑名单、灰名单等查询服务。

    3.平台监控:平台各个模块的数据实时监控。

    二、WEB端效果展示:

    三、架构设计

    下载器、解析器、持久器、调度器都支持独立部署,可横向拓展部署多台服务。解耦。

    下载器内部开启多线程下载;

    解析器从待解析队列取数据,分支抽链、解析;

    调度器和持久器都放在web工程中,项目启动时抓取任务初始化+持久器任务开启。

    下载器、解析器、调度器、持久器都依赖于底层基础DAO服务。

    四、技术选型

    1.下载器和解析器:尝试过很多种,Jsoup、Jspider、Xpath、httpclient、HtmlUnit等。基本功能都可以。Jsoup可直接解析某个URL地址、HTML文本内容。它提供了一套非常省力的API,可通过DOM,CSS以及类似于jQuery的操作方法来取出和操作数据。Jsoup的强大选择器最终让我选择了它。

    2.生产消费介质:这里有很多种:消息队列MQ、缓存容器redis等都可以胜任。作为一次练手,采用单台redis作为消费介质(内部串行执行),可避免多线程并发问题,数据结构为list。

  • 相关阅读:
    第一章 数据集散地:数据库
    第六章 使用ADO.NET查询和操作数据
    第五章 使用ADO.NET访问数据库
    第四章 深入C#的String类
    IOS框架和服务
    一步步调试解决iOS内存泄漏
    app跳转
    iOS 视频直播
    学习心得
    iOS中FMDB的使用
  • 原文地址:https://www.cnblogs.com/dennyzhangdd/p/5941281.html
Copyright © 2011-2022 走看看