zoukankan html css js c++ java

python爬虫模块之调度模块

调度模块也就是对之前所以的模块的一个调度，作为一个流水的入口。

下面的代码的获取数据部分暂时没有写，细节部分在实际开发中，要根据要求再定义，这里说的是使用方法

from savedb import DataOutput
from getnodelist import GetNodeList
from gethtml import Gethtml
from urlqueue import URLQueue


class Run(object):
    def __init__(self):
        self.queue = URLQueue()
        self.downloader = Gethtml()
        self.parser = GetNodeList()
        self.output = DataOutput()

    def crawl(self, root_url):
        # 添加入口URL
        self.queue.add_new_url(root_url)
        # 判断URL管理器是否有新的URL，同时计算抓取了多少个url
        while (self.queue.has_new_url() and self.queue.old_url_size() < 100):
            try:
                new_url = self.queue.get_new_url()
                html = self.downloader.get_source(new_url)
                new_urls = self.parser.use_xpath(new_url, html)
                self.queue.add_new_urls(new_urls)
                # 数据存储器存储文件
                data="" #datalist一般是上面取xpath获取值的一个集合这里略。
                self.output.store_data(data)
                print("已经抓取%s个链接" % self.queue.old_url_size())
            except Exception:
                print("err")

if __name__ == "__main__":
    spider_man = Run()
    spider_man.crawl("https://www.baidu.com")

查看全文

相关阅读:
I hate it [HDU 1754]
K Besk [POJ 3111]
Little Pony and Alohomora Part 3 [HihoCoder 1075]
Shuffle 洗牌 [AHOI 2005]
Qt打包程序
 linux用户相关命令介绍_用户密码与用户组相关命令_yum软件包相关_编译安装
 find查找条件_find处理动作_正则表达式_linux压缩命令_tar追加文件
 linux文本相关工具_文件权限相关_vim命令介绍_vim帮助信息
 linux目录介绍_目录命令介绍_文件增删改查_输入和输出
 linux系统命令linux命令介绍_bash特性_基础命令介绍

原文地址：https://www.cnblogs.com/c-x-a/p/9175327.html