scrapy - 走看看

zoukankan html css js c++ java

scrapy

# -*- coding: utf-8 -*-
import scrapy
import chardet
from scrapy.spider import BaseSpider
from scrapy.selector import HtmlXPathSelector
from scrapy.utils.url import urljoin_rfc
from scrapy.http import Request

class Greasemonkey1Spider(scrapy.Spider):
    name = "greasemonkey1"
    allowed_domains = ["wiki.greasespot.net"]
    start_urls = (
        'http://wiki.greasespot.net/',
    )

    def parse(self, response):
        baseurl = response.url
        print 'baseurl = ', baseurl

        hxs = response.xpath(r'//a')
        for path in hxs:
            titles = path.xpath(r'text()').extract()
            urls = path.xpath(r'@href').extract()
            if len(titles) == 0:
                continue
            if len(urls) == 0:
                continue
            title = titles[0]
            url = urls[0]
            if title == '':
                continue
            if len(url) == 0:
                continue
            if url[0] == '#':
                continue
            print '2222', title, url
#
            url2 = urljoin_rfc(baseurl, url)
            print '=== ', url2
            yield scrapy.Request(url2, callback=self.parse)

查看全文

相关阅读:
PowerDesigner中生成SQL SERVER2005字段注释和导出图片的方法
 右键显示打开控制台
 dubbo 的 Protocol 类
 nacos 的 grpc
shell 替换文本中为空格，多行为本合并为一行
 gcc、python3、python性能分析工具安装
 kafka listeners和advertised
Default Activity not found 问题解决
 使用Global Mapper计算kml中面状图形的面积
 jeecg-boot 报表组——折线图初始化显示部分图例，部分变灰

原文地址：https://www.cnblogs.com/zhang-pengcheng/p/4223074.html

Copyright © 2011-2022 走看看