zoukankan      html  css  js  c++  java
  • Python爬虫入门教程 30-100 高考派大学数据抓取 scrapy

    1. 高考派大学数据----写在前面

    终于写到了scrapy爬虫框架了,这个框架可以说是python爬虫框架里面出镜率最高的一个了,我们接下来重点研究一下它的使用规则。

    安装过程自己百度一下,就能找到3种以上的安装手法,哪一个都可以安装上
    可以参考 https://scrapy-chs.readthedocs.io/zh_CN/0.24/intro/install.html 官方说明进行安装。

    2. 高考派大学数据----创建scrapy项目

    通用使用下面的命令,创建即可

    scrapy startproject mySpider

    完成之后,你的项目的目录结构为

    在这里插入图片描述

    每个文件对应的意思为

    • scrapy.cfg 项目的配置文件
    • mySpider/ 根目录
    • mySpider/items.py 项目的目标文件,规范数据格式,用来定义解析对象对应的属性或字段。
    • mySpider/pipelines.py 项目的管道文件,负责处理被spider提取出来的item。典型的处理有清理、 验证及持久化(例如存取到数据库)
    • mySpider/settings.py 项目的设置文件
    • mySpider/spiders/ 爬虫主目录
  • 相关阅读:
    deepcopy list,dict
    朴素贝叶斯
    COMP6714 week2a skipTo()
    batch normalization / layer normalization
    self-attention Transformer
    44. 通配符匹配
    FOJ 10月赛题 FOJ2198~2204
    CF #323 DIV2 D题
    HDU 5467
    CF #321 (Div. 2) E
  • 原文地址:https://www.cnblogs.com/hzcya1995/p/13311567.html
Copyright © 2011-2022 走看看