scrapy爬虫框架实例一，爬取自己博客

zoukankan html css js c++ java

scrapy爬虫框架实例一，爬取自己博客

　　本篇就是利用scrapy框架来抓取本人的博客，博客地址：http://www.cnblogs.com/shaosks

　　scrapy框架是个比较简单易用基于python的爬虫框架，相关文档：http://scrapy-chs.readthedocs.org/zh_CN/latest/

　　几个比较重要的部分：

　　items.py：用来定义需要保存的变量，其中的变量用Field来定义，有点像python的字典

　　pipelines.py：用来将提取出来的Item进行处理，处理过程按自己需要进行定义

　　spiders：定义自己的爬虫

　　爬虫的类型也有好几种：

　　1）spider:最基本的爬虫，其他的爬虫一般是继承了该最基本的爬虫类，提供访问url，返回response的功能，会默认调用parse方法

　　2）CrawlSpider：继承spider的爬虫，实际使用比较多，设定rule规则进行网页的跟进与处理，注意点：编写爬虫的规则的时候避免使用parse名，因为这会覆盖继承的spider的的方法parse造成错误。其中比较重要的是对Rule的规则的编写，要对具体的网页的情况进行分析。

　　3）XMLFeedSpider 与 CSVFeedSpider

　　代码实现：

　　items.py下的

　　

　　pipelines.py

　　

　　myspider.py

　　

　　settings.py

　　

　　执行命令导出csv文件

　　D:workscrapyCodecnblog> scrapy crawl myspider -o spider.csv

结果数据

要获取动态渲染的数据， scrapy框架本身没有获取这种数据的功能，要利用第三方库scrapy-splash，下载：https://pypi.python.org/pypi/scrapy-splash#downloads

这个以后再做.

查看全文

相关阅读:
C++ template —— 模板基础（一）
《C++标准程序库》笔记之四
 《C++标准程序库》笔记之三
 《C++标准程序库》笔记之二
 C++标准程序库笔记之一
 JAVA中JPA的主键自增长注解设置
 SVN中服务器地址变更
 JAVA中正则表达式常用的四个方法
 反编译class文件并重新编译的方法
 JAVA中文件与Byte数组相互转换的方法

原文地址：https://www.cnblogs.com/shaosks/p/6895010.html