scrapy shell 的科学使用
scrapy shell 是在scrapy网络爬虫开发时非常有用的测试工具
在命令行里输入
>scrapy shell url
就可以获得这个网页返回的response进行以下操作
这样对于一些对爬虫没有限制的网站是可行的,但是对于一些网站来说是会被制裁的,比如说豆瓣网
这个时候我们就需要在这个里面添加headers
这个时候我们需要这样提交url
scrapy shell -s USER_AGENT='Mozilla/5.0' http://www.douban.com
这样就可以完成模拟headers的目的了