python爬虫爬取赶集网数据 - 走看看

zoukankan html css js c++ java

python爬虫爬取赶集网数据

一.创建项目

scrapy startproject putu

二.创建spider文件

scrapy genspider patubole patubole.com

三.利用chrome浏览器分析出房价和标题的两个字段的xpath表达式，开始编写patubole.py文件。网络的爬取是通过这个文件进行的

以下代码是最终的代码

所建的patubole.py文件必须实现name,parse函数，start_url这三个属性

四.将爬取的数据保存到数据库sufang中。

（1）在pycharm中新建数据库

完成后会出现

（2）将数据存放在新建的数据库zufang的数据表sufang中

数据的爬取是有patubole.py实现的，数据的存储是由pipelines.py实现的，pipelines.py又是有items.py提供数据的支持

所以编写items.py

此时就要回过头来修改刚开是为了测试编写的patubole.py 文件

代码如下

3）在settings.py中进行PatuPipeline文件配置

ITEM_PIPELINES = {

'patu.pipelines.PatuPipeline': 300,

}

（5）pipelines.py文件代码，实现存储数据到数据库中

其中包含SQL的相关知识

最终结果

其中main.py文件是为了调式方便而添加的，可以不用，直接用相关命令启动爬虫

查看全文

相关阅读:
Python3和高性能全文检索引擎Redisearch进行交互
 Django项目连接多个数据库配置
 Redisearch实现的全文检索功能服务
 python一键搭建ftp服务
 yum提示错误: error: rpmdb: BDB0113 Thread/process 9866/140290246137664 failed:
Django + FastDFS (分布式远程服务器存储文件)
Docker来搭建分布式文件系统FastDfs
VSCode---REST Client接口测试辅助工具
 在Centos下使用Siege对Django服务进行压力测试
 Mysql联合索引的最左前缀原则以及b+tree

原文地址：https://www.cnblogs.com/Pythonmiss/p/10701278.html

热门文章
CDOJ--1141
HDU--4607
HDU--4099
HDU--4764
HDU--1272
HDU--4768
UESTC--1468
UESTC--1548
HDU--4705
javascript DES加密

Copyright © 2011-2022 走看看