zoukankan      html  css  js  c++  java
  • pyspider爬虫框架的安装和使用

    pyspider是国人binux编写的强大的网络爬虫框架,它带有强大的WebUI、脚本编辑器、任务监控器、项目管理器以及结果处理器,同时支持多种数据库后端、多种消息队列,另外还支持JavaScript渲染页面的爬取,使用起来非常方便。

    pyspider是支持JavaScript渲染的,而这个过程是依赖于PhantomJS的,所以还需要安装PhantomJS。

    官方文档:http://docs.pyspider.org/
    PyPI:https://pypi.python.org/pypi/pyspider
    GitHub:https://github.com/binux/pyspider
    官方教程:http://docs.pyspider.org/en/latest/tutorial
    在线实例:http://demo.pyspider.org

    一、安装pyspider

    pip3 install pyspider

    Windows下可能会出现这样的错误提示:

    Command "python setup.py egg_info" failed with error code 1 in /tmp/pip-build-vXo1W3/pycurl

    这是PyCurl安装错误,此时需要先安装PyCurl库。http://www.lfd.uci.edu/~gohlke/pythonlibs/#pycurl

    启动pyspider:

    pyspider all

    这时pyspider的Web服务就会在本地5000端口运行。直接在浏览器中打开http://localhost:5000/,即可进入pyspider的WebUI管理页面

  • 相关阅读:
    JVM 垃圾收集与内存分配
    JVM 内存管理机制
    JVM 启动调优总结
    Visual Studio 2019 秘钥
    dubbo初学采坑记
    Intellij idea 一个窗口打开多模块并添加依赖
    Intellij idea 自动生成serialVersionUID
    office visio 2019 下载激活
    ASP.NET Core中的配置
    electron快捷键
  • 原文地址:https://www.cnblogs.com/xuyingzhong/p/9345575.html
Copyright © 2011-2022 走看看