zoukankan      html  css  js  c++  java
  • 如何使用lxml的XPath功能

    用python写爬虫呢,最常见的过滤方式有BeautifulSoup, css selector, XPath, 如果使用前两个,BeautifulSoup包就能解决,然而使用XPath,就要引入lxml包了。

     接下来我以我的博客为例,教大家怎么使用XPath。

    我们要做什么:

        关于XPath, 网上有诸多语法教程,我不再详细介绍。

        我们要抓取的是 http://www.cnblogs.com/chenyansu/ 中第三篇文章,7月15日的文章的简介,它在网页中显示为这样的:

       

      在chrome浏览器中右键点击相关正文,选择最后的检查选项:将在右边出现一个文档树,相关位置已被选定,右键,copy -> copy XPath
         得到结果:'//*[@id="main"]/div[3]/div[2]'
     
     

    实践代码:

    import requests
    from lxml import etree

    # requests包
    testurl = "http://www.cnblogs.com/chenyansu/"
    session = requests.Session()
    s = session.get(testurl)

    # lxml无法处理响应文件,用.content输出正文
    s = s.content

    # lxml包
    # 将对象转化为html
    s = etree.HTML(s)

    # html拥有xpath方法
    x = s.xpath('//*[@id="main"]/div[3]/div[2]')
    print(x)

    # 循环输出x内容
    for child in x:
    print(child.text)


     
     

     总体思路是:

    用requests包获得全部网页内容 -> 用.contente选取正文 ->  用lxml转换为html -> 使用XPath -> 将结果循环输出
     
  • 相关阅读:
    HDU 1686 Oulipo(kmp)
    openstack介绍以及流程
    openstack组件介绍
    linux之sort
    linux-ls命令
    CSRF-跨域访问保护
    WEB聊天
    python之路-Django进阶
    python之路-Django
    python之路-jQuery
  • 原文地址:https://www.cnblogs.com/onemorepoint/p/7274706.html
Copyright © 2011-2022 走看看