如何使用lxml的XPath功能 - 走看看

zoukankan html css js c++ java

如何使用lxml的XPath功能
用python写爬虫呢，最常见的过滤方式有BeautifulSoup, css selector, XPath，如果使用前两个，BeautifulSoup包就能解决，然而使用XPath，就要引入lxml包了。

接下来我以我的博客为例，教大家怎么使用XPath。
我们要做什么：

关于XPath，网上有诸多语法教程，我不再详细介绍。

我们要抓取的是 http://www.cnblogs.com/chenyansu/ 中第三篇文章，7月15日的文章的简介，它在网页中显示为这样的：

　　

　　在chrome浏览器中右键点击相关正文，选择最后的检查选项：将在右边出现一个文档树，相关位置已被选定，右键，copy -> copy XPath

　得到结果：'//*[@id="main"]/div[3]/div[2]'

实践代码：

import requests
from lxml import etree

# requests包
testurl = "http://www.cnblogs.com/chenyansu/"
session = requests.Session()
s = session.get(testurl)

# lxml无法处理响应文件，用.content输出正文
s = s.content

# lxml包
# 将对象转化为html
s = etree.HTML(s)

# html拥有xpath方法
x = s.xpath('//*[@id="main"]/div[3]/div[2]')
print(x)

# 循环输出x内容
for child in x:
print(child.text)

总体思路是：

用requests包获得全部网页内容 -> 用.contente选取正文 -> 用lxml转换为html -> 使用XPath -> 将结果循环输出

原文链接：http://www.cnblogs.com/chenyansu/
查看全文

相关阅读:
bootstrap里的下拉菜单
 bootstrap里的图标
 bootstrap
maven和svn区别
 maven
计算机程序的思维逻辑 (20)
计算机程序的思维逻辑 (19)
计算机程序的思维逻辑 (18)
计算机程序的思维逻辑 (17)
计算机程序的思维逻辑 (15)

原文地址：https://www.cnblogs.com/onemorepoint/p/7274706.html

Copyright © 2011-2022 走看看