zoukankan      html  css  js  c++  java
  • Xpath做数据解析

    xpath是一个路径表达式,

    xpath学习

    (1)xpath节点

    在XPath中,有七种类型的节点:元素,属性,文本,命名空间,处理指令,注释以及文档节点;XML文档是被作为节点树来对待的。树的根被称为文档节点或者根结点

    (2)xpath语法

    xpath使用路径表达式来选取XML文档中的节点或节点集。节点是通过沿着路径(path)或者步(steps)来获取的。
    //表示从匹配选择的当前节点选择文档中的节点,而不考虑它们的位置。例如:

    <?xml version="1.0" encoding="UTF-8"?>
    
    <bookstore>
    
    <book>
      <title lang="eng">Harry Potter</title>
      <price>29.99</price>
    </book>
    
    <book>
      <title lang="eng">Learning XML</title>
      <price>39.95</price>
    </book>
    
    </bookstore>
    

    其中,选取节点方式为:

    表达式 描述
    bookstore 表示选取bookstore元素的所有子节点;
    /bookstore 表示选取根元素bookstore;
    bookstore/book 表示选取bookstore的子元素的所有book元素;
    //book 表示选取所有book子元素,而不管它们在文档中的位置;
    bookstore//book 表示选取bookstore元素的后代的所有book元素,而不管它们位于bookstore之下的什么位置;
    //@lang 表示选取名为lang的所有元素。

    选择谓语方式为:

    谓语用来查找某个特定的节点或者包含某个指定的值的节点;谓语被嵌套在方括号中;

    路径表达式 结果
    /bookstore/book[1] 表示选取属于bookstore子元素的第一个book元素;
    /bookstore/book[last()] 表示选取属于bookstore子元素的最后一个book元素;
    /bookstore/book[-1] 表示选取bookstore子元素的倒数第二个book元素;
    bookstore/book[position()<3] 选取最前面的两个属于bookstore元素的子元素的book元素;
    //title[@lang] 表示选取所有拥有名为lang的属性的title元素;
    //title[@lang='eng'] 表示选取所有拥有属性lang的值为eng的title元素;
    bookstore/bookprice>35.00] 表示选取bookstore元素的所有book元素,且其中的price元素的值须大于35.00;
    /bookstore/book[price>35.00]/title 表示选取bookstore元素中的book元素的所有title元素,且其中的price元素的值须大于35.00。

    选取未知节点:(通配符)

    XPath通配符可用来选取位置的XML元素;

    通配符 描述
    * 匹配任何元素节点;
    @* 匹配任何属性节点;
    node() 匹配任何类型的节点;

    对应的路径表达式可以为:

    路径表达式 结果
    /bookstore/* 选取文档中的所有元素;
    //* 表示文档中的所有元素。
    //title[@*] 选取所有带有属性的title元素。

    选取若干路径:

    通过在路径表达式中使用“|”运算符,您可以选取若干个路径。

    |//book/title | //book/price |表示book元素的所有title和price元素;|
    |//title | //price |表示文档中的所有title和price元素;|
    |bookstore/book/title | //price|表示选取属于bookstore元素的book元素的所有title元素,以及文档中所有的price元素;|

    因此://dd[@data-index = '0']表示选取所有dd子元素,且其属性data-index的值为0;
    //div[@class='option-list']表示选取所有div子元素,且其属性class的值为option-list;
    /a/text()表示选取属于a元素节点中的所有文本;其中text()表示匹配任何文本类型的节点;

    //dd[@data-index = '0']//div[@class='option-list']/a/text()表示选取所有属性data-index值为0的dd元素下的所有属性class值为option-list的div元素下的a元素的所有文本;

    //dd[@data-index = '0']//div[@class='option-list']/a/@href表示选取所有属性data-index值为0的dd元素下的所有属性class值为option-list的div元素下的a元素的所有属性为href的数据;

  • 相关阅读:
    小Z的袜子
    C#操作XML
    C#中接口的实现方法
    C#邮箱批量注册
    C# 委托的使用
    C# socket
    在C#.net中如何操作XML
    C#接口的基础知识
    C#判断网页中是否含有某字符串
    C#多线程处理多个队列的数据
  • 原文地址:https://www.cnblogs.com/hugechuanqi/p/9609827.html
Copyright © 2011-2022 走看看