zoukankan      html  css  js  c++  java
  • 使用HTMLParser解析html

    使用HTMLParser解析html#

    前几天遇到一个问题,需要把网页中的一部分内容挑出来,于是找到了urllib和HTMLParser两个库.urllib可以将网页爬下来,然后交由HTMLParser解析,初次使用这个库,在查官方文档时也遇到了一些问题,在这里写下来与大家分享.


    一个例子##

    from HTMLParser import HTMLParser
    class MyHTMLParser(HTMLParser):
      def handle_starttag(self, tag, attrs):
        print "a start tag:",tag,self.getpos()
    parser=MyHTMLParser()
    parser.feed('<div><p>"hello"</p></div>') 
    

    这个例子里HTMLParser是基类,重载了他的handle_starttag方法,输出了一些信息.parser是MyHTMLParser的实例,调用feed方法开始解析函数.值得注意的是,不需要显示调用handle_starttag方法就会执行.

    HTMLParser方法的调用方式困惑了我很长时间,看了很多博文才恍然大悟,HTMLParser含有的方法分为两类,一类是需要显式调用的,而另一类不需显示调用.

    不需显式调用的方法##

    下面的这些函数在解析的过程中会触发,但是默认情况下不会产生任何副作用,因而我们要根据自己的需求重载.

    • HTMLParser.handle_starttag(tag,attrs): 解析时遇到开始标签调用,如<p class='para'>,参数tag是标签名,这里是'p',attrs为标签所有属性(name,value)列表,这里是[('class','para')]

    • HTMLParser.handle_endtag(tag): 遇到结束标签时调用,tag是标签名

    • HTMLPars.handle_data(data): 遇到标签中间的内容时调用,如<style> p {color: blue; }</style>,参数data为开闭标签间的内容.值得注意的是在形如<div><p>...</p></div>的位置,并不会在div处调用,而是只在p处调用

    当然还有其他函数,这里不做介绍

    显式调用的方法##

    • HTMLParser.feed(data): 参数为需要解析的html字符串,调用后字符串开始被解析

    • HTMLParser.getpos(): 返回当前的行号和偏移位置,如(23,5)

    • HTMLParser.get_starttag_text(): 返回当前位置最近的开始标签的内容

    • ...


    所有的内容写完了,最后还有一点注意事项,HTMLParser只是一个简单的模块,解析html的功能并不完善,例如不能准确的分别开标签和"自闭标签",看下面代码:

    from HTMLParser import HTMLParser
    class MyHTMLParser(HTMLParser):
      def handle_starttag(self,tag,attrs):
        print 'begin tag',tag
      def handle_startendtag(self,tag,attrs):
        print 'begin end tag',tag
    
    str1='<br>'
    str2='<br/>'
    parser=MyHTMLParser()
    
    parser.feed(str1)    # 输出 "begin tag br"
    parser.feed(str2)    # 输出 "begin end br"
    
  • 相关阅读:
    nyoj 164&amp;&amp;poj2084 Game of Connections 【卡特兰】
    1、Cocos2dx 3.0游戏开发找小三之前言篇
    hibernate一级缓存,二级缓存和查询缓存
    WCF服务端调用client.
    优化中的subgradient方法
    Xsolla和Crytek合作,对游戏战争前线推出全新支付方式
    CNZZ站点流量统计原理简析
    分数加减法
    【jvm】windows下查看java进程下多线程的相关信息
    【面试 docker+k8s+jenkins】【第二十篇】docker+k8s+jenkins相关面试
  • 原文地址:https://www.cnblogs.com/lessmore/p/4279529.html
Copyright © 2011-2022 走看看