zoukankan html css js c++ java

python模块之HTMLParser解析出URL链接

# -*- coding: utf-8 -*-
#python 27
#xiaodeng
#python模块之HTMLParser解析出URL链接
#http://www.cnblogs.com/mfryf/p/3691563.html



from HTMLParser import HTMLParser
class MyHTMLParser(HTMLParser):   
    def __init__(self):   
        HTMLParser.__init__(self) #继承  
        self.links = []#links 链接
    
    def handle_starttag(self, tag, attrs):   
        #print "Encountered the beginning of a %s tag" % tag
        
        if tag == "a":   
            if len(attrs) == 0:   
                pass   
            else:   
                for variable, value in attrs:
                    if variable == "href":   
                        self.links.append(value)   

                     
if __name__ == "__main__":
    #写入一个html长字符串
    html_code = """<a href="www.google.com"> google.com</a>
<A Href="www.pythonclub.org"> PythonClub </a>
<A HREF = "www.sina.com.cn"> Sina </a>
"""   
    hp = MyHTMLParser()
    hp.feed(html_code)
    hp.close()
    #print hp.handle_starttag('a', 'href')
    print hp.links #['www.google.com', 'www.pythonclub.org', 'www.sina.com.cn']

查看全文

相关阅读:
CVS简介
 快捷搭建JavaWeb开发环境
 局域网Win7 SVN 服务器搭建以及使用(原创)
给自己一个方向，让自己不再迷茫
 SQL Server2005安装配置以及测试
 Oracle中表结构和表内容复制
 Myeclipse8.5 svn插件安装两种方式
 Oracle中错误代码ORA02292 违反了完整性约束条件解决
 JSP中字符编码转换问题
 C# sealed关键词

原文地址：https://www.cnblogs.com/dengyg200891/p/4983683.html