zoukankan      html  css  js  c++  java
  • 提取HTML代码中文字的C#函数

    /// <summary>
    /// 去除HTML标记
    /// </summary>
    /// <param name="strHtml">包括HTML的源码 </param>
    /// <returns>已经去除后的文字</returns>
    public static string StripHTML(string strHtml)
    {
        string [] aryReg ={
            @"<script[^>]*?>.*?</script>", 
            @"<(\/\s*)?!?((\w+:)?\w+)(\w+(\s*=?\s*(([""])(\\[""tbnr]|[^\7])*?\7|\w+)|.{0})|\s)*?(\/\s*)?>",
            @"([\r\n])[\s]+",
            @"&(quot|#34);",
            @"&(amp|#38);",
            @"&(lt|#60);",
            @"&(gt|#62);", 
            @"&(nbsp|#160);", 
            @"&(iexcl|#161);",
            @"&(cent|#162);",
            @"&(pound|#163);",
            @"&(copy|#169);",
            @"&#(\d+);",
            @"-->",
            @"<!--.*\n"
        };
    
        string [] aryRep = {
            "",
            "",
            "",
            "\"",
            "&",
            "<",
            ">",
            " ",
            "\xa1",//chr(161),
            "\xa2",//chr(162),
            "\xa3",//chr(163),
            "\xa9",//chr(169),
            "",
            "\r\n",
            ""
        };
    
        string newReg =aryReg[0];
        string strOutput=strHtml;
        for(int i = 0;i<aryReg.Length;i++)
        {
            Regex regex = new Regex(aryReg[i],RegexOptions.IgnoreCase );
            strOutput = regex.Replace(strOutput,aryRep[i]);
        }
    
        strOutput.Replace("<","");
        strOutput.Replace(">","");
        strOutput.Replace("\r\n","");
    
        return strOutput;
    } 
    
  • 相关阅读:
    Navicat 总是断开连接
    MySQL 重连机制
    优化 一
    python之 paramiko模块 连接服务器
    变量值的修改
    Python使用APScheduler实现定时任务
    Linux命令 清空文件
    输入法 | 输入法如何打出直角引号
    Java | Java字节码
    英语 | 图片学习单词
  • 原文地址:https://www.cnblogs.com/wubin264/p/1771305.html
Copyright © 2011-2022 走看看