zoukankan      html  css  js  c++  java
  • $ 专治各种python字符编码问题疑难杂症

    标准动作

    • 在脚本第一行指定编码格式:
    # coding:utf-8
    
    • 将默认的ascii字符流处理方式变为utf-8:
    import sys
    sys.getdefaultencoding()
    
    'ascii'
    
    reload(sys)
    sys.setdefaultencoding('utf-8')
    

    常见字符编码知识

    ascii编码

    是最早使用、最常见的一种字符编码,包含了128个字符(英文字母、数字、符号、控制字符等),也是下面讲到的所有编码的公共集合。

    ISO8859-1编码

    西欧字符集编码。

    gb2312/gbk/gb18030之间的关系

    这是简体中文的三种编码,从左到右包含的字符范围依次增大,左边是右边的子集。

    big5编码

    繁体中文编码。

    unicode/utf-8/utf-16/utf-32之间的关系

    • unicode是一个字符集,表示包含了哪些字符——包含了世界上所有字符。

    • 而utf-8/utf-16/utf-32是字符编码,表示用哪种方式表示unicode字符集,是对unicode字符集的具体编码实现方式。

    • 最常用的是utf-8

    获取字符串的编码格式

    from chardet import detect
    
    detect('abc')
    
    {'confidence': 1.0, 'encoding': 'ascii', 'language': ''}
    
    detect(r'abc')
    
    {'confidence': 1.0, 'encoding': 'ascii', 'language': ''}
    

    注:detect的参数不能是unicode字符串,否则会报错。

    str和unicode对象

    str和unicode都是python内置的两种字符串类,并且有着同样的父类:basestring

    type('123')
    
    str
    
    type(u'123')
    
    unicode
    
    str.__bases__
    
    (basestring,)
    
    unicode.__bases__
    
    (basestring,)
    
    basestring.__bases__
    
    (object,)
    

    用好unicode这个桥梁

    有时候并不知道一个字符串的编码是什么(比如从某个文件中读取的内容),这时候如何把这个文件的字符编码转为需要的编码呢(比如utf-8)?

    答案是:借助unicode为桥梁。

    比如:

    with open('content.txt','r') as fin:
        content = fin.read()
        # 这里先把文件内容decode成utf-8编码(中间桥梁),再encode成gbk编码(目标编码)
        target = content.decode('utf-8').encode('gbk')
    

    把转义的中文unicode字符串转为中文

    s = 'u6211'
    
    type(s)
    
    str
    
    print s
    
    u6211
    
    print s.decode('unicode-escape').encode('utf-8')
    

    把各种字符都统一成unicode来处理

    from __future__ import unicode_literals
    
    type('123')
    
    unicode
    
    type(u'123')
    
    unicode
    

    解决matplotlib图表中的中文乱码问题

    按照matplotlib默认的字符编码,在图表中中文不能正常显示,会显示为方框,如下:

    import matplotlib.pyplot as plt
    
    x = [1,2,3]
    y = [4,6,8]
    plt.plot(x,y)
    plt.title(u'数据')
    plt.show()
    

    解决方法:

    plt.rcParams['font.sans-serif'] = ['SimHei']  # 指定默认字体
    plt.rcParams['axes.unicode_minus'] = False  # 解决负号显示为方框的问题
    plt.title(u'数据')
    plt.plot(x,y)
    plt.show()
    

  • 相关阅读:
    装饰者模式
    Moon.Orm总目录,及常见问题解决方案(有问题直接在这里问,我会立即作答)
    中国IT格局分析
    细说MVC框架的几大困惑
    一天学一个模式_第一天:策略模式
    一天学一个模式_第三天:单例模式
    一天学一个模式_第二天:代理模式
    News: Microsoft Released URL Rewriter 2.0 RTW
    微软一站式示例代码库 20100125 新增代码示例简介
    微软一站式示例代码库 1月小结
  • 原文地址:https://www.cnblogs.com/jiayongji/p/7287752.html
Copyright © 2011-2022 走看看