zoukankan      html  css  js  c++  java
  • Python基础之字符的编码

    参考原文

      Python廖雪峰

    为什么要进行编码?

      计算机只能处理二进制数字(0100111),要处理文本,就必须先把文本转为数字才能处理,这个过程就叫编码。

    字符的编码

      ASCII编码

      由于计算机是美国人发明的,最早只有127个字符被编码到计算机里,包括大小写英文字母、数组和一些符号,这个编码表被称为ASCII编码,比如大写字母A的编码是65,小写字母z的编码是122。

      但是用来处理中文显然一个字节是不够的,至少需要2个字节,而且不能和ASCII原有的编码冲突。所以中国制定了GB2312编码来将中文编进去。但是可以想象,全世界有上百中语言,各国有各国的标准,日本把日文编到Shift_JIS里,韩国把韩文编到Euc-kr里。这肯定会出现冲突,结果就导致在多语言的混合的文本中显示出来会有乱码。

      Unicode编码

      因此,Unicode应运而生。Unicode将所有的语言都统一到一套编码里,这样就不会有乱码问题了。Unicode标准也在不断发展,但最常用的是用2个字节表示1个字符(偏僻的字符,就需要4个字节)

    ASCII和Unicode区别:ASCII编码是一个字节代表一个字符,Unicode2个字节表示一个字符,对于汉字来说超出了ASCII的编码范围,对于英语字母两者皆可编码,但Unicode编码就要比ASCII编码多用一倍的存储空间。所以引出了下面的编码方式。

      UTF-8编码

      UTF-8编码(可变长编码)把一个Unicode字符根据不同的数字大小编码成1-6个字节,常用的英文字母被编码成1个字节,汉字通常是3个字节,只有生僻的字符才会被编码成4-6个字节。ASCII编码实际上是UTF-8编码的一部分。

      比较

      在计算机内存中统一使用Unicode编码,当需要保存到硬盘或传输的时候,就转换为UTF-8编码。例如:用记事本编辑的时候,从文件读取的UTF-8字符被转换为Unicode字符到内存里,编辑完成后,保存时又将Unicode字符转换为UTF-8保存到文件中。

  • 相关阅读:
    学英语舌尖效应(转)
    winform程序防止重复运行
    label字符自动换行(转自网络)
    C# WINFORM中的combobox.items.add实现像web开发那样,添加显示内容text和实际value值
    三极管开关电路设计(转)
    ASPNET+ArcGIS+Flex初次使用笔记
    转:oracle日期函数集锦
    网站开发人员应该知道的62件事
    cassandra的安装与使用
    datejs一个很好用的时间日期JavaScript组件
  • 原文地址:https://www.cnblogs.com/yunche/p/8847017.html
Copyright © 2011-2022 走看看