python 读取带BOM的utf-8格式文件 - 走看看

zoukankan html css js c++ java

python 读取带BOM的utf-8格式文件
简言：

在windows上使用open打开utf-8编码的txt文件时开头会有一个多余的字符
它叫BOM,是用来声明编码等信息的,但python会把它当作文本解析

解决办法:open的encoding参数
for line in open('data.txt', encoding='utf-8-sig' ):
UTF有哪些分类？

UTF-8分为两种，一种是不带BOM的，一种是带BOM的。其中第一种不带BOM的是标准形式，第二种带BOM的主要是微软的习惯。

为什么有BOM的UTF-8？

微软在UTF-8中使用BOM（Byte order mark）是因为这样可以将UTF-8和ASCII等编码明确区分开。
windows对于utf-8格式的文件存储默认是带有BOM的格式

为什么BOM不受欢迎？

因为在UNIX环境下，很多的UNIX程序不认识BOM。主要是在UNIX所有脚本语言首行为#！标示，它依赖于shell解析，而很多shell出于兼容的考虑不检测BOM，所以加进BOM时shell会把它解释为某个普通字符输入导致破坏#！标示。比如很多现代脚本语言，例如python，其解释器本身是能处理BOM的，但是shell卡在这里。
因此我们在linux服务器上读取这些txt文件时，会遇到如下报错：
xefxbbxbf…

怎么解决？

使用codecs库，将文件转换为utf-8-sig格式
import codecs with open("xx.txt",'r','utf-8-sig') as file: line = file.readlines();
　　
查看全文

相关阅读:
ios启动画面
 不让精灵移除屏幕外重写setPosition方法
 post和get请求方式的区别
 IOS开发之手势——UIGestureRecognizer 共存
 Xcode 中的GDB的命令
 [UIView beginAnimations:context:]与[UIView animateWithDuration:animations:]值得注意的一个区别
 应用图标 ICON
cocos2d 1.01不能运行以前版本工程的问题
 SQL 中数据类型的转换转
 SQL Server中sql语句执行时间

原文地址：https://www.cnblogs.com/yinhaiping/p/10711110.html

Copyright © 2011-2022 走看看