某些软件,如notepad,在保存一个以UTF-8编码的文件时,会在文件开始的地方插入三个不可见的字符(0xEF 0xBB 0xBF,即BOM)。
因此我们在读取时需要自己去掉这些字符,python中的codecs module定义了这个常量:
# coding=gbk
import codecs
data = open("Test.txt").read()
if data[:3] == codecs.BOM_UTF8:
data = data[3:]
print data.decode("utf-8")
本文介绍如何在Python中读取并去除UTF-8编码文件开头的BOM(Byte Order Mark)。通过使用Python的codecs模块,可以轻松实现这一目标。
:讨厌的BOM&spm=1001.2101.3001.5002&articleId=1890920&d=1&t=3&u=d63566b395934d7d939d791a0f800fe3)
2417

被折叠的 条评论
为什么被折叠?



