首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >list上的循环操作仅在第一项上不能正确执行

list上的循环操作仅在第一项上不能正确执行
EN

Stack Overflow用户
提问于 2017-02-16 06:16:08
回答 1查看 32关注 0票数 1

我只是尝试删除导入的文本文件中每行的前45个字符,然后将结果写入一个新的文本文件。由于某些原因,只有列表/行中的第一项被弄乱,并且只删除了前42个字符。

我以前遇到过很多次这个问题,从来没有想过为什么会发生,我可以借鉴一些外部的智慧!谢谢!

下面是我的代码:

代码语言:javascript
复制
list1 = []
list2 = []
with codecs.open('FILE.txt', "r", encoding="utf-8") as inputfile:
        list1 = [line.strip() for line in inputfile]
        list1 = [x.encode('utf-8') for x in list1]
        for item in list1:
            list2.append(item[45:])
z = open('NEWFILE.txt', 'w');
z.write("\n".join(list2))
z.close()
EN

回答 1

Stack Overflow用户

回答已采纳

发布于 2017-02-16 06:24:36

UTF-8以及第一行中的3字节移位看起来非常像额外的BOM头。

代码语言:javascript
复制
>>> from codecs import BOM_UTF8
>>> len(BOM_UTF8)
3

BOM表头可被大多数文本编辑器检测到,并且不直接可见(除非使用文本编辑器)。

我建议你像这样改变你的内部循环:

代码语言:javascript
复制
for item in list1:
    list2.append(item[45+len(codecs.BOM_UTF8) if item.startswith(codecs.BOM_UTF8) else 45:])

因此,如果行(第一行)以BOM标题开头,则需要添加3个额外的字节

或者可以直接在对完整字符串进行编码之前:

代码语言:javascript
复制
list1 = [(x[len(codecs.BOM_UTF8):] if x.startswith(codecs.BOM_UTF8) else x).encode('utf-8') for x in list1]

物料清单-取自此Q/A的条形码:Python load json file with UTF-8 BOM header

票数 1
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/42261131

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档