首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >unicodeencodeerror latin-1_gbk codec

unicodeencodeerror latin-1_gbk codec

作者头像
全栈程序员站长
发布2022-10-02 15:05:04
发布2022-10-02 15:05:04
1.7K0
举报

大家好,又见面了,我是你们的朋友全栈君

最近在搞人工智能的东东,玩了玩词云的东西,在编写代码时,出现了一个问题。

目的:统计西游记里出现的词的内容。

读取西游记整本小说的内容,然后进行统计分析。

代码如下:

代码语言:javascript
复制
text = open('西游记.txt').read()

但是在执行的时候一直报错: UnicodeDecodeError: ‘gbk’ codec can’t decode byte 0x80 in position 2: illegal multibyte sequence

分析可能是由于小说里的内容不是标准的gbk的内容导致的。

查看小说内容截图:

于是乎查找了一番,分析可能是由于小说里还有特殊的符号等内容导致的。

想法:需要进行编码转换。

于是修改代码为,添加了编码范围为utf-8:

代码语言:javascript
复制
text = open('西游记.txt' ,encoding='utf-8').read()
若依然报错,可以添加属性忽略非法字符内容
代码语言:javascript
复制
text = open('西游记.txt', encoding='utf-8', errors='ignore' )

哦了!!问题解决!!成功显示出图如下!!!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 举报,一经查实,本站将立刻删除。

发布者:全栈程序员栈长,转载请注明出处:https://javaforall.cn/194510.html原文链接:https://javaforall.cn

本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2022年9月12日 ,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 最近在搞人工智能的东东,玩了玩词云的东西,在编写代码时,出现了一个问题。
    • 目的:统计西游记里出现的词的内容。
    • 想法:需要进行编码转换。
    • 若依然报错,可以添加属性忽略非法字符内容
  • 哦了!!问题解决!!成功显示出图如下!!!
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档