首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >pandas 读 csv 中文乱码,gbk/utf-8 都试过还乱,怎么系统排查?

pandas 读 csv 中文乱码,gbk/utf-8 都试过还乱,怎么系统排查?

提问于 2026-07-29 12:26:55
回答 0关注 0查看 19

最近处理一批来源不一的 csv 文件,pd.read_csv 读出来中文乱码。试了 encoding='utf-8' 直接报 decode 错,encoding='gbk' 能读但部分列还是乱码,还有几个文件两种编码都失败。 想请教几个点: 1. 怎么快速判断一个 csv 到底什么编码(chardet / 文件头 BOM 之类的)? 2. 混合编码(同一文件部分 gbk 部分 utf-8)这种情况真实存在吗,怎么兜底? 3. 有没有比"试错法"更稳的自动识别再读取的流程? 附我现在最笨的办法: import chardet with open("x.csv","rb") as f: raw = f.read(10000) print(chardet.detect(raw)) 但 chardet 对小样本经常误判,求更靠谱的方案。

回答

和开发者交流更多问题细节吧,去 写回答
相关文章

相似问题

相关问答用户
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档