繁体   English   中英

Python:从csv移除非ascii字符

[英]Python: Remove non ascii characters from csv

我有一个csv文件,在4000条记录中只有4条具有一些非ASCII字符。 例如

['com.manager', '2016012300', '16.1.23', 'en', 'kinzie', '2015-04-11T17:36:23Z', '1428773783781', '2016-03-11T09:53:45Z', 'df', '5', "\xa5\x06`'", '\xc0\x03"', '\xa2{\xac ===]\xa9}\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7\xf7>', '', '', '', 'https://play.google.com/apps/publish?account=sd#ReviewDetailsPlace:p=com.manager&reviewid=gp:AOqpTOEcQQGmjFcd-bFfU372DTrxh']

我正在使用以下python代码读取csv

with open('/Users/duttaam/Downloads/test1.csv', 'rU') as csvfile:
    reader_obj = csv.reader(x.replace('\0', '') for x in csvfile)
    rownum=0
    for row in reader_obj:
        rownum += 1
        if len(row) != 16:
            print rownum
            print row 

对于四行,阅读器显示的列号不一致。 但是,当我计算这些行中的定界符(,)时,它显示的很好。 我可以看到的唯一问题是非ascii字符,如上一行所示。 我猜这些是一些表情符号转换成一些字符。

我想出了一个从字符串中删除不可打印字符的功能,如何将其应用于整个csv?(感谢以下文章: 在python中从字符串中删除不可打印字符)

def removeSpecialcahr(s):
        printable = set(string.printable)
        return filter(lambda x: x in printable, s)

有没有办法处理csv并删除所有不可打印和/或非ASCII字符?

要从文件中删除非ASCII字符,请使用codecs.open()替换open调用。 您还可以定义自己的错误处理程序...:

import codecs
codecs.open('file.csv', 'r', encoding='ascii', errors='ignore')

暂无
暂无

声明:本站的技术帖子网页,遵循CC BY-SA 4.0协议,如果您需要转载,请注明本站网址或者原文地址。任何问题请咨询:yoyou2525@163.com.

 
粤ICP备18138465号  © 2020-2024 STACKOOM.COM