繁体   English   中英

Python mmh3:UnicodeEncodeError:'ascii'编解码器无法在位置0-14处编码字符:序数不在范围内(128)

[英]Python mmh3: UnicodeEncodeError: 'ascii' codec can't encode characters in position 0-14: ordinal not in range(128)

我正在向数据库查询笑话,并重新获得Python str 我想将它们用作Unicode对象,所以我这样做:

joke = unicode(joke, 'utf-8')

这适用于我所有的数据库结果,不会引起任何问题。

然后,我尝试像这样对每个笑话中的每个单词进行哈希处理:

result = mmh3.hash(joke)

然后我回来:

UnicodeEncodeError: 'ascii' codec can't encode characters in position 0-14: ordinal not in range(128)

我检查了文本,它是日语。 这是否意味着我应该在散列之前删除所有非ASCII字符,还是有更好的方法来处理此问题?

谢谢!

.hash(...)函数似乎需要bytesascii转换的文本。

最简单的方法(如果要完全处理unicode对象)是在调用mmh3.hash将它们转换为bytes

result = mmh3.hash(joke.encode('UTF-8'))

暂无
暂无

声明:本站的技术帖子网页,遵循CC BY-SA 4.0协议,如果您需要转载,请注明本站网址或者原文地址。任何问题请咨询:yoyou2525@163.com.

 
粤ICP备18138465号  © 2020-2024 STACKOOM.COM