将Unicode字符串转换为Python中的字符串(包含额外符号)

如果您有一个Unicode字符串，并且希望将其写入文件或其他序列化形式，则必须首先将其编码为可存储的特定表示形式。有几种常见的Unicode编码，例如UTF-16(大多数Unicode字符使用两个字节)或UTF-8(1-4字节/码点取决于字符)，等等。要将该字符串转换为特定的编码，您可以使用:

>>> s= u'£10'
>>> s.encode('utf8')
'\xc2\x9c10'
>>> s.encode('utf16')
'\xff\xfe\x9c\x001\x000\x00'

可以将这个原始字节字符串写入文件。但是，请注意，当读取它时，您必须知道它是什么编码，并使用相同的编码进行解码。

当写入文件时，您可以使用codecs模块来摆脱这个手动编码/解码过程。因此，要打开一个将所有Unicode字符串编码为UTF-8的文件，请使用:

import codecs
f = codecs.open('path/to/file.txt','w','utf8')
f.write(my_unicode_string)  # Stored on disk as UTF-8

请注意，使用这些文件的任何其他程序如果想读取这些文件，就必须了解文件的编码。如果你是唯一一个读/写的人，这不是问题，否则请确保你写的是一种其他使用文件的人都能理解的形式。

在Python 3中，这种形式的文件访问是默认的，内置的open函数将接受编码参数，并始终将以文本模式打开的文件转换为Unicode字符串(Python 3中的默认字符串对象)。

2009-07-30 16:44:54

下面是一个示例代码

import unicodedata    
raw_text = u"here $%6757 dfgdfg"
convert_text = unicodedata.normalize('NFKD', raw_text).encode('ascii','ignore')

2016-12-19 07:59:44

看到unicodedata.normalize

title = u"Klüft skräms inför på fédéral électoral große"
import unicodedata
unicodedata.normalize('NFKD', title).encode('ascii', 'ignore')
'Kluft skrams infor pa federal electoral groe'

2009-07-30 15:44:32

这是我的函数

import unicodedata
def unicode_to_ascii(note):
    str_map = {'Š' : 'S', 'š' : 's', 'Đ' : 'D', 'đ' : 'd', 'Ž' : 'Z', 'ž' : 'z', 'Č' : 'C', 'č' : 'c', 'Ć' : 'C', 'ć' : 'c', 'À' : 'A', 'Á' : 'A', 'Â' : 'A', 'Ã' : 'A', 'Ä' : 'A', 'Å' : 'A', 'Æ' : 'A', 'Ç' : 'C', 'È' : 'E', 'É' : 'E', 'Ê' : 'E', 'Ë' : 'E', 'Ì' : 'I', 'Í' : 'I', 'Î' : 'I', 'Ï' : 'I', 'Ñ' : 'N', 'Ò' : 'O', 'Ó' : 'O', 'Ô' : 'O', 'Õ' : 'O', 'Ö' : 'O', 'Ø' : 'O', 'Ù' : 'U', 'Ú' : 'U', 'Û' : 'U', 'Ü' : 'U', 'Ý' : 'Y', 'Þ' : 'B', 'ß' : 'Ss', 'à' : 'a', 'á' : 'a', 'â' : 'a', 'ã' : 'a', 'ä' : 'a', 'å' : 'a', 'æ' : 'a', 'ç' : 'c', 'è' : 'e', 'é' : 'e', 'ê' : 'e', 'ë' : 'e', 'ì' : 'i', 'í' : 'i', 'î' : 'i', 'ï' : 'i', 'ð' : 'o', 'ñ' : 'n', 'ò' : 'o', 'ó' : 'o', 'ô' : 'o', 'õ' : 'o', 'ö' : 'o', 'ø' : 'o', 'ù' : 'u', 'ú' : 'u', 'û' : 'u', 'ý' : 'y', 'ý' : 'y', 'þ' : 'b', 'ÿ' : 'y', 'Ŕ' : 'R', 'ŕ' : 'r'}
    for key, value in str_map.items():
        note = note.replace(key, value)
    asciidata = unicodedata.normalize('NFKD', note).encode('ascii', 'ignore')
    return asciidata.decode('UTF-8')

2022-06-08 10:12:06

>>> text=u'abcd'
>>> str(text)
'abcd'

如果字符串只包含ascii字符。

2012-10-25 16:27:20