python去除拼音声调字母,替换为字母的方法

第一种方法

									import sys

									import unicodedata

									s = "Lǐ Zhōu Wú"

									remap = {

									 # ord返回ascii值

									 ord('\t'): '',

									 ord('\f'): '',

									 ord('\r'): None

									 }

									# 去除\t, \f, \r

									a = s.translate(remap)

									'''

									　　通过使用dict.fromkeys() 方法构造一个字典，每个Unicode 和音符作为键，对于的值全部为None

									　　然后使用unicodedata.normalize() 将原始输入标准化为分解形式字符

									　　sys.maxunicode : 给出最大Unicode代码点的值的整数，即1114111（十六进制的0x10FFFF）。

									　　unicodedata.combining:将分配给字符chr的规范组合类作为整数返回。 如果未定义组合类，则返回0。

									'''

									cmb_chrs = dict.fromkeys(c for c in range(sys.maxunicode) if unicodedata.combining(chr(c))) #此部分建议拆分开来理解

									b = unicodedata.normalize('NFD', a)

									'''

									　　　调用translate 函数删除所有重音符

									'''

									print(b.translate(cmb_chrs))

第二种方法（推荐）

									import unicodedata

									mystr='Lǐ Zhōu Wú'

									unicodedata.normalize('NFKD', mystr).encode('ascii','ignore')

以上这篇python去除拼音声调字母,替换为字母的方法就是小编分享给大家的全部内容了，希望能给大家一个参考，也希望大家多多支持服务器之家。

原文链接：https://blog.csdn.net/qq_32590631/article/details/81369980

秒客网

python去除拼音声调字母,替换为字母的方法

相关文章