在最新的python 3版本中,字符串是以unicode编码的,即python的字符串支持多语言
编码和解码
字符串在内存中以unicode表示,在操作字符串时,经常需要str和bytes互相转换
如果在网络上传输或保存到磁盘上,则从内存读到的数据就是str,要把str变为以字节为单位的bytes,称为编码
如果从网络或磁盘上读取字节流,则从网络或磁盘上读到的数据就是bytes,要把bytes变为str,称为解码
为避免乱码问题,应当始终坚持使用utf-8编码对str和bytes进行转换
使用示例:
单个字符的编码
1
2
|
print ( ord ( 'a' )) #输出:65,获取字符的整数表示
print ( chr ( 66 )) #输出:b,把编码转换为对应的字符
|
十六进制表示
1
2
|
print ( '中文' ) #输出:'中文',
print ( '\u4e2d\u6587' ) #输出:'中文','\u4e2d\u6587'和'中文'完全对等,如果知道字符的整数编码,还可以用十六进制这么写str
|
bytes类型的数据表示
x = b'abc' #python对bytes类型的数据用带b前缀的单引号或双引号表示,'abc'和b'abc'在显示上完全一样,但bytes的每个字符都只占用一个字节
编码
1
2
3
|
print ( 'abc' .encode( 'ascii' )) #输出:b'abc',以unicode表示的str通过encode()方法可以编码为指定的bytes
print ( '中文' .encode( 'utf-8' )) #输出:b'\xe4\xb8\xad\xe6\x96\x87',
print ( '中文' .encode( 'ascii' )) #输出:报错,因为中文字符在ascii编码范围外,所以导致编码失败
|
解码
1
2
3
|
print (b 'abc' .decode( 'ascii' )) #输出:'abc'
print (b '\xe4\xb8\xad\xe6\x96\x87' .decode( 'ascii' )) #输出:'中文'
print (b '\xe4\xb8\xad\xff' .decode( 'utf-8' , errors = 'ignore' )) #输出:'中',如果bytes中只有一小部分无效的字节,可以传入errors='ignore'忽略错误的字节
|
计算长度
1
2
3
4
5
6
|
#len(a)函数返回a的长度,如果a是字符串则返回字符数,如果a是字节表示则返回字节数
print ( len ( '中文' )) #输出:2,共2个字符
print ( len ( 'abc' )) #输出:3,共3个字符
print ( len (b 'abc' )) #输出:3,共是3个字节
print ( len (b '\xe4\xb8\xad\xe6\x96\x87' )) #输出:6,共是6个字节
print ( len ( '中文' .encode( 'utf-8' ))) #输出:6, 1个中文字符经过utf-8编码后通常会占用3个字节,因此两个汉字的字节数是6
|
源码文件开头与编码
1
2
|
#!/usr/bin/env python3 告诉linux/os x系统,这是一个python可执行程序,windows系统会忽略这个注释
# -*- coding: utf-8 -*- 告诉python解释器,按照utf-8编码读取源代码,否则在源代码中写的中文输出可能会有乱码
|
#注意:告诉编译器使用utf-8编码并不意味着.py文件就是utf-8编码的,必须并且要确保.py文件用utf-8 without bom编码保存,才可确保文件中的中文正常显示
总结
以上所述是小编给大家介绍的python中字符串与编码示例代码,希望对大家有所帮助,如果大家有任何疑问欢迎给我留言,小编会及时回复大家的!
原文链接:https://www.cnblogs.com/shiliye/archive/2019/05/20/10893939.html