• 技术文章 >常见问题 >Python常见问题

    python编码和解码区别是什么?

    yangyang2020-05-20 13:10:19原创2921

    python中的编码与解码的区别:

    编码 / encode:将 Unicode 字符串转换为特定编码格式对应的字节码的过程

    解码 / decode:将特定编码格式的字节码转换为对应的 Unicode 字符串的过程

    示例:

    In [43]: '美丽人生'.encode('gbk')
    Out[43]: b'\xc3\xc0\xc0\xf6\xc8\xcb\xc9\xfa'
    
    In [44]: b'\xc3\xc0\xc0\xf6\xc8\xcb\xc9\xfa'.decode('gbk')
    Out[44]: '美丽人生'
    
    In [45]: '美丽人生'.encode('utf-8')
    Out[45]: b'\xe7\xbe\x8e\xe4\xb8\xbd\xe4\xba\xba\xe7\x94\x9f'
    
    In [46]: b'\xe7\xbe\x8e\xe4\xb8\xbd\xe4\xba\xba\xe7\x94\x9f'.decode('utf-8')
    Out[46]: '美丽人生'
    
    In [47]: b'\xc3\xc0\xc0\xf6\xc8\xcb\xc9\xfa'.decode('gbk').encode('utf-8')
    Out[47]: b'\xe7\xbe\x8e\xe4\xb8\xbd\xe4\xba\xba\xe7\x94\x9f'

    上面这种以 b 开头的就是字节码,一个斜杠就是一个字节。可见,一个常用汉字用 GBK 格式编码后占 2 个字节,用 UTF-8 格式编码后占 3 个字节。因为存储或传输时,也用 UTF-8 编码,所以一个汉字占的空间就是 3 个字节。

    字符串长度和字节码长度:

    In [61]: len('美丽人生')
    Out[61]: 4
    
    In [62]: len(b'\xe7\xbe\x8e\xe4\xb8\xbd\xe4\xba\xba\xe7\x94\x9f')
    Out[62]: 12

    更多Python知识请关注Python自学网

    专题推荐:python
    上一篇:python画图怎么添加汉字的坐标轴 下一篇:python2.7 numpy导入出错怎么解决

    相关文章推荐

    • python如何解析json字符串• python如何表达连加?• python密码判断是否符合要求的方法• python怎么检测字符串是否有字母?

    全部评论我要评论

    © 2021 Python学习网 苏ICP备2021003149号-1

  • 取消发布评论
  • 

    Python学习网