你知道utf-8编码中的一个中文汉字需要占有多少/几个字节表示或编码吗?

占2个字节的:〇

占3个字节的:基本等同于GBK,含21000多个汉字

占4个字节的:中日韩超大字符集里面的汉字,有5万多个

一个utf8数字占1个字节

一个utf8英文字母占1个字节

在查找 UTF-8 编码资料时发现,很多的帖子说的 UTF-8 编码里,一个汉字占用3个字节,有的还做了个证明,大概是这样的,创建一个没有BOM的UTF-8编码的文本文件,里面保存了几个汉字,然后查看文件的大 小。我觉得这样的证明没有一点说服力,因为 UTF-8 是变长的,1-6个字节,少量的汉字检测是不能说明所有的汉字都是的。

后来我又查看了字符映射表-汉语,找到了正确的答案,少数是汉字每个占用3个字节,多数占用4个字节。

占用3个字节的范围[text] view plaincopy

  1. U+2E80 – U+2EF3 : 0xE2 0xBA 0×80 – 0xE2 0xBB 0xB3      共 115 个
  2. U+2F00 – U+2FD5 : 0xE2 0xBC 0×80 – 0xE2 0xBF 0×95      共 213 个
  3. U+3005 – U+3029 : 0xE3 0×80 0×85 – 0xE3 0×80 0xA9      共 36 个
  4. U+3038 – U+4DB5 : 0xE3 0×80 0xB8 – 0xE4 0xB6 0xB5      共 7549 个
  5. U+4E00 – U+FA6A : 0xE4 0xB8 0×80 – 0xEF 0xA9 0xAA      共 44138 个
  6. U+FA70 – U+FAD9 : 0xEF 0xA9 0xB0 – 0xEF 0xAB 0×99      共 105 个

合计: 52156 个

占用4个字节的范围[text] view plaincopy

  1. U+20000 – U+2FA1D : 0xF0 0xA0 0×80 0×80 – 0xF0 0xAF 0xA8 0x9D      共 64029 个

合计: 64029 个

GBK编码,一个汉字占两个字节。

UTF-16编码,通常汉字占两个字节,CJKV扩展B区、扩展C区、扩展D区中的汉字占四个字节(一般字符的Unicode范围是U+0000至U+FFFF,而这些扩展部分的范围大于U+20000,因而要用两个UTF-16)。

UTF-8编码是变长编码,通常汉字占三个字节,扩展B区以后的汉字占四个字节。依据编码形式:
GB-231280 编码为 2个字节(Byte) 包含了 20902 个汉字,其编码范围是 0×8140-0xfefe。
GB18030-2000(GBK2K) 在 GBK 的基础上进一步扩展了汉字,增加了藏、蒙等少数民族的字形。编码是变长的,其二字节部分与 GBK 兼容;四字节部分是扩充的字形、字位,其编码范围是首字节 0×81-0xfe、二字节0×30-0×39、三字节 0×81-0xfe、四字节0×30-0×39
Unicode 范围一般所用为\U0000-\UFFFF,对于CJK EXT B区汉字,范围大于\U20000
UTF, 按其基本长度所用位数分为UTF-8/16/32。其中:
UTF-8是变长编码,每个Unicode代码点按照不同范围,可以有1-3字节的不同长度。UTF-16长度相对固定,只要不处理大于\U200000范围的字符,每个Unicode代码点使用16位即2字节表示,超出部分使用两个UTF-16即4字节表示。按照高低位字节顺序,又分为UTF-16BE/UTF-16LE。

UTF-32长度始终固定,每个Unicode代码点使用32位即4字节表示。按照高低位字节顺序,又分为UTF-32BE/UTF-32LE。