四个不一样的字组成的汉字

发布网友发布时间：2022-10-28 18:13

共1个回答

热心网友时间：2023-10-09 08:14

通常我们所说是2字节（GB-2312）。
具体依据汉字编码形式有所不同：
GB－231280编码为2个字节(Byte)包含了20902个汉字，其编码范围是0x8140-0xfefe。
GB18030-2000(GBK2K)在GBK的基础上进一步扩展了汉字，增加了藏、蒙等少数民族的字形。编码是变长的，其二字节部分与GBK兼容；四字节部分是扩充的字形、字位，其编码范围是首字节0x81-0xfe、二字节0x30-0x39、三字节0x81-0xfe、四字节0x30-0x39
Unicode范围一般所用为\U0000-\UFFFF，对于CJKEXTB区汉字，范围大于\U20000
UTF，按其基本长度所用位数分为UTF-8/16/32。其中：
UTF-8是变长编码，每个Unicode代码点按照不同范围，可以有1-3字节的不同长度。UTF-16长度相对固定，只要不处理大于\U200000范围的字符，每个Unicode代码点使用16位即2字节表示，超出部分使用两个UTF-16即4字节表示。按照高低位字节顺序，又分为UTF-16BE/UTF-16LE。UTF-32长度始终固定，每个Unicode代码点使用32位即4字节表示。按照高低位字节顺序，又分为UTF-32BE/UTF-32LE。