UTF-8 字符分析器

UTF-8 字符分析器

逐字符分析文本的码点、UTF-8 / UTF-16 编码与字节序列

字符明细
# 字符 名称 / 说明 码点 十进制 UTF-8 字节 UTF-16 单元
— 请输入文本 —
💡 说明:
· 码点(code point):Unicode 为每个字符分配的唯一编号,如 U+4E2D(中);
· UTF-8 字节:码点在 0–127 占 1 字节,128–2047 占 2 字节,2048–65535 占 3 字节,≥65536 占 4 字节;
· UTF-16 单元:BMP 内为 1 个单元;BMP 外(如 Emoji)需 2 个代理单元;
· charCodeAt 返回 UTF-16 单元,codePointAt 返回码点;
· 部分字符(如带变音符号的字母、旗帜 Emoji)由多个码点组成一个字素簇。