UTF-8 字符分析器
逐字符分析文本的码点、UTF-8 / UTF-16 编码与字节序列
字符明细
| # | 字符 | 名称 / 说明 | 码点 | 十进制 | UTF-8 字节 | UTF-16 单元 |
|---|
— 请输入文本 —
💡 说明:
· 码点(code point):Unicode 为每个字符分配的唯一编号,如
· UTF-8 字节:码点在 0–127 占 1 字节,128–2047 占 2 字节,2048–65535 占 3 字节,≥65536 占 4 字节;
· UTF-16 单元:BMP 内为 1 个单元;BMP 外(如 Emoji)需 2 个代理单元;
·
· 部分字符(如带变音符号的字母、旗帜 Emoji)由多个码点组成一个字素簇。
· 码点(code point):Unicode 为每个字符分配的唯一编号,如
U+4E2D(中);· UTF-8 字节:码点在 0–127 占 1 字节,128–2047 占 2 字节,2048–65535 占 3 字节,≥65536 占 4 字节;
· UTF-16 单元:BMP 内为 1 个单元;BMP 外(如 Emoji)需 2 个代理单元;
·
charCodeAt 返回 UTF-16 单元,codePointAt 返回码点;· 部分字符(如带变音符号的字母、旗帜 Emoji)由多个码点组成一个字素簇。