这是一个查 Unicode 字符的网页工具,输入一个字符或一段编码就能看到它的码点、官方名称、所属区块和分类。比如你从 PDF 里复制到一段文字,里面混了个看不见的零宽空格 U+200B,导致程序判断长度出错,把这段文字粘进搜索框,就能看到它显示为 <U+200B> ZERO WIDTH SPACE,分类是 Cf(格式字符),问题立刻定位。写正则、做字体排查、处理多语言文本、核对 emoji 的码点,或者单纯想知道「𠮷」这个字到底占几个码元,都可以用它。所有解析都在浏览器里跑,不联网、不上传。
| 对比维度 | 本工具 | 手工/替代做法 |
|---|---|---|
| 查一个字符的码点 | 粘贴即出结果,约 1 秒 | 翻 Unicode 官网 PDF 码表,按区块逐页找,通常 3–10 分钟 |
| 编码互转 | 同时给出 UTF-8 字节、UTF-16、十进制、HTML 实体 | 手算 UTF-8 模板或写 Python 脚本 ord()/chr(),需装环境 |
| 批量核对 | 一行一个粘贴,逐行输出 | Excel 里用 UNICODE 函数,但拿不到名称和分类 |
| 不可见字符排查 | 直接显示 U+200B 等码点 | 肉眼完全看不出,只能靠代码逐字符打印 |
合法码点范围是 U+0000 到 U+10FFFF,共 1,114,112 个位置。其中 U+0000–U+FFFF 是基本多文种平面 BMP,U+10000 以上是补充平面,需要用代理对表示。U+D800–U+DFFF 这 2048 个位置是代理区,本身不是合法字符,单独查会提示无效。
很多 emoji 由 ZWJ(U+200D)连接多个码点组成。比如 👨👩👧 是 U+1F468 U+200D U+1F469 U+200D U+1F467 共 5 个码点,UTF-16 下占 8 个码元,UTF-8 下 18 字节。JavaScript 的 str.length 会返回 8 而不是 1,判断长度要用 Array.from 或 Intl.Segmenter。
是 E4 B8 AD 三个字节。换算规则:码点 0x4E2D 落在 0x800–0xFFFF 区间,用三字节模板 1110xxxx 10xxxxxx 10xxxxxx,把 0x4E2D 拆成 0100 111000 101101 填入,得到 11100100 10111000 10101101,即 E4 B8 AD。工具结果里会直接列出这串字节。
零宽字符肉眼不可见,直接粘贴到搜索框即可。常见的有 U+200B ZERO WIDTH SPACE、U+200C ZWNJ、U+200D ZWJ、U+FEFF BOM,分类都是 Cf。如果粘贴后搜索框看起来是空的但结果有输出,说明命中了不可见字符,可以配合本站 invisible-char 工具做批量清理。
名称和分类来自 Unicode 官方字符数据库,版本以工具内置的 UCD 为准,通常跟随较新的 Unicode 版本。个别字符在不同版本间名称有过修订,比如 U+1F170 早期叫 NEGATIVE SQUARED LATIN CAPITAL LETTER A。如果和你的系统字体显示不一致,以码点为准,名称只作参考。
覆盖 Unicode 标准定义的码点范围 U+0000–U+10FFFF,代理区 U+D800–U+DFFF 会标记为无效。字符名称与分类依据 Unicode 字符数据库,个别字符在不同版本间可能有修订。所有查询和转换都在浏览器本地完成,输入的字符、编码不会发送到服务器,断网也能用。