关于 文本转 Unicode
文本转 Unicode 工具把字符转换为“反斜杠 u 加四位十六进制”的转义序列或码点列表,也支持反向把 Unicode 转义还原为可读文字,方便在源码、配置文件或日志中正确表示非 ASCII 字符。它能列出每个字符的十进制与十六进制码点,帮助排查乱码与编码不一致问题。转换在浏览器本地完成,结果可复制。对处理中文、emoji 或特殊符号的开发者,以及学习字符编码原理的用户,都是一个随时可用的小助手,也常与本站 Base64 工具配合,先把二进制再编成文本以便传输。或在调试时快速确认某个奇怪字符究竟对应哪个码点,定位乱码根源更方便;转换在本地完成结果可复制,对处理中文、emoji 或特殊符号的开发者以及学习字符编码原理的用户都是随手助手,也常与本站 Base64 工具配合先把二进制再编成文本以便传输。
码点与字节序列是两个层次,混用会导致对结果的误读。码点是字符在标准中的编号,与编码方式无关;而字节序列是它落成文件后的实际形态,同一码点在不同编码下占用的字节数不同。因此讨论「这个字符有多长」时必须先说明是哪个层次:按字符数、按码点数还是按字节数,三者在含中文或表情的文本上差异明显。
超出基本平面的字符需要用一对代理项来表示,这是转义形式里最容易出错的地方。常见转义写法只记录四位编号,遇到编号超过该范围的字符时就需要用两个连续的转义单元拼合,单独看任何一个都不构成完整字符。因此在处理表情或罕见汉字时,若按每四位一组去切分字符串,就会把字符拦腰截断。
转义写法的种类比想象的更多,互相转换时需要说明格式。同一条码点可以用「U 加编号」的形式书写,也可以写成反斜杠转义、十进制实体或十六进制实体,各自的适用场景不同:前者便于人工阅读,后几种用于嵌入特定语言或标记。因此转换工具应当明确输出的是哪一种,否则接收方可能按另一种规则解读。
不可见字符是这类转换里最容易带来安全问题的部分。存在一批看起来与常规字符完全相同、实际码点不同的字母(例如不同书写体系里的同类字母),它们能用来构造视觉上毫无差别但内容不同的字符串,从而绕过简单的比对。因此在做标识校验或域名核对时,不能只做视觉比对,应当先做一次规范化再用码点严格比较。
归一化是处理跨来源文本时的必要步骤。同一个可见字符可能有多种码点组合方式,例如带重音符号的字母既可以是一个合成码点,也可以是基础字母加组合符号。若不先归一化,两个「看起来一样」的字符串在比较时会判定为不同,这种现象在从不同系统汇总文本时尤其常见,排查起来又不容易定位。
最后,这类转换的典型用途是排查而非创作。它最有价值的地方在于「把一个看不见差异的问题变成看得见的差异」——例如确认两个变量名是否真的相同、找出配置里混入的不可见字符。因此使用时应把它当作诊断工具,在确认问题后回到文本编辑器里用规范化手段处理,而不是长期依赖转义形式来承载内容。
实现原理
转义把字符写成码位形式(形如反斜杠加 u 加四位十六进制)。需要注意两点:一,超出基本平面的字符在部分语言的写法中用两个代理项表示,逐位解读会得到错误字符;二,转义只是表示方式,解析时必须由目标语言按同样规则还原,直接当普通字符串处理会把转义序列原样显示出来。
字符 A\u0041(四位十六进制);基本平面之外的字符需要两个代理项表示使用方法
- 打开「文本转 Unicode」
- 选择源格式与目标格式
- 根据需要调整输出选项
- 点击「转换」按钮,结果实时显示
- 复制或导出结果
使用场景
- 查码点 — 查看某个字符对应的 U+ 码点,确认是否为期望的那个字。
- 还原转义 — 把源码里的 \\uXXXX 转义序列还原成可读文字,方便核对内容。
- 生成转义 — 把含特殊字符的字符串转成 \\u 转义,安全嵌入 JSON 或源码。
- 辨别相似字 — 通过码点区分形近的字符(如全角与半角),排查输入陷阱。
- 排查乱码 — 看码点判断字符是否被错误编码,定位乱码来源。
常见问题
emoji 的码点为什么有时显示两个值?
超出基本多文种平面的字符(码点大于 U+FFFF)在 UTF-16 里用一对代理项表示。工具会显示其真实码点,并能在码点与代理对之间正确转换。
支持哪些转义写法?
常见的有 \\uXXXX(四位十六进制)和 U+XXXX 标记;对于大码点字符,也支持带花括号的扩展写法,便于处理 emoji。
组合字符(如带音标的字母)怎么处理?
它们可能由多个码点组合而成。工具按实际码点序列展开,因此一个看起来单一的字形可能对应多个 U+ 值,属正常现象。
码点是十进制还是十六进制?
Unicode 码点通常以十六进制表示并加 U+ 前缀。本工具默认输出十六进制,符合标准书写习惯。
想要 0/1 二进制怎么办?
本工具给的是字符码点;如果你需要基于 UTF-8 字节的二进制位串,请使用本站的文本转二进制工具。
如何在线把文字转成 Unicode 编码?
在本工具粘贴文本,即时得到对应的 Unicode 转义序列,方便在代码或配置中安全嵌入非常规字符。
UTF-8 和 Unicode 转义有什么区别?
UTF-8 是字节编码方案,Unicode 转义是文本表示形式;本工具做后者,常用于 JSON 或源码中表达特殊字符。
How to encode text to Unicode online?
Paste text and get the Unicode escape sequence instantly, handy for safely embedding unusual characters in code or config.
What is the difference between UTF-8 and Unicode escapes?
UTF-8 is a byte encoding; a Unicode escape is a text representation. This tool produces the latter, often used in JSON or source to express special characters.
「花式字体」发到别的平台变成方框或问号?
花式字体用的是 Unicode 数学字母区(U+1D400 起),这些字符不是所有平台的字体都收录。目标是聊天软件时兼容性差;用于标题、用户名等场景前,先在目标平台实测一次。
转义后文本长度变了,还能还原回原文吗?
能,转义是双向可逆的:\XXXX 按 4 位十六进制还原成一个字符,代理对还原成一个 emoji。前提是转义与反转义使用同一编码口径(UTF-16 码元 vs Unicode 码点),混用会导致字符边界错乱。
为什么同一个汉字在不同工具里得到的码点不一样?
极少数汉字存在「兼容字符」:同一字形在 Unicode 里有多个码位(CJK 统一表意区与兼容区)。来源不同(不同输入法、不同字体)可能落在不同码位,显示相同但编码不同。全文检索与搜索优化时要注意归一化(NFC/NFKC)。