← 文章 / 编程开发
Hacker News 3小时前 · 2026-08-16 13:03:51 · 0 阅读

幽灵文字正在困扰 Unicode

本文收录于代码与计算机日语语言技术专题。

1978 年,日本经济产业省制定了一套编码标准,后来被称为 JIS X 0208。时至今日,它仍是所有日文编码的重要参考。然而,JIS 标准发布后,人们发现了一些奇怪之处:新增的若干字符找不到明确的出处,也没人知道它们表示什么、该如何发音。没人能确定它们的来源。这些字符后来被称为“幽灵文字”(幽霊文字)。

写什么可得小心点。资料来源:日本国立国会图书馆

长期以来,幽灵文字一直是个未解之谜,也几乎被人们遗忘;但在 1997 年,人们展开调查,着手追查它们的来历。按照要求,JIS 标准中的每个字符都应该留有出处记录,但即便有记录,内容也不够具体,通常只列出参考文件的名称。

你可能会以为,只要列出出处,找出字符的来源就很容易。但必须先弄清楚,所谓“出处”究竟指什么。幽灵文字最常见的来源之一是《日本全国行政区划总览》(国土行政区画総覧),其中收录了日本各地的地名。你大概会和我一开始一样,以为它是一本大开本地图集,最多不过几百页。结果却发现,最新版足足有七卷,每卷大约九百页。试想一下,如果没有页码信息,要从中追查某个字符的出处会有多难。

尽管过程艰难,对幽灵字符的调查还是基本查清了它们的来历。通过采访参与标准编纂的编目人员,调查人员确认,其中一些字符其实是编目过程中无意间产生的错误。比如「妛」就是在尝试记录「山 over 女」时引入的错误。「山 over 女」出现在某个地名中,因此符合纳入 JIS 标准的条件,但由于当时还无法将其作为一个字符打印,他们便把「山」和「女」分开打印,剪下来并排贴在一张纸上再复印。在阅读复印件时,两小片纸相接处的线条看起来像是一笔,于是被误加进了这个字符。而它原本的字形(𡚴)直到很久以后才被加入 JIS 和 Unicode,而且在大多数网站上我也没法正常显示它。

核心幽灵字符:�挧暃椦槞蟐袮閠駲墸�彁

最终,只有一个字符既没有明确的来源,也找不到任何历史先例,那就是「彁」。最有可能的解释是,它是被误读成「彊」字时产生的,但具体是怎么发生的并没有查清楚。

JIS 标准被广泛采用之后,这些字符随之进入了 Unicode,而 Unicode 在 CJK 统一过程中也引入了自己一套独立的幽灵字符

总结一下——1978 年的一系列小错误凭空「创造」出了一些字符。这些错误在被发现之前,恰好赶上了标准定型的时机,于是就这样被永远固化下来。如今这些幽灵至少在理论上已经存在于地球上每一台电脑之中,潜伏在字符表的隐秘角落。

照这个趋势,它们大概会永远伴随着人类。�

参考资料 / 相关链接:

2018-07-29T14:03:09+09:00
原始来源: Hacker News

评论 (0)