Unicode 中的幽灵字符:1978 年的误植

A Spectre Is Haunting Unicode

Unicode 中的幽灵字符:1978 年的误植

1978 年日本经济产业省制定的 JIS X 0208 标准中,意外混入了一批来源不明的“幽灵字符”。这些字符大多源于编目时的无心之失,例如将“山”和“女”拼贴时产生的视觉误差。尽管 1997 年的调查揭示了大部分字符的成因,但仍有字符如“彁”至今成谜。随着 JIS 标准被广泛采用,这些由错误诞生的字符最终进入了 Unicode,如今潜伏在全球计算机的字库角落,或许将伴随人类文明永远存在。

这些错误未被发现的时间刚好足够被固化下来,如今这些幽灵至少从理论上已成为地球上每台计算机的一部分,潜伏在字符表的黑暗角落。
  1. joshdavham

    徐冰有一本完全由自造字组成的书:

    https://en.wikipedia.org/wiki/A_Book_from_the_Sky

  2. tengwar2

    作者 Paul McCann (polm) 是我见过最棒的程序员之一!

    过去十年他在日语 NLP 领域做了大量出色的工作,对我的语言学习项目帮助极大。

    他维护了一个用于 Python 的 mecab(日语分词器)封装库 [0],还写了一本面向英语读者的日语 NLP 书籍 [1],并且曾在 Spacy 项目工作过 [2]。

    [0] https://github.com/polm/fugashi

    [1] https://www.japanesenlp.com/

    [2] https://spacy.io/

  3. layer8

    我突然想到,我们可以用“彊”来表示“一个完全未知、无法命名的概念”。例如,如果你问:“当克苏鲁从沉睡中苏醒时,它做的第一件事会是什么?”,答案可能是:它将会 彊。

  4. eproxus

    我认为有证据表明,“彁”这个字的起源是某篇报纸文章扫描质量太差导致的。搜索“彁 新聞”可以找到一些关于此事的日语资料。

  5. erjiang

    事实上,康熙字典(它是绝大多数 CJK 字符的“来源”)中就有大片区域充满了文章中描述的那种“幽灵字符”……

    CJK 字符的特殊属性以及其被纳入 Unicode 时的哲学理念(看来日本人不太喜欢 Unicode 那种亚里士多德式的本质主义倾向),可能单凭这一点就迫使 Unicode 不得不超出 BMP 的范围进行扩展……

同日更多故事

2026-08-15