Unicode 中的幽灵字符:1978 年的误植
A Spectre Is Haunting Unicode

1978 年日本经济产业省制定的 JIS X 0208 标准中,意外混入了一批来源不明的“幽灵字符”。这些字符大多源于编目时的无心之失,例如将“山”和“女”拼贴时产生的视觉误差。尽管 1997 年的调查揭示了大部分字符的成因,但仍有字符如“彁”至今成谜。随着 JIS 标准被广泛采用,这些由错误诞生的字符最终进入了 Unicode,如今潜伏在全球计算机的字库角落,或许将伴随人类文明永远存在。
这些错误未被发现的时间刚好足够被固化下来,如今这些幽灵至少从理论上已成为地球上每台计算机的一部分,潜伏在字符表的黑暗角落。
HN 评论区
114- joshdavham
徐冰有一本完全由自造字组成的书:
- tengwar2
作者 Paul McCann (polm) 是我见过最棒的程序员之一!
过去十年他在日语 NLP 领域做了大量出色的工作,对我的语言学习项目帮助极大。
他维护了一个用于 Python 的 mecab(日语分词器)封装库 [0],还写了一本面向英语读者的日语 NLP 书籍 [1],并且曾在 Spacy 项目工作过 [2]。
[0] https://github.com/polm/fugashi
- layer8
我突然想到,我们可以用“彊”来表示“一个完全未知、无法命名的概念”。例如,如果你问:“当克苏鲁从沉睡中苏醒时,它做的第一件事会是什么?”,答案可能是:它将会 彊。
- eproxus
我认为有证据表明,“彁”这个字的起源是某篇报纸文章扫描质量太差导致的。搜索“彁 新聞”可以找到一些关于此事的日语资料。
- erjiang
事实上,康熙字典(它是绝大多数 CJK 字符的“来源”)中就有大片区域充满了文章中描述的那种“幽灵字符”……
CJK 字符的特殊属性以及其被纳入 Unicode 时的哲学理念(看来日本人不太喜欢 Unicode 那种亚里士多德式的本质主义倾向),可能单凭这一点就迫使 Unicode 不得不超出 BMP 的范围进行扩展……