幽霊文字:Unicodeに潜む1978年の幻の漢字

A Spectre Is Haunting Unicode

幽霊文字:Unicodeに潜む1978年の幻の漢字

1978年、日本の通商産業省(現・経済産業省)が制定したJIS X 0208には、出典不明の謎の漢字がいくつか含まれていた。これらは「幽霊文字」と呼ばれ、長らく謎とされてきたが、1997年の調査で、多くは誤植や誤読によって生まれたことが判明。例えば「妛」は「山」と「女」を貼り合わせた際の線が誤って筆画として加えられたものだった。しかし「彁」だけは出典も前例も見つからず、誤読の可能性が指摘されるのみ。これらの文字はUnicodeにも収録され、今や世界中のコンピュータに潜む「幽霊」となっている。

これらの幽霊は、少なくとも潜在的に、地球上のすべてのコンピュータの一部となり、文字表の暗がりに潜んでいる。
  1. joshdavham

    著者のPaul McCann(polm)は、私が最も好きなプログラマーの一人です!

    彼はここ10年、日本語NLPの分野で素晴らしい仕事をしてきて、私の言語学習プロジェクトに本当に役立っています。

    彼はPython用のmecab(日本語形態素解析器)ラッパーをメンテナンスしており[0]、英語話者向けの日本語NLPの本を執筆し[1]、またSpacyの開発にも携わっていました[2]。

    [0] https://github.com/polm/fugashi

    [1] https://www.japanesenlp.com/

    [2] https://spacy.io/

  2. tengwar2

    その前には、IBM基本文字セットにおけるÿとŸの事例がありました(https://en.wikipedia.org/wiki/Ÿ 参照)。前者はフランス語とハンガリー語の固有名詞のごく一部(約5つの固有名詞)に存在しますが、それは単にトレマ付きのyであり、通常はUnicodeの修飾記号で処理されるものです。また、南米のいくつかの絶滅危惧言語でも使用されていますが、それがPC文字セットに採用されることに影響を与えたとは考えられません。おそらく、オランダ語の「ij」文字を表すつもりだったのではないかと考えられていますが、どうやら印刷物で「ÿ」と書かれることはないようです。Ÿはどの言語でも使用されていないようです。

  3. erjiang

    「彁」の起源については、新聞記事のスキャン不良によるものだという証拠が見つかっていると思います。「彁 新聞」で検索すると、これに関する日本語の情報源が見つかります。

  4. gweinberg

    「彊」を「まったく未知の、名前を付けられない概念」を意味するのに使えることに気づきました。例えば、「クトゥルフが眠りから目覚めたとき、最初に何をするだろうか?」と尋ねたら、おそらく「彊」するでしょう。

  5. layer8

    (2018年)

    主な過去の議論:

    110コメント: https://news.ycombinator.com/item?id=17637375

    130コメント: https://news.ycombinator.com/item?id=24951130

    180コメント: https://news.ycombinator.com/item?id=32095502

  6. hnfong

    まあ、康煕字典(おそらくほとんどのCJK文字の「出典」として使われている)の広大な部分は、記事で説明されているような「幽霊文字」です...

    CJK文字の特異な性質と、Unicodeに実装された際の哲学(どうやら日本人はUnicodeのアリストテレス的本質主義への傾向を好まなかったようです)は、おそらく単独でUnicodeをBMPを超えて拡張せざるを得なくしました...

  7. sedatk

    魅力的ですね。しかし、実在する文字が欠けているよりも、余分な無効な文字がある方が良いと思います。

  8. eproxus

    これは、漢字のタトゥーを読めない人に入れるという洒落として、素晴らしいタトゥーになるでしょう。

この日のほかの記事

2026-08-15