LLMに「1866年の電信文体」で書かせると、出力トークンが48%減り、精度はむしろ向上した

Write Like It's 1866: LLMs Relearn Telegraphese

LLMに「1866年の電信文体」で書かせると、出力トークンが48%減り、精度はむしろ向上した

1866年の電信は10語で100ドル、現代のLLM APIはトークン課金。同じ「計量された言葉」の制約下で、モデルに電信文体(cablese)で書かせると、出力トークンを最大49%削減できることが50記事・約1300問のベンチマークで判明。圧縮された記録を別のモデルが読んでも精度は平文と同等以上(回復率0.99〜1.10)。ただし推論を無効化できないgpt-5-miniだけは逆にコストが倍増する。

圧縮は、内容が固まった後、機械が読む記録へと行うなら、支払うものは何もない。
  1. OtherShrezzing

    このページは(ある意味皮肉にも)Claude語りがあまりに満載で、ノイズの中で情報を見つけるのが難しい。しかし、すべてを読み進めると、こうした事実が見えてくる:

    >テストが測定するもの:モデルに一節と、短く検証可能な回答(日付、名前、数)が付いた固定の質問セットが与えられる。

    つまり、モデルには特に圧縮に適した内容が与えられ、次のような特定の制約下でそれを再現するよう求められる…

    >なぜプレーンテキストのベースラインは100%ではないのか?非圧縮の一節についてプレーンテキストで質問に答えると約91%のスコアになる…正しい答えでも言い回しが違うと[失敗]と判定される

    モデルは客観的に正しい答えを出せる(そして実際に出している)が、実装者の言い回しの好みに関する全知の知識を持たないためにペナルティを受ける。

    もしこの現象がモデルに創発するなら、このベンチマークは意味のある形でそれを証明するものではない。

  2. Solomet

    最近のLLMの文章の特徴:概念が、通常は物理的な物体により適した用語で説明される。

    > フロンティアモデルでそれを抑制するラボは、単にその利点を、まだそれを _carry_ しているオープンモデルに移すだけだ

    > それらはどちらが優れているかについてのシグナルを _carry_ していない

    > そのフロンティア上でワークロードがどこに _sits_ するかが、その点を選ぶべきだ

    > そしてどのモデルも審判の席に _sits_ していない

    > すべての比率が0.99〜1.10に _sits_ している

    「sit」の例はまだまだたくさんある。

    > この記事のすべての比較が質問を「holds」している

    最近のLLMを使った仕事でこれをよく見かけるようになり、かなりイライラする。さらにイライラするのは、不必要に低シグナルの用語を頻繁に使うことだ。こうした「物理的オブジェクト」用語は一例だが、時には「fit」するからという理由で、より説明的でない用語を選ぶことで「努力を保存」しているように本当に見える。

    また、怠惰以外に識別できる理由もなく、説明的な用語をより曖昧な用語に置き換えているのにも気づいた。

    エージェントが曖昧な用語と具体性の欠如に逆戻りし始めたとき、最近の私の定番の指示は「曖昧さを最小化せよ」だ。

  3. bilater

    実は、この記事から得られる教訓は、コンテキスト圧縮、AGENTS.md、システムガイド、その他トークンを節約するためのハーネス的な方法の周りで我々がやっているこうした小さなハックの多くは、電信時代のトリックがすべて、通信が十分に安くなり、ただ平易な言葉で話す方が簡単になった時点で消え去ったのと同じように、かなり急速に消え去るだろうということだと思う。

  4. netsharc

    Cablese/TelegrapheseはLLMでの使用よりも興味深い。DuckDuckGoで「paromella」を検索した:

    https://en.wikipedia.org/wiki/Commercial_code_(communication...

    興味深いいくつかのコード:

    > INSANE - at what price, free on board and freight, can you offer us cotton for shipment by steamer sailing this week?

    > COGNOSCO - dining out this evening, send my dress clothes here

    便利なコードワード!

    > ANNOSUS — Confined yesterday, Twins, both dead, Mother not expected to live

    これが実際に使われたのはどれくらいの頻度だったんだろう??

  5. z2

    最近のChatGPT(GPT5.6)との会話で、時折UIに推論が漏れ出るのを見たが、そこからすると、このようなものはすでに実装されていることは明らかだ。そして、これが最近のトークン使用量削減の主張の大部分を占めているのだろうと推測する。もちろん、彼らが文字通りcableseをプロンプトしているかどうかはわからないが。

    「前回の出力を確認する必要あり。スクリプトを実行、結果は問題なし、次のステップの準備が必要。準備OK?進め。」

この日のほかの記事

2026-10-07