LLMs entdecken Telegraphenstil neu: fast halbierte Token-Kosten bei gleicher Genauigkeit
Write Like It's 1866: LLMs Relearn Telegraphese

Ein neuer Benchmark zeigt: Wenn man LLMs anweist, im Telegrammstil zu schreiben – Artikel und Füllwörter weglassen, alles in Kleinbuchstaben –, schrumpfen die Ausgaben um bis zu 49 Prozent, während andere Modelle die komprimierten Aufzeichnungen genauso gut oder besser verstehen als Klartext. Der Effekt tritt über Modellfamilien hinweg auf, ohne Training oder API-Änderung. Nur Modelle mit nicht abschaltbarem Reasoning wie gpt-5-mini profitieren nicht. Die Technik eignet sich für Agenten-Gedächtnis und maschinelles Lesen, nicht für menschenlesbare Endausgaben.
Die teure Hälfte jeder LLM-Rechnung ist optionaler Overhead für maschinell konsumierten Text.
- OtherShrezzing
Diese Seite ist (etwas ironischerweise) so extrem vollgestopft mit Claude-Sprech, dass es schwer ist, in all dem Lärm die Informationen zu finden. Aber wenn man sich durch alles durchgekämpft hat, sieht man diese Fakten:
>Was der Test misst: Ein Modell bekommt eine Passage und einen festen Satz von Fragen mit kurzen, überprüfbaren Antworten – ein Datum, ein Name, eine Anzahl.
Also bekommt ein Modell Inhalt, der besonders komprimierbar ist, und wird gebeten, ihn unter bestimmten Einschränkungen wiederzugeben, wie ...
>Warum ist die Klartext-Baseline nicht 100 %? Die Beantwortung von Fragen zu einer unkomprimierten Passage in Klartext erreicht ~91 % ... eine korrekte Antwort, die anders formuliert ist, wird als [Fehler] gewertet.
Modelle können (und tun es) objektiv richtige Antworten geben, werden aber dafür bestraft, dass sie nicht über eine Art allwissende Kenntnis der Formulierungsvorlieben des Implementierers verfügen.
Wenn dieses Phänomen in Modellen emergent ist, ist dieser Benchmark kein Beweis dafür in irgendeiner sinnvollen Weise.
- Solomet
Neuestes LLM-Schreibverrat: Konzepte werden mit Begriffen beschrieben, die normalerweise eher für physische Objekte angemessen sind.
> Ein Labor, das es in einem Frontier-Modell unterdrückt, verlagert den Vorteil nur auf offene Modelle, die es immer noch _tragen_
> sie tragen kein Signal darüber, welches besser ist
> wo deine Workload an dieser Frontier _sitzt_, sollte den Punkt auswählen
> und kein Modell _sitzt_ auf dem Richterstuhl
> jedes Verhältnis _sitzt_ bei 0,99–1,10
Viele, viele weitere Beispiele für "sitzen"
> Jeder Vergleich in diesem Beitrag "hält" die Fragen
Ich habe das in letzter Zeit bei meiner Arbeit mit LLMs oft gesehen, und es ist ziemlich frustrierend. Noch frustrierender ist, wie häufig es unnötigerweise Begriffe mit geringem Signalgehalt für Dinge verwendet. Diese "physischen Objekt"-Begriffe sind ein Beispiel, aber manchmal scheint es wirklich, dass sie "Aufwand bewahren", indem sie einen weniger beschreibenden Begriff wählen, weil er "passt".
Ich habe auch bemerkt, dass es beschreibende Begriffe durch vagere ersetzt, ohne erkennbaren Grund außer Faulheit.
"Minimiere Mehrdeutigkeit" ist in letzter Zeit meine Standardanweisung, wenn der Agent wieder zu vagen Begriffen und mangelnder Spezifität driftet.
- bilater
Eigentlich, ich denke, die Lektion aus diesem Artikel ist, dass viele dieser kleinen Hacks, die wir rund um Kontextkomprimierung, AGENTS.md, Systemanleitungen und andere harnessartige Wege zur Token-Einsparung machen, ziemlich schnell verschwinden werden, genau wie all die Tricks aus der Telegrafen-Ära verschwanden, als Kommunikation billig genug wurde, dass es einfacher war, einfach in klarer Sprache zu sprechen.
- netsharc
Das Cablese/Telegraphese ist interessanter als die Verwendung im LLM. DuckDuckGo'te "paromella":
https://en.wikipedia.org/wiki/Commercial_code_(communication...
Einige Codes, die ich interessant fand:
> INSANE – zu welchem Preis, frei an Bord und Fracht, können Sie uns Baumwolle für den Versand per Dampfer anbieten, der diese Woche ausläuft?
> COGNOSCO – heute Abend auswärts essen, schicken Sie meine Abendgarderobe hierher
Nützliches Codewort!
> ANNOSUS – Gestern eingesperrt, Zwillinge, beide tot, Mutter wird voraussichtlich nicht überleben
Wie oft wurde das wohl verwendet??
- z2
Aus neueren ChatGPT (GPT5.6)-Konversationen, in denen ich gelegentlich Reasoning-Leaks in die UI gesehen habe, ist klar, dass so etwas bereits implementiert ist, und ich würde spekulieren, dass dies die Mehrheit der jüngsten Behauptungen über geringeren Token-Verbrauch ausmacht. Ich bin mir nicht sicher, ob sie buchstäblich zu Cablese auffordern, natürlich.
"Muss Ausgabe vs. vorherige prüfen. Skript ausgeführt, Ergebnisse in Ordnung, muss nächsten Schritt vorbereiten. Bereit? Los."