Wenn KI eine Million Token pro Sekunde schreibt, entscheidet die Prüfung
What if AI worked at 1.000.000 tokens per seconds?

Eine Million Token pro Sekunde – was bedeutet das eigentlich? Der Artikel unterscheidet vier Bedeutungen: Kontextkapazität, Eingabeverarbeitung, aggregierter Durchsatz und die Ausgabegeschwindigkeit eines einzelnen Agenten. Anhand von vier Gedankenexperimenten – 1.000 Story-Enden, 40 App-Entwürfe, 10.000 Experimente, 10.000 Gesprächsproben – zeigt er: Selbst wenn das Schreiben um den Faktor 10.000 schneller wird, bleibt die Prüfung der Engpass. Bei einer festen 60-Sekunden-Kontrolle sinkt der End-to-End-Speedup auf das 132-fache. Wertvoll bleiben Urteilsvermögen, Spezifikationen, Tests und physische Evidenz.
Was auch immer Sie nicht beschleunigen, wird fast die gesamte verbleibende Zeit ausmachen – die Logik von Amdahls Gesetz.
- gchamonlive
Ich will den Artikel nicht schlechtreden, aber eine viel interessantere Perspektive mit einem LLM, das 1 Mio. TPS schafft, wären die unzähligen Echtzeit-Anwendungen, die man damit bauen könnte.
Ich mag elektronische Musik, ich tanze viel dazu. Was wäre, wenn ich ein LLM hätte, das genug Durchsatz und niedrige Latenz hat, um das Gegenteil zu tun: mein Tanzen aufzunehmen und Musik zu generieren.
Wir starren immer noch auf rohe künstliche kognitive Intelligenz, aber echter Fortschritt wird kommen, wenn wir aufhören, diese als externe Intelligenz wahrzunehmen und sie einfach als eine Erweiterung unserer selbst betrachten.
- sixtyj
„Wenn“ ist vorübergehend. Mehr TPS ist eine Frage der Zeit. In einem solchen Anwendungsfall wird der Mensch aus der Schleife entfernt, da niemand – selbst jemand mit der schnellsten Auffassungsgabe – der langsamste Teil sein wird.
Wie viele Branchen sind das? Wie viele Anwendungsfälle sind möglich?
Wenn du alles löst, was werden die Menschen tun? Am Strand sitzen und Drinks schlürfen?
Massiver Abbau der menschlichen Gehirne und Anstieg neurodegenerativer Erkrankungen, weil ein ungenutztes Gerät fehlerhaft zu werden beginnt?
1.000.000 TPS ist gut für einige Anwendungsfälle, aber nicht öffentlich verfügbar …
- ed
Bei 1 Mio. TPS könnten LLMs UIs in Echtzeit generieren (eine 5k-Webseite würde 5 ms dauern). Anwendungen werden dann kaum noch etwas mit den heutigen Stacks gemeinsam haben. (Zum Anfang könnten Rendering, Event-Handling und Datenspeicherung in den Kontext wandern.)