DeepSeek verschenkt einen 437-fachen KV-Cache-Durchbruch – und der Westen schweigt

The AI Race Just Got Awkward

DeepSeek verschenkt einen 437-fachen KV-Cache-Durchbruch – und der Westen schweigt

Während Anthropic und OpenAI noch über chinesisches Model-Distillation klagen, hat DeepSeek mit seiner MLA-Architektur und nachfolgenden Optimierungen den KV-Cache für Long-Context-Modelle um den Faktor 437 verkleinert. Die neueste Version DeepSeek-V4.1-Flash senkt den Speicherbedarf auf 890 Bytes pro Token. Westliche Labore übernehmen diese Technik stillschweigend: Claude Opus 5.5 und GPT-6.1 Sol erschienen ohne Ankündigung, mit drastisch gesenkten Cache-Read-Preisen. Die chinesischen Labore haben ihren westlichen Konkurrenten damit unerwartet unter die Arme gegriffen – warum, bleibt unklar.

So haben die chinesischen Labore den westlichen Verlust-Laboren ein Rettungsseil zugeworfen, und ich habe einfach keine Ahnung, warum.
  1. cmiles8

    Warum ist es ein Problem, dass die chinesischen Labore einfach Anthropics Modelle destillieren? Sind Anthropics Modelle nicht auch nur Destillate der Arbeit anderer?

    Fühlt sich an, als würde Anthropic weinen: „Tu, was ich sage, nicht, was ich tue.“

  2. slowin

    Ich bin den chinesischen Laboren auch dankbar dafür, dass sie Workarounds für die umzäunten Gärten bereitstellen, die die US-amerikanischen KI-Firmen zu errichten versuchen.

    Weiß jemand, ob es Destillations-Datensätze gibt? Ich würde sie liebend gern per BitTorrent verteilt sehen. Ich halte es für entscheidend, dass KI demokratisiert wird und nicht in den Händen einiger weniger Privatunternehmen isoliert bleibt.

  3. bwest87

    Die beste Erklärung ist, dass es ein Ziel der KPCh ist, LLMs generell zu commodifizieren, weil LLMs letztlich eine Ergänzung zur Fertigung sein werden (die China dominiert), und man immer seine Ergänzungen commodifizieren will.

    Ich denke, das erklärt, warum sie so umfassend Open Source betreiben. Es ist nicht aus Nettigkeit. Es ist ein strategischer Schachzug der chinesischen Regierung, um sicherzustellen, dass es in diesem Rennen viele Spieler gibt und sich nicht zu viel Macht bei amerikanischen Laboren ansammelt (auch wenn amerikanische Labore dabei profitieren).

  4. listless

    Ich bin mehr als dankbar, dass chinesische KI-Modelle so gut sind. Ich möchte unbedingt die unzähligen Leiden heilen, die Menschen täglich unnötig ertragen. Dafür werden wir leistungsfähigere Modelle brauchen als die, die wir jetzt haben, und die Chinesen liefern den Wettbewerb, der nötig ist, um die Sache so schnell wie möglich voranzutreiben.

    Mir ist klar, dass „so schnell wie möglich“ derzeit nicht die populärste Haltung ist. Aber ich bin weit mehr daran interessiert, welches Gute wir bewirken können, als an 10%-Apokalypse-Szenarien. Ich arbeite ehrenamtlich für eine Wohltätigkeitsorganisation für Hirntumor bei Kindern und will nicht noch ein 4-jähriges Kind sterben sehen. Ich bin bereit, alles zu riskieren, um das zu verhindern.

  5. reedf1

    Ich betreibe Qwen 3.8 27b (ein Modell der Opus-4.6-Klasse) seit etwas über zwei Wochen lokal auf einer 5090 mit 170 Tokens/s. Das ist ein Frontier-Modell von vor 9 Monaten, das auf Consumer-Hardware läuft. Wer weiß, wohin uns Destillation und Pruning in einem weiteren Jahr bringen.

  6. reticulates

    „Also haben die chinesischen Labore den westlichen Verlust-Laboren einen Rettungsring zugeworfen, und ich habe einfach keine Ahnung, warum.“

    Ich glaube nicht, dass es Absicht ist, aber tatsächlich ist das ziemlich schlecht für die westlichen Labore.

    Das ganze Booster-Narrativ war: „Schaut, wie ihr Umsatz wächst! Von 10 Mrd. auf 100 Mrd. ARR in unter einem Jahr! Das wird ein Multi-Billionen-IPO!“ Und das extrapolierte zukünftige Wachstum von 100 Mrd. auf 500 Mrd. und von 500 Mrd. auf 1 Billion rechtfertigte zukünftige Investitionen … aber dieser Umsatz kam nur daher, dass Inferenz teuer war.

    Die Umsatzwachstumsgeschichte ist vor dem IPO alles, was zählt. Wenn der Umsatz von 100 Mrd. auf 50 Mrd. fällt, ist das eine sehr, sehr schlechte Optik für OpenAI und Anthropic, selbst wenn sie jetzt profitabel sind – es zerstört das Wachstumsnarrativ vollständig.

  7. eggbrain

    Leistungsoptimierungen helfen nicht nur den westlichen Laboren, sie helfen auch dabei, leistungsfähigere/nützlichere LLMs lokal laufen zu lassen.

    Wenn lokale LLMs „gut“ genug werden, werden die Leute bald keine Abonnements für ChatGPT und Claude mehr bezahlen, was deren Umsatz schadet.

  8. user43928

    > All dies muss bedeuten, dass die westlichen KI-Firmen jetzt extrem positive Inferenz-Margen haben.

    > Also haben die chinesischen Labore den westlichen Verlust-Laboren einen Rettungsring zugeworfen, und ich habe einfach keine Ahnung, warum.

    Dass Inferenz nicht profitabel war, ist ein weitverbreiteter Mythos.

    Eine Analyse auf Basis von Kimi K3 legt nahe, dass OpenAI und Anthropic Margen deutlich über 95 % haben: https://inferencex.semianalysis.com/run/kimi-k3-on-b200

    In den letzten Monaten habe ich mehrfach Nachrichten gesehen, dass OpenAI Durchbrüche bei der Inferenz-Effizienz erzielt hat.

    Ich habe keinen Grund zu der Annahme, dass die führenden US-Labore nicht ihre eigenen Optimierungen haben oder dass sie diese spezielle Optimierung von DeepSeek gelernt haben.

  9. rglover

    > Also haben die chinesischen Labore den westlichen Verlust-Laboren einen Rettungsring zugeworfen, und ich habe einfach keine Ahnung, warum.

    „So bewegt der Kriegskundige den Feind und wird nicht von ihm bewegt.“

    Sie haben eine clevere Methode gefunden, um übermäßige Trainingskosten durch Destillation zu vermeiden. Das zwingt die Frontier-Labore, schneller zu handeln, bessere Modelle zu produzieren usw. (um Blamage und „Zurückfallen“ zu vermeiden – während sie den Großteil der Kosten tragen), die sie dann einfach weiter destillieren können – oder andere Techniken dagegen anwenden – sehr zum Leidwesen besagter Frontier-Labore.

    Schachmatt.

  10. wren6991

    Die Doppeldenk-Leistung, die nötig ist, um gleichzeitig zu glauben, „unsere Schutzmaßnahmen hindern unsere Modelle daran, nicht genehmigte Cybersicherheitsaufgaben auszuführen“ und „Destillation ist der Grund, warum chinesische Modelle bei Cybersicherheitsaufgaben besser werden“, ist wirklich ziemlich komisch.

Mehr von diesem Tag

2026-09-30