Warum Ihr lokales LLM dümmer wirkt, als es ist

Why your local LLM feels dumber than it is

Warum Ihr lokales LLM dümmer wirkt, als es ist

Ein technischer Deep Dive zeigt, warum lokale LLMs oft schlechter abschneiden als erwartet: Die Wahl des Attention-Backends, KV-Cache-Quantisierung und Gewichtsquantisierung führen zu messbaren Abweichungen bei den Logits. In Tests mit Qwen3.6-27B auf einer RTX PRO 6000 verursachten verschiedene Backends Token-Flips, und eine quantisierte KV-Cache führte zu Fehlern bei Tool-Aufrufen. Die Ergebnisse unterstreichen, dass die Implementierung die Modellqualität erheblich beeinflusst.

Jede einzelne Hardware- und Software-Instanz, die heute ein LLM ausführt, ist ein wenig anders – oder in manchen Fällen sogar sehr unterschiedlich.
  1. big-chungus4

    Ich habe gerade Qwen 3.8 27b MLX auf meinem MacBook Pro zum Laufen gebracht, und ehrlich gesagt bin ich ziemlich beeindruckt davon, wie wenig dumm es ist.

  2. jonplackett

    Der Abschnitt über Systemprompts und Kontextfenster-Management trifft den Nagel auf den Kopf; die meisten Leute realisieren nicht, wie stark die Standard-Quantisierung in beliebten Runnern die Logik im Vergleich zu vollem FP16 verschlechtert. Ich wäre neugierig, ob der Autor die Auswirkungen der KV-Cache-Kompression auf das Denken über längere Kontexte gemessen hat, denn das scheint meistens der Punkt zu sein, an dem mein lokales Llama-3-Setup auseinanderzufallen beginnt.

  3. utopiah

    Vieles davon ist der Grund, warum ich mich an die Regel halte:

    a) Quantisiere deinen KV-Cache nicht

    b) Verwende keine Quantisierungen des LLM, die schlechter sind als das beste verfügbare Q8 (die größtmögliche Dateigröße von unsloth GGUF für ein bestimmtes Modell wie Qwen 3.8 27B als Beispiel). Ich lasse es lieber langsam laufen, aber ich habe das Vertrauen, dass es die Dinge genauer macht.

  4. a11r

    Selbst eine 4-Bit-Quantisierung von Qwen3.8 27b ist in unseren internen Tests nicht von Gemini 3.7 Flash zu unterscheiden. Mit einer RTX5090-Karte und ninfer erreichst du etwa 800 TPS Token-Generierung (c=8) und etwa 140 Tokens pro Sekunde im Einzelstream.

  5. heywoods

    Ich lasse Qwen3.8 aggressive uncensored Q4_K_P auf einer 4090 in einer Schleife gegen die 2026 CrackMe CTF-Herausforderungen laufen.

    Mit oh-my-pi in einer vorgebauten Umgebung, die ich von Qwen habe bauen lassen.

    Codex würde sich die Dateien nicht einmal ansehen – buchstäblich, sobald es etwas mit CTF las, hat es abgeschaltet. Es bot nicht einmal an, auf ein dümmeres Modell zurückzugreifen.

Mehr von diesem Tag

2026-08-22