Warum Ihr lokales LLM dümmer wirkt, als es ist

Why your local LLM feels dumber than it is

Warum Ihr lokales LLM dümmer wirkt, als es ist

Ein technischer Deep Dive zeigt, warum lokale LLMs oft schlechter abschneiden als erwartet: Die Wahl des Attention-Backends, KV-Cache-Quantisierung und Gewichtsquantisierung führen zu messbaren Abweichungen bei den Logits. In Tests mit Qwen3.6-27B auf einer RTX PRO 6000 verursachten verschiedene Backends Token-Flips, und eine quantisierte KV-Cache führte zu Fehlern bei Tool-Aufrufen. Die Ergebnisse unterstreichen, dass die Implementierung die Modellqualität erheblich beeinflusst.

Jede einzelne Hardware- und Software-Instanz, die heute ein LLM ausführt, ist ein wenig anders – oder in manchen Fällen sogar sehr unterschiedlich.

Mehr von diesem Tag

2026-08-22