Qwen3.8 27B mit 256K Kontext: 50 Token/s auf einer 24-GB-GPU

Qwen3.8-27B at 256K on a 24GB RTX PRO 4000 SFF (432 GB/s): 50 tok/s with MTP

Qwen3.8 27B mit 256K Kontext: 50 Token/s auf einer 24-GB-GPU

In einem ausführlichen Experiment optimiert der Autor ein lokales Inferenz-Setup mit Qwen3.8 27B auf einer NVIDIA RTX PRO 4000 SFF (24 GB VRAM) für 256K-Kontext und multimodale Eingaben. Durch eine maßgeschneiderte NVFP4-Quantisierung, die sensible Teile des Modells schützt, und eine speziell angepasste llama.cpp-Version mit MTP-Spekulation erreicht er 50,44 Token/s im Produktionsbetrieb. Der Beitrag zeigt, dass nicht einzelne Komponenten, sondern das Zusammenspiel von Quant, Drafter, CUDA-Kernels und Speicherlayout entscheidend ist. So schlägt ein präziserer MTP-Drafter schlechter ab als der native NVFP4, und die beste Leistung erzielt ein Hybrid-Quant mit selektiv geschützten Tensoren.

Der Drafter und das Zielmodell bilden ein einziges quantisiertes System, und ihre Interaktion entscheidet über Akzeptanz und Durchsatz.

Mehr von diesem Tag

2026-08-17