Qwen3.8 27B lokal auf dem Mac Studio: echte Zahlen
Run Qwen3.8 27B locally: real numbers from my Mac Studio

Zehn Tage lang lief Qwen3.8 27B als Hintergrundassistent auf einem Mac Studio M3 Ultra. Der Autor hat das Modell mit fünf zeitgesteuerten Läufen pro Modell benchmarkt und mit dem Vorgänger qwen3.6 verglichen. Überraschung: Die neue Version generiert nur halb so schnell (14 vs. 28,6 Tokens pro Sekunde), braucht aber nur ein Drittel der Tokens pro Antwort – unterm Strich ein Patt. Dazu ein 1-Bit-Experiment: Das Quant läuft flott und liefert Fakten korrekt, scheitert aber an Entscheidungen. Der Beitrag nennt konkrete RAM-Anforderungen pro Quant und zeigt, wie man das Modell mit Ollama oder llama.cpp startet – inklusive der aktuellen Runtime-Pflicht.
Quantization doesn’t degrade a model evenly. Facts survive, decisiveness dies.
- Youden
Ich habe darüber nachgedacht, mir ein System zu kaufen, um LLMs lokal auszuführen, aber der Preis für eines, das Qwen3.8-27B gut ausführt, ist zumindest ziemlich abschreckend. Was ich mir stattdessen angeschaut habe, sind Inferenz-Anbieter, die TEE und E2EE nutzen, um kryptografische Garantien zu bieten, dass meine Prompts und Antworten nur für mich und die GPU selbst sichtbar sind. Trotz ihrer Dokumentation und Zusicherungen darüber, was ihre Garantien bedeuten, fällt es mir schwer, an einen Punkt zu gelangen, an dem ich mich tatsächlich wohl dabei fühle, ihnen Geheimnisse anzuvertrauen. Phala zum Beispiel scheint nur bis zum Gateway E2EE zu sein und leitet die Prompts dann an (möglicherweise Drittanbieter-)Provider weiter. Hat jemand diesen Weg schon beschritten und einen Anbieter gefunden, bei dem er sich sicher fühlt?
- Infernal
Ich bin wirklich überrascht, dass du bei 3.8 die halbe Generierungsleistung von 3.6 bei gleicher Parametergröße und Quantisierung siehst (und auch die gleiche Prefill-Leistung) – gibt es da nur irgendwo im Stack eine Optimierung für 3.6, die für 3.8 noch nicht gelandet ist? Mich würde interessieren, ob andere auch von dieser offensichtlichen Diskrepanz überrascht sind oder eine plausible Erklärung haben.
- Atreiden
Ich habe dasselbe Verhalten. Ich habe 4-8-Bit-Quants ausprobiert und bekomme 14-17 tok/s, mit einem Lauf, der 19 erreichte. Ich warte gespannt auf dflash2-Unterstützung in Unsloth oder LM Studio, da das angeblich den Durchsatz auf etwa 30 tok/s erhöhen sollte, was die Grundlinie für das ist, was ich als zumindest einigermaßen interaktiv betrachte. Ich bin neidisch auf die Leute mit 5090ern, die ninfer ausführen und >100 tok/s bekommen. Bei diesen Geschwindigkeiten ist es meiner Meinung nach ein echter Ersatz für die Spitzenklasse.
- rbanffy
Es ist ziemlich beeindruckend, wie der Mac hier in Irland am Ende günstiger ist als die Strix-Halo-Boxen. Ein 128-GB-Mac-Studio mit M5 Max (das Ultra kann nur 96 oder 256 GB haben) kostet immer noch weniger als der "GMKtec EVO-X2" oder der Nvidia DGX Spark mit ähnlicher Leistung. Ist das in den USA auch so?
- pwython
Ja, Qwen3.8 war auf meinem 64-GB-M4-Max auch nicht angenehm zu nutzen (aber besser als diese Zahlen), also ist mein neuer täglicher Begleiter Ornith-1.5-35B-A3B-MLX-4bit. Ich empfehle, das auszuprobieren, wenn du ähnliche Hardware hast, es ist definitiv besser als Qwen3.6 35b-a3b, das vorher mein Favorit war. https://huggingface.co/ornith-ai/Ornith-1.5-35B-A3B