Qwen 3.8-Flash-Next: 125B-Modell mit 6B aktiven Parametern erscheint morgen

Qwen 3.8-Flash-Next releasing tomorrow (125B a6B)

Qwen 3.8-Flash-Next: 125B-Modell mit 6B aktiven Parametern erscheint morgen

Qwen kündigt die Veröffentlichung von Qwen3.8-Flash-Next an, einem multimodalen MoE-Modell, das auf der nächsten Generation der Qwen4-Architektur basiert. Das Modell hat 125B Parameter, von denen nur 6B aktiv sind. Die Veröffentlichung ist für den 26. August 2026 um 15:00 UTC geplant. Die Community kann sich auf der ModelScope-Seite benachrichtigen lassen, um sofortigen Zugriff zu erhalten. Zusätzlich wird eine FP8-Variante angeboten.

Qwen3.8-Flash-Next ist ein multimodales MoE-Modell, das auf der nächsten Generation der Qwen4-Architektur basiert.
  1. SwellJoe

    Endlich ein Grund, ein 128GB Strix Halo oder GB10 Gerät zu besitzen. Oder ein Grund, über das neue Mac Studio nachzudenken.

    Ich habe ein Strix Halo und duale 32GB GPUs in meinem Desktop, und letzteres ist für lokale Modelle fast immer besser, weil es deutlich schneller ist dank höherer Speicherbandbreite. Es gab einfach keine Modelle, die besser sind als Qwen 27B oder Gemma 31B, die bequem in 64GB mit großem Kontext laufen.

    Und MoE sollte es nahezu brauchbar schnell machen.

  2. ddtaylor

    Ich mag die Qwen-Modelle sehr, aber darauf mit OpenRouter aufzubauen war schmerzhaft.

    OpenRouter leistet großartige Arbeit und ich genieße es wirklich, verschiedene Modelle so einfach nutzen zu können. Ich mag es, wenn ein Anbieter ein älteres Modell auslaufen lässt, das immer noch für meine Bedürfnisse funktioniert und der Preis viel niedriger ist. Das scheint so ein Win-Win zu sein.

    Das Problem ist jedoch, dass viele Qwen-Modelle fast keine Kapazität haben oder so unzuverlässig sind, dass man buchstäblich seinen Code mit einer Blacklist/Whitelist von Anbietern übersäen muss. OpenRouter hat einige Versuche, das zu lösen, aber sie funktionieren nicht. Tatsächlich hat OpenRouter viele wirklich coole Dinge, die dokumentiert sind, aber wenn man den Code liest, sind sie noch nicht implementiert oder tatsächlich noch nicht da, was schade ist.

    Ich habe versucht, sie bei OpenRouter zu kontaktieren, und ich war in der Vergangenheit daran interessiert, mit ihnen zu arbeiten, aber es ist schwierig, die richtigen Leute zu erreichen, und sie wachsen sehr schnell. Ich erwarte, dass die Übernahme durch Stripe diese Probleme in gewisser Weise beschleunigen wird. Ich habe keinen Zweifel, dass sie alle diese Probleme irgendwann lösen werden, und so schnell so viel zu skalieren ist wirklich schwer, also Hut ab, aber der Weg war ziemlich lahm und hat mir etwas den Wind aus den Segeln genommen.

  3. notnullorvoid

    Es wird interessant sein, die Überschneidung mit Inferenz-Engines wie FreeToken zu sehen, die die Verteilung der Arbeit für MoE-Modelle auf CPU/RAM und GPU/VRAM verbessern.

    Wenn alles, was es braucht, damit ein wettbewerbsfähiges Modell lokal mit guten Geschwindigkeiten läuft, eine gebrauchte 3090 und etwas DDR4 ist, dann könnten wir das Jahr der lokalen KI haben.

    https://github.com/FlashML-org/FreeToken

  4. fcanesin

    HF-Link: https://huggingface.co/Qwen/Qwen3.8-Flash-Next

  5. syntaxing

    Ich freue mich wirklich darauf, 27B ist eine Herausforderung mit einem Strix Halo und Laguna 2.1 kann dumme Dinge für Tooling-Aufrufe tun.

  6. vegnus

    Ich habe ein m1 max 64gb MacBook. Gibt es etwas, das ich tun kann, um 3.8 27b mit mehr als 10 tok/s zu bekommen, oder bin ich abgeschrieben? 3.6 a3b ist gut, aber nicht so gut.

  7. big-chungus4

    > Wir veröffentlichen diese architektonischen Verbesserungen im Voraus, damit die Community sich auf die kommende vollständige Familie der Qwen4-Modelle vorbereiten kann.

    Das gibt mir Hoffnung, dass "vollständige Familie" bedeutet, dass sie auch kleinere Modelle wie 4B enthalten wird.

  8. Catloafdev

    Ich bin sehr gespannt, wie das im Vergleich zu Deepseek v4 Flash abschneidet. Ich muss annehmen, dass sie das nicht veröffentlichen würden, wenn es schlechter wäre.

Mehr von diesem Tag

2026-08-25