Qwen3.8-Flash-Next: Neue Architektur senkt Trainingskosten auf ein Neuntel

Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency

Qwen3.8-Flash-Next: Neue Architektur senkt Trainingskosten auf ein Neuntel

Qwen3.8-Flash-Next ist ein multimodales MoE-Modell mit 125B Parametern (6B aktiv), das als Vorschau auf die Qwen4-Architektur dient. Es kombiniert Gated DeltaNet mit Qwen Sparse Attention (QSA), Gated Residual, N-gram Embedding und den Muon-Optimierer. Dadurch sinkt der Trainingsaufwand auf etwa ein Neuntel im Vergleich zu Qwen3.7-Plus, bei überlegener Leistung in Coding- und Office-Aufgaben. Das Modell unterstützt nativ 262.144 Token Kontext, erweiterbar auf 1M mit YaRN. Die Gewichte sind auf Hugging Face und ModelScope verfügbar; die Produktionsversion Qwen3.8-Flash kostet 0,16 USD pro Million Input-Tokens.

Einfach ausgedrückt: GDN „erinnert“ effizient, während QSA präzise „abruft“.

Mehr von diesem Tag

2026-08-26