Qwen3.8-Flash-Next:架构革新,成本骤降
Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency

Qwen3.8-Flash-Next 正式发布,作为 Qwen4 架构的早期预览,它通过 Gated DeltaNet 与 Qwen Sparse Attention 的混合设计,在保持 125B 参数规模的同时,仅激活 6B 参数。该模型在训练成本上相比 Qwen3.7-Plus 降低了约 9 倍,却在编程和办公任务中展现出更强的能力。原生支持 262K 上下文,并可扩展至 100 万 token。从 Gated Residual 到 N-gram Embedding,四大维度的升级让其在 DeepSWE 和 CoWorkBench 等基准测试中表现优异,真正实现了向极致成本效率的迈进。
GDN 高效地“记住”历史,而 QSA 则精准地“检索”信息。