Qwen 3.8-Flash-Next 明日发布

Qwen 3.8-Flash-Next releasing tomorrow (125B a6B)

Qwen 3.8-Flash-Next 明日发布

基于下一代 Qwen4 架构构建的 Qwen 3.8-Flash-Next 多模态 MoE 模型即将登场。作为 Qwen4 模型家族发布前的技术预览,这款模型将提前向社区展示最新的架构突破。预计将于 2026 年 8 月 26 日 15:00(UTC+00:00)在 ModelScope 魔搭社区正式开源,届时将提供 Qwen/Qwen3.8-Flash-Next 及其 FP8 量化版本。开发者可立即关注并开启通知,以便第一时间获取模型访问权限,提前为即将到来的 Qwen4 系列做好准备。

我们提前发布这些架构进展,旨在帮助社区为即将推出的 Qwen4 模型家族做好准备。
  1. SwellJoe

    终于有个理由入手 128GB Strix Halo 或 GB10 设备了。或者,这也是考虑新款 Mac Studio 的理由。

    我台式机里有一块 Strix Halo 和两块 32GB 的 GPU,后者在运行本地模型时几乎总是表现更好,因为显存带宽更高,速度也快不少。目前还没有任何模型能超越 Qwen 27B 或 Gemma 31B,而这两者在 64GB 显存下配合大上下文运行得非常从容。

    而且,MoE 架构应该能让它跑出接近可用的速度。

  2. ddtaylor

    我很喜欢 Qwen 系列模型,但基于它们用 OpenRouter 构建应用的过程很痛苦。

    OpenRouter 做了很多很棒的工作,我也很享受能如此便捷地使用不同模型。当某个提供商逐步淘汰旧模型,而该模型仍能满足我的需求且价格大幅降低时,我觉得这是双赢。

    然而问题在于,许多 Qwen 模型的容量几乎为零,或者极其不稳定,你简直不得不在代码里到处堆砌供应商的黑白名单。OpenRouter 尝试过解决这个问题,但效果不佳。事实上,OpenRouter 有很多文档里写得挺酷的功能,但如果你去看代码,会发现它们要么还没实现,要么压根就不存在,这很可惜。

    我曾试图联系 OpenRouter 沟通此事,过去也有意与他们合作,但很难找到对的人,而且他们扩张得太快了。我预计被 Stripe 收购会在某些方面加剧这些问题。毫无疑问,他们最终会解决所有这些问题,毕竟以如此快的速度实现如此大规模的扩展真的很难,值得称赞,但这条路走得相当磕绊,也浇灭了我不少热情。

  3. notnullorvoid

    看看这个模型与 FreeToken 这类推理引擎的结合会很有趣,后者能优化 MoE 模型在 CPU/RAM 和 GPU/VRAM 之间的任务分布。

    如果运行一个有竞争力的本地模型只需一张二手 3090 和一点 DDR4 内存就能达到不错的速度,那我们可能就要迎来“本地 AI 元年”了。

    https://github.com/FlashML-org/FreeToken

  4. fcanesin

    HF 链接:https://huggingface.co/Qwen/Qwen3.8-Flash-Next

  5. syntaxing

    非常期待这个发布,27B 在 Strix Halo 上跑起来很吃力,而 Laguna 2.1 在处理工具调用时经常干出一些蠢事。

  6. big-chungus4

    > 我们提前发布这些架构改进,以便社区为即将推出的 Qwen4 完整系列模型做好准备。

    这让我有理由相信,“完整系列”可能包含像 4B 这样的小模型。

  7. pwython

    我本来就在盘算要不要上一台 128GB M5 Max 的 MBP。现在看到这个!

    4-bit MLX 量化配合 128k 上下文窗口应该能完美适配,速度大概在 50-70 tok/s 之间。

  8. Catloafdev

    非常好奇这个模型和 Deepseek v4 Flash 相比会怎样。我敢打赌,如果它更差,他们就不会发布了。

同日更多故事

2026-08-25