DFlash 2:让推理吞吐量再提 20%

DFlash 2: Keep Drafting Parallel

DFlash 2:让推理吞吐量再提 20%

在 Agent 时代,推理成本已成为核心瓶颈。Inco AI 推出的 DFlash 2 将并行草稿技术推向新高度,在仅增加 1% 延迟的情况下,让每次验证通过的 token 数量提升超过 20%。通过引入轻量级路径选择器,DFlash 2 解决了并行预测中的连贯性问题,并针对性地修复了序列末端的精度衰减。目前,该技术已集成至 SGLang、vLLM 和 llama.cpp 等主流引擎,在 Qwen3.8-27B 等模型上实现了 2.7 至 3.4 倍的吞吐量提升,为未来的 token 经济构建了更高效的推理基础设施。

选择比预测更便宜,而且我们仍有提升空间。
  1. ilc

    仔细看看视频。DFlash2 的工具调用在 Python 语法上失败了。

    通常这类模型都能一次性搞定这种问题,而对方确实做到了。

    我不清楚原因。也许没什么大不了的。但我希望能看到模型在路径约束更严格一些的场景下运行,以便排除这类怪事。

  2. hypfer

    技术太牛了

    > 一个 Agent 花一下午就能写出聊天机器人花一个月才能写出的东西

    但你能不能……别这么干。

    你的技术已经足够出色,无需多言。别把它搞砸了。

  3. adefa

    我在 DGX Spark 上使用 vLLM + Qwen 3.8 27b nvfp4 + DFlash 2,解码速度大约在每秒 27 个 token。

同日更多故事

2026-08-19