DFlash 2:让推理吞吐量再提 20%

DFlash 2: Keep Drafting Parallel

DFlash 2:让推理吞吐量再提 20%

在 Agent 时代,推理成本已成为核心瓶颈。Inco AI 推出的 DFlash 2 将并行草稿技术推向新高度,在仅增加 1% 延迟的情况下,让每次验证通过的 token 数量提升超过 20%。通过引入轻量级路径选择器,DFlash 2 解决了并行预测中的连贯性问题,并针对性地修复了序列末端的精度衰减。目前,该技术已集成至 SGLang、vLLM 和 llama.cpp 等主流引擎,在 Qwen3.8-27B 等模型上实现了 2.7 至 3.4 倍的吞吐量提升,为未来的 token 经济构建了更高效的推理基础设施。

选择比预测更便宜,而且我们仍有提升空间。

同日更多故事

2026-08-19