DFlash 2:並列ドラフトで推論をさらに高速化、検証1回あたりの出力が20%以上増加

DFlash 2: Keep Drafting Parallel

DFlash 2:並列ドラフトで推論をさらに高速化、検証1回あたりの出力が20%以上増加

Inco AIがDFlash 2を発表。DFlashは投機的デコードで並列ドラフトを実現し、NVIDIA Blackwellで最大15倍、Google TPUで3倍のスループット向上を達成。DFlash 2はパス選択と畳み込みにより、検証パスあたりの出力を20%以上増加させ、遅延は約1%増加のみ。Qwen3.8-27Bドラフターでは、バッチサイズ1で自己回帰デコードの2.7〜3.4倍のスループットを実現。SGLang、vLLM、llama.cpp、oMLXで利用可能。

選択は予測よりも安価である。
  1. ilc

    ビデオを注意深く見てください。DFlash2のツール呼び出しがPythonの構文で失敗しています。通常、このクラスのモデルは、もう一方がやったように、そういったことを一発で成功させます。原因はわかりません。何でもないかもしれません。しかし、モデルがもう少し制約のある経路で何かを行っているところを見て、そのような異常を除外するのに役立てたいと思います。

  2. hypfer

    素晴らしい技術だ。

    > エージェントは、チャットボットが1ヶ月かかることを1日で書く。

    でも、それはやめてくれ。

    あなたの技術はとても優れているので、それ自体が物語っています。それを台無しにしないでください。

  3. adefa

    DGX SparkでvLLM + Qwen 3.8 27b nvfp4 + DFlash 2を使って、デコードで毎秒約27トークンが出ています。

この日のほかの記事

2026-08-19