DFlash 2: 20 % mehr Tokens pro Verifikationsdurchlauf – ohne Zusatzkosten
DFlash 2: Keep Drafting Parallel

Inco AI stellt DFlash 2 vor, eine Weiterentwicklung des spekulativen Decodierers DFlash. DFlash 2 wählt aus den Kandidaten des Drafters einen kohärenten Pfad aus und erzielt so über 20 % mehr Ausgabe pro Verifikationsdurchlauf bei nur 1 % zusätzlicher Latenz. Die Ausgabe bleibt nachweislich unverändert. In Benchmarks verbessert sich die Akzeptanzlänge um 16–25 %. Mit dem neuen Drafter für Qwen3.8-27B erreicht SGLang den 2,7- bis 3,4-fachen Durchsatz im Vergleich zu autoregressivem Decoding bei Batch-Größe 1. Zudem führt DFlash 2 eine gezielte Lösung für den Suffix-Verfall ein, bei der ein leichtes Modul die Abhängigkeiten innerhalb des Blocks übernimmt.
Wählen ist billiger als Vorhersagen.