llama.cpp: 42-mal schnelleres Prompt-Lookup-Drafting

Faster prompt lookup drafting in llama.cpp

llama.cpp: 42-mal schnelleres Prompt-Lookup-Drafting

Hayder Tirmazi hat das Drafting für Prompt-Lookup-Decoding in llama.cpp durch einfache Optimierungen um bis zu 42× beschleunigt und den Speicherbedarf um bis zu 2,6× reduziert. Die Änderungen: unnötige Kopien der inneren Maps entfernen, die äußere Map durch ankerl::unordered_dense ersetzen und die inneren Maps als sortierte Vektoren darstellen. Die Latenz pro entworfenem Token sinkt von 165,48 µs auf 3,98 µs bei einem 541 MB großen Korpus.

Ich mache das Drafting für Prompt-Lookup-Decoding in llama.cpp bis zu 42-mal schneller und verwende dabei bis zu 2,6-mal weniger Speicher durch eine Reihe einfacher Leistungsoptimierungen, die größtenteils auf der Arbeit von Daniel Lemire und Martin Ankerl basieren.

Mehr von diesem Tag

2026-09-27