llama.cpp ускорил prompt lookup drafting в 42 раза

Faster prompt lookup drafting in llama.cpp

llama.cpp ускорил prompt lookup drafting в 42 раза

Хайдер Тирмази оптимизировал prompt lookup decoding в llama.cpp, ускорив драфтинг до 42 раз и сократив память до 2.6 раз. В основе — устранение копирования вложенных std::unordered_map, замена внешней карты на ankerl::unordered_dense::segmented_map и внутренней на отсортированный вектор. При корпусе 541 МБ задержка драфтинга упала с 165.48 µs до 3.98 µs.

Я сделал драфтинг для prompt lookup decoding в llama.cpp до 42 раз быстрее, используя до 2.6 раз меньше памяти, благодаря набору простых оптимизаций производительности, в значительной степени основанных на работе Daniel Lemire и Martin Ankerl.

Ещё за этот день

2026-09-27