llama.cpp ускорил prompt lookup drafting в 42 раза
Faster prompt lookup drafting in llama.cpp

Хайдер Тирмази оптимизировал prompt lookup decoding в llama.cpp, ускорив драфтинг до 42 раз и сократив память до 2.6 раз. В основе — устранение копирования вложенных std::unordered_map, замена внешней карты на ankerl::unordered_dense::segmented_map и внутренней на отсортированный вектор. При корпусе 541 МБ задержка драфтинга упала с 165.48 µs до 3.98 µs.
Я сделал драфтинг для prompt lookup decoding в llama.cpp до 42 раз быстрее, используя до 2.6 раз меньше памяти, благодаря набору простых оптимизаций производительности, в значительной степени основанных на работе Daniel Lemire и Martin Ankerl.