llama.cpp acelera el drafting de prompt lookup hasta 42 veces
Faster prompt lookup drafting in llama.cpp

El ingeniero Hayder Tirmazi optimizó el drafting de prompt lookup en llama.cpp con cuatro cambios simples: eliminar copias innecesarias de mapas, reemplazar el mapa externo por ankerl::unordered_dense, usar vectores ordenados en el mapa interno y aprovechar la distribución de seguidores. El resultado: hasta 42x menos latencia por token y 2.6x menos memoria, sin alterar la tasa de aceptación. Las pruebas usan WikiText-103 y un Apple M4 Pro.
Este es casi más una corrección de errores que una optimización. Descubrí que los mapas internos se copiaban innecesariamente en múltiples lugares en cada paso de drafting.