Gemma 4 26B corre a 5 tokens por segundo en un Xeon de 13 años sin GPU
Running Gemma 4 26B at 5 tokens/sec on a 13-year-old Xeon with no GPU

Un servidor HP StoreVirtual reutilizado, con dos Xeon E5-2690 v2 (Ivy Bridge, 2013) y sin GPU, ejecuta Gemma 4 26B-A4B (MoE) a unos 5 tokens por segundo. El autor detalla cómo hizo funcionar el modelo en hardware que carece de AVX2, superando fallos de compilación y un bug silencioso en el despachador de operaciones que producía salida corrupta. El parche está disponible en un PR de ik_llama.cpp. El artículo también reflexiona sobre la verdadera habilidad en IA: saber dirigir un modelo y verificar sus respuestas, en lugar de limitarse a pagar por suscripciones.
El síntoma era una jerga multilingüe fluida: los tokens se distribuían uniformemente en el vocabulario de 262K, y el modelo era igual de propenso a emitir tailandés, coreano, centinelas `<unused>` o fragmentos en inglés.