Ferrox: un motor de inferencia en Rust que iguala a llama.cpp en Metal
Building a Rust Inference Engine That Matches Llama.cpp
Ferrox es un motor de inferencia escrito desde cero en Rust para ejecutar LLMs locales, compatible con GGUF y con backends para CPU, Metal y CUDA. Su autor, Antonello F, buscaba entender la inferencia a fondo y demostrar el rendimiento con datos verificables. En una Apple M2 Pro, Ferrox alcanza la paridad con llama.cpp en Llama-3.1-8B (28.3 vs 27.6 tok/s) y supera a llama.cpp en modelos pequeños como Qwen2.5-0.5B (196 vs 133 tok/s) y SmolLM2-135M (290 vs 241 tok/s), aunque aún va por detrás en MoE como OLMoE (88 vs 157 tok/s). El motor incluye un CLI compatible con llama.cpp y un servidor compatible con la API de OpenAI, todo en un binario estático sin dependencias externas.
Ese es el momento en que el motor dejó de sentirse como un ejercicio académico.