Ferrox: un motor de inferencia en Rust que iguala a llama.cpp en Metal

Building a Rust Inference Engine That Matches Llama.cpp

Ferrox es un motor de inferencia escrito desde cero en Rust para ejecutar LLMs locales, compatible con GGUF y con backends para CPU, Metal y CUDA. Su autor, Antonello F, buscaba entender la inferencia a fondo y demostrar el rendimiento con datos verificables. En una Apple M2 Pro, Ferrox alcanza la paridad con llama.cpp en Llama-3.1-8B (28.3 vs 27.6 tok/s) y supera a llama.cpp en modelos pequeños como Qwen2.5-0.5B (196 vs 133 tok/s) y SmolLM2-135M (290 vs 241 tok/s), aunque aún va por detrás en MoE como OLMoE (88 vs 157 tok/s). El motor incluye un CLI compatible con llama.cpp y un servidor compatible con la API de OpenAI, todo en un binario estático sin dependencias externas.

Ese es el momento en que el motor dejó de sentirse como un ejercicio académico.

Más de este día

2026-08-08