Ferrox: Wie ein Rust-Inferenz-Engine llama.cpp auf Apple Metal überholt
Building a Rust Inference Engine That Matches Llama.cpp
Ferrox ist eine reine Rust-Inferenz-Engine für lokale LLMs, die GGUF-Dateien lädt und auf CPU, Apple Metal oder CUDA läuft – ohne Bindungen an llama.cpp oder ggml. Entwickler Antonello F. hat alle Kernel und Loader von Grund auf neu geschrieben, um Inferenz wirklich zu verstehen. Auf einem Apple M2 Pro erreicht Ferrox bei Llama-3.1-8B Q4_K_M auf Metal 28,3 tok/s gegenüber 27,6 tok/s von llama.cpp – also leichte Überlegenheit. Bei kleineren Modellen wie Qwen2.5-0.5B ist Ferrox sogar deutlich schneller (196,1 vs. 132,8 tok/s). Die Gewinne stammen aus fusionierter Dequantisierung und architekturspezifischen Metal-Kernels. Ferrox bietet eine CLI und einen OpenAI-kompatiblen Server.
Der Nordstern-Pin ist der, der mir am wichtigsten ist: Llama-3.1-8B auf Metal ist jetzt bei ~0,97× – Ferrox liegt auf demselben Host und GGUF leicht vor llama.cpp (28,27 vs. 27,55 pred).