llama.cppに並ぶRust製推論エンジン「Ferrox」、Metalで逆転も

Building a Rust Inference Engine That Matches Llama.cpp

Rust製の推論エンジン「Ferrox」が、llama.cppと同等以上の性能を達成。GGUF形式のモデルを読み込み、CPU・Apple Metal・CUDA上で動作する。llama.cppのバイナリに頼らず、すべてのカーネルをゼロから実装。ベンチマークでは、Apple M2 Pro上でLlama-3.1-8Bがllama.cppとほぼ同等、Qwen2.5-0.5Bでは約1.5倍高速化を記録。MoEモデルにも対応し、OpenAI互換のAPIサーバーも備える。

Llama-3.1-8B on Metal is now ~0.97× — Ferrox slightly ahead of llama.cpp on the same host and GGUF.

同じ日のその他の記事

2026-08-08