Ferrox:用 Rust 打造媲美 llama.cpp 的推理引擎

Building a Rust Inference Engine That Matches Llama.cpp

我最近花了几天时间构建了 Ferrox,这是一个纯 Rust 编写的本地 LLM 推理引擎,支持 CPU、Apple Metal 和 CUDA,无需依赖 llama.cpp 或 ggml。从内核到调度器,所有代码都是从头手写。我这么做的原因很简单:我想深入理解推理的底层细节,而不是仅仅运行二进制文件,并且希望每一个性能声明都能在与 llama.cpp 的实测对比中经得起推敲。Ferrox 加载 GGUF 文件,提供 CLI 和兼容 OpenAI API 的服务器模式。在 Apple M2 Pro 上,Ferrox 在 Llama-3.1-8B 模型上的表现甚至略优于 llama.cpp,证明了其架构优化的有效性。

我不希望只是断言性能,而是希望每一个性能声明都能在与真实、知名基准的对比中赢得认可。
  1. ubedan

    太棒了……看到 llama.cpp 有了 Rust 版本,我真的很开心。

    它的真正价值将在广泛使用和 PR 合并的过程中随时间得到验证。

    你们打算推动它与 llama.cpp 保持功能对等,还是愿意通过引入新功能(如 NVME/SSD MoE 权重流式加载等)来走差异化路线?

  2. noman-land

    到了这个阶段,所有靠“氛围感”写出来的项目都成了攻击面,应该避开。

    用传统手段根本无法轻易分辨它们是出于好奇的业余爱好者所为,还是恶意行为。

  3. rvz

    这个项目存在的唯一原因:

    它是“用 Rust™ 写的”(多亏了 Claude)

同日更多故事

2026-08-08