Apple SiliconのmacOS VMでLLM推論が最大16倍高速化、Metal機能を解放する研究結果

Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp

Apple SiliconのmacOS VMでLLM推論が最大16倍高速化、Metal機能を解放する研究結果

Cuaは、AppleのVirtualization.framework上で動作するmacOS VM内で、Metalの新しい高速パスを有効にするプロセススコープの互換レイヤーを公開した。この研究リリースにより、M1 Ultra上でTinyLlama 1.1Bのプロンプト処理が11.08倍、トークン生成が16.36倍高速化し、Gemma 4 12Bでもそれぞれ7.20倍、14.54倍の高速化を達成。GPUパススルーなしで、ほぼベアメタル並みの性能を実現する。

ゲストの控えめな回答は、驚くほど高性能なGPUパスを隠していた。テスト機では、2つの狭い範囲の機能変更により、TinyLlamaのプロンプト処理が毎秒432トークンから4,787トークンに向上した。
  1. simonw

    私の見るところでは、これは皆のllama.cppを高速化するわけではなく、この特定の種類のVirtualization.framework VMで実行しているユーザーだけに効果があるようです。この修正は、VMがllama.cppに間違ったカーネルを選択させていた問題を回避するものです。

  2. engzaanin

    それは理にかなっています。タイトルは当初、Apple Silicon上のllama.cppの一般的な高速化のように聞こえましたが、もし改善がVirtualization.framework VM内のカーネル選択の修正によるものであれば、その区別は非常に重要です。

  3. thehamkercat

    > 同じストックVMでの同じワークロードよりも11.08倍速く、生成トークンは16.36倍速くなりました。

    つまり、これが比較対象だったわけですが、私にとってタイトルは少し紛らわしかったです。

  4. aeriose

    私が理解できないのは、この記事が触れていない点ですが、なぜAppleのVirtualization.frameworkは、ホストGPUがサポートするすべての機能を報告する代わりに、より低いMetalプロファイルを公開するのでしょうか?

  5. azinman2

    Apple 1から9が何を指すのか理解できません。最初はMシリーズチップかと思いましたが、M9は(まだ)存在しません。

この日のほかの記事

2026-08-11