Apple SiliconのmacOS VMでLLM推論が最大16倍高速化、Metal機能を解放する研究結果
Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp

Cuaは、AppleのVirtualization.framework上で動作するmacOS VM内で、Metalの新しい高速パスを有効にするプロセススコープの互換レイヤーを公開した。この研究リリースにより、M1 Ultra上でTinyLlama 1.1Bのプロンプト処理が11.08倍、トークン生成が16.36倍高速化し、Gemma 4 12Bでもそれぞれ7.20倍、14.54倍の高速化を達成。GPUパススルーなしで、ほぼベアメタル並みの性能を実現する。
ゲストの控えめな回答は、驚くほど高性能なGPUパスを隠していた。テスト機では、2つの狭い範囲の機能変更により、TinyLlamaのプロンプト処理が毎秒432トークンから4,787トークンに向上した。
HNでの議論
41- simonw
私の見るところでは、これは皆のllama.cppを高速化するわけではなく、この特定の種類のVirtualization.framework VMで実行しているユーザーだけに効果があるようです。この修正は、VMがllama.cppに間違ったカーネルを選択させていた問題を回避するものです。
- engzaanin
それは理にかなっています。タイトルは当初、Apple Silicon上のllama.cppの一般的な高速化のように聞こえましたが、もし改善がVirtualization.framework VM内のカーネル選択の修正によるものであれば、その区別は非常に重要です。
- thehamkercat
> 同じストックVMでの同じワークロードよりも11.08倍速く、生成トークンは16.36倍速くなりました。
つまり、これが比較対象だったわけですが、私にとってタイトルは少し紛らわしかったです。
- aeriose
私が理解できないのは、この記事が触れていない点ですが、なぜAppleのVirtualization.frameworkは、ホストGPUがサポートするすべての機能を報告する代わりに、より低いMetalプロファイルを公開するのでしょうか?
- azinman2
Apple 1から9が何を指すのか理解できません。最初はMシリーズチップかと思いましたが、M9は(まだ)存在しません。