Apple SiliconのmacOS VMでLLM推論が最大16倍高速化、Metal機能を解放する研究結果

Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp

Apple SiliconのmacOS VMでLLM推論が最大16倍高速化、Metal機能を解放する研究結果

Cuaは、AppleのVirtualization.framework上で動作するmacOS VM内で、Metalの新しい高速パスを有効にするプロセススコープの互換レイヤーを公開した。この研究リリースにより、M1 Ultra上でTinyLlama 1.1Bのプロンプト処理が11.08倍、トークン生成が16.36倍高速化し、Gemma 4 12Bでもそれぞれ7.20倍、14.54倍の高速化を達成。GPUパススルーなしで、ほぼベアメタル並みの性能を実現する。

ゲストの控えめな回答は、驚くほど高性能なGPUパスを隠していた。テスト機では、2つの狭い範囲の機能変更により、TinyLlamaのプロンプト処理が毎秒432トークンから4,787トークンに向上した。

同じ日のその他の記事

2026-08-11