Apple Silicon: 11–16× schnellere LLM-Inferenz in macOS-VMs mit Llama.cpp

Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp

Apple Silicon: 11–16× schnellere LLM-Inferenz in macOS-VMs mit Llama.cpp

Ein neuer Metal-Kompatibilitäts-Shim von Cua, einem macOS-Virtualisierungs-Stack, entsperrt neuere GPU-Fähigkeiten in macOS-Gästen, die über Apples Virtualization.framework laufen. Auf einem M1 Ultra beschleunigt der Shim die Prompt-Verarbeitung von TinyLlama um das 11-Fache und die Token-Generierung um das 16-Fache im Vergleich zur Standard-VM. Mit Gemma 4 12B erreicht die entsperrte VM 99,6 % der Bare-Metal-Prompt-Geschwindigkeit. Der Shim ist prozessbasiert und ändert nur ausgewählte Metal-Abfragen, wodurch LLM-Inferenz in VMs praktikabel wird.

Die konservativen Antworten des Gasts versteckten einen überraschend leistungsfähigen GPU-Pfad.

Mehr von diesem Tag

2026-08-11