Apple Silicon y VMs macOS: inferencia LLM 11-16× más rápida con llama.cpp
Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp

Un nuevo shim de capacidades Metal, de ámbito de proceso, desbloquea rutas de GPU más rápidas dentro de las VMs macOS basadas en Virtualization.framework. En un M1 Ultra, TinyLlama 1.1B procesa prompts 11.08× más rápido y genera tokens 16.36× más rápido que en una VM estándar, acercándose al rendimiento en metal desnudo. Con Gemma 4 12B, el procesamiento de prompts alcanza el 99.59% de la velocidad nativa. El equipo de Cua publica el código y los resultados para que la comunidad los reproduzca y amplíe.
Las respuestas conservadoras del invitado ocultaban una ruta de GPU sorprendentemente capaz.