Apple Silicon macOS VM에서 llama.cpp LLM 추론 11~16배 가속화

Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp

Apple Silicon macOS VM에서 llama.cpp LLM 추론 11~16배 가속화

Cua가 Apple Virtualization.framework 기반 macOS VM에서 Metal GPU 성능을 끌어올리는 프로세스 범위 호환 레이어를 공개했다. M1 Ultra에서 TinyLlama 1.1B 프롬프트 처리 11.08배, 토큰 생성 16.36배, Gemma 4 12B는 각각 7.20배, 14.54배 빨라졌다. VM의 가상 GPU가 보고하는 능력치를 조정해 최신 Metal 경로를 활성화하는 방식으로, 물리 GPU 패스스루 없이 순수 소프트웨어만으로 구현했다.

게스트의 보수적인 답변은 놀라울 정도로 강력한 GPU 경로를 숨기고 있었다.

같은 날의 다른 소식

2026-08-11