macOS虚拟机LLM推理提速16倍

Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp

macOS虚拟机LLM推理提速16倍

我们利用Apple Silicon和macOS虚拟机,通过一个小型的进程级兼容性层,成功解锁了Metal的更快路径。在M1 Ultra上,使用llama.cpp运行TinyLlama时,提示处理速度提升了11倍,令牌生成速度提升了16倍。对于Gemma 4 12B模型,提示处理速度也提升了7.2倍。这一成果无需修改内核或进行物理GPU直通,仅通过调整虚拟GPU报告的Metal能力参数,就让虚拟机中的LLM推理性能接近裸机水平。

在测试机器上,两个范围狭窄的能力参数调整,将TinyLlama的提示处理速度从每秒432个令牌提升至4787个令牌。

同日更多故事

2026-08-11