macOS虚拟机LLM推理提速16倍
Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp

我们利用Apple Silicon和macOS虚拟机,通过一个小型的进程级兼容性层,成功解锁了Metal的更快路径。在M1 Ultra上,使用llama.cpp运行TinyLlama时,提示处理速度提升了11倍,令牌生成速度提升了16倍。对于Gemma 4 12B模型,提示处理速度也提升了7.2倍。这一成果无需修改内核或进行物理GPU直通,仅通过调整虚拟GPU报告的Metal能力参数,就让虚拟机中的LLM推理性能接近裸机水平。
在测试机器上,两个范围狭窄的能力参数调整,将TinyLlama的提示处理速度从每秒432个令牌提升至4787个令牌。
HN 评论区
43- simonw
在我看来,这并不会让所有人都能加速 llama.cpp,只对运行在特定 Virtualization.framework 虚拟机中的用户有效。
这里的修复方案解决了一个问题:虚拟机导致 llama.cpp 选错了内核。
- engzaanin
这很合理。标题起初听起来像是 Apple Silicon 上通用的 llama.cpp 加速,但如果提升来自修复 Virtualization.framework 虚拟机内部的内核选择问题,那这个区别就很重要了。
- aeriose
我不明白的是,这篇文章也没提,为什么 Apple 的 Virtualization.framework 会暴露一个功能较弱的 Metal 配置文件,而不是报告主机 GPU 支持的所有能力?
- thehamkercat
> 比相同负载在默认虚拟机中快 11.08 倍,生成 token 速度快 16.36 倍。
所以这就是对比方式,对我来说标题有点让人困惑。
- w10-1
相关讨论:有人能推测一下,M5 Pro+ 中的 Neural Accelerators(通过 Metal 4 访问)会不会出现在 M6 基础版处理器中吗?