Mac Studio实测Qwen3.8 27B:本地部署真数据
Run Qwen3.8 27B locally: real numbers from my Mac Studio

我在Mac Studio M3 Ultra上实测了Qwen3.8 27B,它已作为后台助手运行10天,处理RSS摘要和PDF整理。虽然Qwen3.8的生成速度(14 tokens/s)仅为前代Qwen3.6的一半,但它用更少的token完成回答,实际耗时反而更短。1-bit量化版虽快却缺乏决断力,适合 trivia 问答但不适合代理任务。文章详细对比了不同量化版本对内存的需求,并指出Ollama和llama.cpp需更新至最新内核才能支持该模型。本地部署的核心价值在于隐私与自动化,而非单纯的速度比拼。
量化不会均匀地降低模型能力:事实记忆得以保留,但决断力却会消失。
HN 评论区
75- Youden
我一直在考虑买一套系统来本地运行大语言模型,但能流畅运行 Qwen3.8-27B 的机器价格实在让人望而却步。
所以我转而关注那些利用 TEE 和 E2EE 提供加密保证的推理服务提供商,确保我的提示词和回复只有我和 GPU 本身可见。
尽管他们的文档和关于这些保证含义的声明很充分,但我还是很难真正放心地把机密数据交给他们。例如 Phala 似乎只做到到网关的端到端加密,随后会将提示词转发给(可能是第三方的)提供商。
有没有人走过这条路,找到了值得信任的服务商?
- Atreiden
我也遇到了同样的情况。我试过 4-8bit 量化,速度在 14-17 tok/s 之间,有一次跑到了 19。我正热切等待 Unsloth 或 LM Studio 支持 dflash2,据说那样吞吐量能提升到 30 tok/s 左右,这算是我心目中勉强能算“有点交互感”的基准线了。
真羡慕那些用 5090 跑 ninfer 能达到 >100 tok/s 的大佬。在那种速度下,在我看来它才是真正的生产力替代方案。
- Infernal
我很惊讶,在参数量相同、量化方案相同(甚至预填充性能也一样)的情况下,3.8 版本的生成性能只有 3.6 的一半——难道 3.6 的某个优化还没在 3.8 里落地吗?
好奇其他人是否也对这种明显的差异感到惊讶,或者有没有现成的解释。
- rbanffy
Mac 最终比 Strix Halo 盒子更便宜,这点真的很令人印象深刻,至少在我所在的爱尔兰是这样。一台搭载 M5 Max 的 128GB Mac Studio(Ultra 版本只能选 96GB 或 256GB)的价格,仍然低于性能相似的 GMKtec EVO-X2 或 Nvidia DGX Spark。美国的情况也一样吗?
- pwython
没错,Qwen3.8 在我的 64GB M4 Max 上体验也不怎么样(不过比帖子里的数据要好一些),所以我现在的日常主力模型换成了 Ornith-1.5-35B-A3B-MLX-4bit。如果你也是类似的硬件配置,推荐试试这个,它肯定比我之前常用的 Qwen3.6 35b-a3b 要好。