Mac Studio实测Qwen3.8 27B:本地部署真数据

Run Qwen3.8 27B locally: real numbers from my Mac Studio

Mac Studio实测Qwen3.8 27B:本地部署真数据

我在Mac Studio M3 Ultra上实测了Qwen3.8 27B,它已作为后台助手运行10天,处理RSS摘要和PDF整理。虽然Qwen3.8的生成速度(14 tokens/s)仅为前代Qwen3.6的一半,但它用更少的token完成回答,实际耗时反而更短。1-bit量化版虽快却缺乏决断力,适合 trivia 问答但不适合代理任务。文章详细对比了不同量化版本对内存的需求,并指出Ollama和llama.cpp需更新至最新内核才能支持该模型。本地部署的核心价值在于隐私与自动化,而非单纯的速度比拼。

量化不会均匀地降低模型能力:事实记忆得以保留,但决断力却会消失。
  1. Youden

    我一直在考虑买一套系统来本地运行大语言模型,但能流畅运行 Qwen3.8-27B 的机器价格实在让人望而却步。

    所以我转而关注那些利用 TEE 和 E2EE 提供加密保证的推理服务提供商,确保我的提示词和回复只有我和 GPU 本身可见。

    尽管他们的文档和关于这些保证含义的声明很充分,但我还是很难真正放心地把机密数据交给他们。例如 Phala 似乎只做到到网关的端到端加密,随后会将提示词转发给(可能是第三方的)提供商。

    有没有人走过这条路,找到了值得信任的服务商?

  2. Atreiden

    我也遇到了同样的情况。我试过 4-8bit 量化,速度在 14-17 tok/s 之间,有一次跑到了 19。我正热切等待 Unsloth 或 LM Studio 支持 dflash2,据说那样吞吐量能提升到 30 tok/s 左右,这算是我心目中勉强能算“有点交互感”的基准线了。

    真羡慕那些用 5090 跑 ninfer 能达到 >100 tok/s 的大佬。在那种速度下,在我看来它才是真正的生产力替代方案。

  3. Infernal

    我很惊讶,在参数量相同、量化方案相同(甚至预填充性能也一样)的情况下,3.8 版本的生成性能只有 3.6 的一半——难道 3.6 的某个优化还没在 3.8 里落地吗?

    好奇其他人是否也对这种明显的差异感到惊讶,或者有没有现成的解释。

  4. rbanffy

    Mac 最终比 Strix Halo 盒子更便宜,这点真的很令人印象深刻,至少在我所在的爱尔兰是这样。一台搭载 M5 Max 的 128GB Mac Studio(Ultra 版本只能选 96GB 或 256GB)的价格,仍然低于性能相似的 GMKtec EVO-X2 或 Nvidia DGX Spark。美国的情况也一样吗?

  5. pwython

    没错,Qwen3.8 在我的 64GB M4 Max 上体验也不怎么样(不过比帖子里的数据要好一些),所以我现在的日常主力模型换成了 Ornith-1.5-35B-A3B-MLX-4bit。如果你也是类似的硬件配置,推荐试试这个,它肯定比我之前常用的 Qwen3.6 35b-a3b 要好。

    https://huggingface.co/ornith-ai/Ornith-1.5-35B-A3B

同日更多故事

2026-08-28