迷你PC为何能跑70B模型而RTX 5090不行?
Unified Memory, Explained: Why Mini PCs Can Run 70B Models a Big GPU Can't

把一台搭载RTX 5090的塔式机和一台仅2000美元的AMD Ryzen AI Max+ 395迷你PC放在桌上,面对70B参数模型,结果令人咋舌:RTX 5090因显存不足直接无法加载,而迷你PC却能轻松运行。这背后的秘密在于Unified Memory架构,它打破了CPU与GPU的显存壁垒,让迷你PC能拥有128GB甚至更大的内存池。然而,容量换来了速度:迷你PC的内存带宽远低于独立显卡,导致生成文本像慢速阅读。文章深入解析了Capacity与Memory Bandwidth这对矛盾如何决定LLM性能,并指出MoE模型是提升迷你PC速度的关键,同时提醒长文本处理时的Prompt Processing瓶颈。
迷你PC的缓慢并非驱动问题或芯片孱弱,而是内存带宽数字上的算术结果。
- 有评论者指出 MoE 模型在本地推理场景下表现糟糕,因为路由机制依赖前一层激活值,导致难以流水线化且缺乏对 grouped GEMM kernels 的支持,相比之下 Dense 模型更易于部署。
- 一位用户反驳了关于 decode 阶段难以 batch 的说法,认为 GPU 需要流式传输大量权重,在 Strix Halo 上对 4 个预测进行 batching 可将总 TPS 提升 2-3 倍。
- 评论强调 LLM 推理的瓶颈在于将数十 TB/s 数据推过硅片的物理限制,而非单纯的计算或内存容量,因此 Mini PC 的统一内存架构在带宽上比依赖 PCIe 传输的 RTX 5090 更具优势。
- 有观点提到将权重从系统内存交换到 VRAM 在理论上是可行的,但受限于 PCIe 5.0 x16 约 64 GB/s 的带宽,实际速度远慢于统一内存机器,且涉及 disk 到 RAM 再到 VRAM 的多重延迟。