M1 Mac 运行 2.8T 参数 Kimi K3
Running Kimi K3 on a M1 Mac
这是一个大胆的实验:在仅 64GB 内存的 M1 Max Mac 上运行拥有 2.8 万亿参数的 Kimi K3 混合专家模型。项目 Deltafin 通过按需流式传输 MXFP4 专家权重到本地磁盘缓存,利用 Metal/MPS 计算和融合 NEON 内核,实现了精确且可复现的推理。虽然速度较慢,在 M1 Max 上生成一个 token 约需 16 秒,但它证明了在单台消费级设备上运行超大规模模型的可能性。项目提供了两种模式:全量安装需 1.7TB 空间,或流式模式仅需 215GB 即可启动,并支持 OpenAI 兼容 API,让本地对话和编码代理成为现实。
它并不快——在我们的 M1 Max 上大约每秒生成 0.06 个 token,但它精确、可复现,并且能在 64GB 内存的笔记本电脑上运行。
- antirez
M5 Max 128GB 上的 SSD 流式加载:https://x.com/antirez/status/2082136334160818528
很快就能在两台配备 512GB 内存的 Mac Studio 上实现不错的速度。
- Azantys
0.01 tk/s 的速度根本没法用,光生成 1000 个 token 的输出就得等上一整天,这类项目到底有什么意义?
- acmnrs
标题最好改一下,明确写成 "M1 Max" 而不是 "M1 Mac"。你短期内可没法在基础版 M1 上跑 K3。不管怎样,这依然是一个非常 impressive 的项目。
- mannyv
打算在我的 M1 Ultra 128GB 上试试。这类工程技巧的意义就在于探索可能性的边界。你可以用这些技巧在更小的硬件上跑更大的模型,或者在更小的硬件上跑更小的模型。
- mips_avatar
如果能在 4 台 512GB 的 Mac Studio 上跑,看看速度会多快,应该会很有趣。