MacBook Pro 跑满 2.8T 参数 Kimi K3
Kimi K3 (2.8T) at 1 token/s on a MacBook Pro, streamed from four SSDs
Deltafin 项目展示了在消费级硬件上运行完整 Kimi K3 模型的可能性。该方案未对模型进行任何剪枝,保留了全部 16 个专家模块,确保每个 token 都由 Kimi K3 亲自决策。通过在 M1 Max 笔记本上从四块 SSD 流式加载模型,实现了每秒约 1 个 token 的推理速度。这不仅是技术实验,更证明了无需千万级基础设施,也能在本地运行前沿大模型,为自托管 AI 探索了新路径。
我们选择在本地运行完整的 2.8 万亿参数模型并挑战其他极限,并非因为容易,而是因为困难。
HN 评论区
120- lukeduff
让我想起了《银河系漫游指南》里的深思(Deep Thought)。
- kgeist
人们往往只引用解码速度,但实际上,LLM 生成的 token 数量远少于它需要读取的数量(除非你问的是通用知识类问题)。因此,实际性能比解码率暗示的要慢得多,因为仅加载一个 512 token 的提示词就需要 6 分钟。
- mandeepj
你目前根本无法在本地运行 2.8T 参数的模型,这完全不可能。所以,这算是一个不错的开始。
- dusted
仅仅 11 天就搞定了中等规模的提示词。
- bluechair
我错过了关于 SSD 是如何连接的解释。
也许这是个蠢问题。
- amelius
SSD 是必需的,因为 Apple 的架构不允许升级内存。这让我想起有人曾说:“640KB 对任何人来说都足够了”。
- pjdesno
我在想更快的 SSD 会不会有帮助?
特别是你仍然可以在 eBay 上买到二手的 Optane SSD,尽管价格相当昂贵。(不是那些速度比一半靠谱的消费者级 NVMe 还慢的假冒 m.2 产品)。
- alex7o
我觉得这很酷,不是为了 Kimi,而是为了像 GLM Flash 这样的东西。