2.78万亿参数Kimi K3在笔记本运行
Run Kimi K3 using 29 GB of RAM at 0.50 tok/s
sqliteai团队推出了WASTE引擎,成功在仅64GB内存的MacBook Pro上运行了完整的2.78万亿参数Kimi K3模型。这项技术并非模型蒸馏或剪枝,而是通过从NVMe硬盘直接流式传输激活的权重,将闲置参数留在磁盘上。虽然生成速度仅为每秒0.5个token,但它证明了在消费级硬件上运行前沿规模模型无需依赖云端API。该引擎由C语言编写,零依赖,不仅解决了内存限制问题,更让数据完全本地化运行成为可能。
WASTE意味着终结这种token浪费的第一步:云服务的每个token都被支付了两次,一次在账单上,一次在运行本可勉强放入桌面硬件的模型的数据中心电力中。
HN 评论区
158- theanonymousone
那份 README 完全踩中了我所有“这是 LLM 写的”的直觉。我猜代码库也是 LLM 写的吧?
- ikurei
行吧,这个在 Claude Code 里打完招呼后,开始输出 token 只需要 30 小时(相比之下,另一个项目得花 6.25 天)。
- hddambo
挺有意思。我看到了它的 novelty(新奇之处)。
- bgirard
这个项目和 https://github.com/gavamedia/deltafin 相比怎么样?
- nialv7
粗略估算下来,成本大概是每百万 token 5 美元(假设持续功耗 42W,电价 20 美分/千瓦时),而且这还没算硬件和其他成本。