Swiftlet: 在苹果设备上运行超大语言模型
Show HN: Run an 80B Qwen in 4.3 GB of RAM on a Mac, and a 35B on an iPhone
Swiftlet 是一个基于 Swift 和 Metal 的运行时,专为 Qwen3-Next 和 Qwen3.5/3.6 MoE 混合模型家族打造。它通过仅将模型的小型稠密核心常驻内存,并按需从存储流式加载路由的专家权重,实现了惊人的内存效率。在 Mac 上,它仅需 4.3 GB 内存即可运行 80B 参数模型;在 iPhone 17 上,甚至能用 2.5 GB 内存运行 35B 模型。这是同类模型首次在手机上原生运行,支持本地聊天、代码生成及 OpenAI 兼容服务,让普通苹果设备也能体验大模型的强大能力。
据我们所知,这是同类模型首次在手机上原生运行。
- dghlsakjg
我知道大家都想对这些不切实际的方案大加贬低,但进步就是这样发生的。
人们会不断钻研,找出如何避免把硬盘当穿戴设备、如何提升运行速度、如何设计自定义硬件总线等问题的解决方案。
继续加油!我个人迫不及待想看到那一天:一个 1T 参数的模型能直接跑在 200 美元的 SSD 上,而不是依赖价值 5 万美元的 Nvidia 芯片机架。
- AHASIC
几个月前我在本站看到过一条评论,想再重申一下。基本上,苹果很可能在押注:未来的 LLM 会高效到消费者日常使用的模型,都能轻松由 iPhone 甚至更大算力的 Mac 来运行。老实说,这确实是最合理的发展方向,最晚几年内我们就会朝这个方向迈进。
- CyLith
我对 LLM 的运作机制了解不多,但我一直看到像这样的项目,用非常有限的 RAM 就能运行超大规模的 MoE 模型,甚至显得有点过于极限了。我好奇的是,有没有办法让 RAM 占用变得可调节?我有一台 32GB RAM 的 Macbook,如果能运行同样的模型,同时利用额外的内存来提升速度,那就太棒了。