slotstream: 让Mac流式运行百十亿参数大模型
Show HN: Running 104GB Qwen3.8-Flash-Next on 48GB Mac with at ~12 tok/s
slotstream 是一个基于 MLX 和 Swift 构建的创新工具,它能让内存有限的 Mac 运行高达 104GB 的 Qwen3.8-Flash-Next 大模型。通过独特的 SSD 专家流式加载技术,它突破了显存瓶颈,在 48GB 内存的 Mac 上实现了约 12 tok/s 的流畅推理速度。该项目提供与 Ollama 和 OpenAI 兼容的 API,用户只需一条命令即可安装,无需担心内存不足,让本地大模型推理变得更加轻松高效。
磁盘才是最先咬人的门槛,而非你的内存。