slotstream - Stream 104GB LLM on Macs with less RAM

Show HN: Running 104GB Qwen3.8-Flash-Next on 48GB Mac with at ~12 tok/s

slotstream は、104GB の大規模言語モデル Qwen3.8-Flash-Next を、SSD からエキスパートをストリーミングすることで、少ないメモリの Mac でも実行できるようにするツールです。48GB Mac では約 12 tok/s の高速デコードを実現し、メモリ使用量は自動調整(最小 8.1GB まで)。Ollama や OpenAI 互換の API を提供し、既存のクライアントから簡単に利用できます。インストールは curl コマンド一つで完了し、署名付きのバイナリで安全性も確保。メモリが少ない Mac でも大規模モデルを活用したい開発者に最適です。

スロットストリームは、モデルの全重みをメモリに載せずに、必要なエキスパートだけを SSD からストリーミングすることで、104GB のモデルを 8.1GB のメモリまで縮小して実行できます。

この日のほかの記事

2026-09-01