29GB RAMでKimi K3を実行:NVMeストリーミングによる画期的な推論
Run Kimi K3 using 29 GB of RAM at 0.50 tok/s
私はC言語で記述されたWASTEという推論エンジンを開発しました。これにより、2.78兆パラメータを持つKimi K3モデルを、64GB RAMの一般的なMacBook Pro上で実行可能にしました。モデルの重みの大部分をNVMeストレージから直接ストリーミングする仕組みにより、膨大なメモリ容量がなくても、完全版のモデルをローカルで動かすことが現実となりました。
クラウドサービスで回答される各トークンは2回支払われています。1回は請求書で、もう1回は、机の上にあるハードウェアにギリギリ収まるはずのモデルをデータセンターで動かすための電気代です。