Lumabri - Run huge MoE models on a P2P swarm
Show HN: Lumabri – Run Moe Models on a P2P Swarm with Colibri
Lumabriは、ピアツーピアのスウォーム上で巨大なMixture-of-Expertsモデルを実行できるオープンソースツールです。Pure Cで書かれ、依存関係もありません。1台のマシンがモデルを共有し、他のマシンはダウンロードなしで即座にチャットできます。必要なバイトだけがネットワーク経由で届き、ローカルにキャッシュされるため、2回目以降の応答はフルスピードで返ります。GPUがなくても動作し、CPUとSSDを最優先に設計されています。GPUがあれば高速化されますが、出力はバイト単位で同一です。複数のモデルを1つのスウォームで扱え、匿名のピア管理、NAT越えのリレー、トークンによるプライベートスウォームもサポート。セットアップは簡単で、5分で最初のスウォームを構築できます。
「GPUを持たないマシンでも参加できる。lumabriは、GPUをプールするネットワークが少数からしか集められないのに対し、すべての人から集めるのです。」
HNでの議論
19- SCHiM
これは本当に面白そうだ。そして、もし私がこれを正しく理解しているなら、誰かがこれを構築する時が来ていたんだ!
自分で実験をしてみることなく言うと、もし可能で持っているなら、統計や実験ログを追加してくれると素晴らしいと思う。
例えば:
モデルXYZを仮定して、それぞれ32GBの均一なドナーが5人いるとする。各フォワードパスはリンク上でxGBを転送する。各パスはnミリ秒かかる、などなど。その結果、レイテンシがnミリ秒だと仮定すると、毎秒nトークンになる。
そういった統計はある?それとも、リポジトリで見逃したかな?
- gebdev
最近私も同じアイデアを考えていたので、それが今存在するのは嬉しい!
私が見る最大の利点は、RAMに制約のあるGPUが、驚くほど高いスループットで大規模パラメータモデルの推論を実行できるようになることだ。なぜなら、単一のエキスパートだけが常駐するので、ネットワーク上のメモリ対計算比は、重みではなくアクティベーションによってのみ制限されるからだ。kimi k3のようなMoEでは、アクティブパラメータが103Bあり、性能は約5有効トークン/秒/Tflopと約1トークン/秒/100GB/sにのみ制限されると期待できるかもしれない。
ネットワークのメンバーが多ければ多いほど、常駐パラメータを小さくする必要がある。レイヤー推論を任意のチャンクに分割できるかどうかは確信がないが、もしできるなら、すべてをGPUキャッシュに保存することでメモリスループットを向上させることができるだろう。
もちろん、レイテンシが比較的高くなると予想されるが、それは特定の状況では許容できるトレードオフだ。
このアイデアにこれ以上問題があるかどうかは確信がないが、それでも楽しいアイデアだね :)
- brainless
すみません、全部は理解できませんでした。でも、これを使えば、エキスパートを複数の安価なGPU(またはCPU)に分散させて、ローカルネットワーク上で大規模なMoE LLMを実行できるようになるのでしょうか?これは、インターネット経由よりも、例えばオフィス内などでより有用かもしれません。