Mesh LLM:GPUを束ねて手元のマシン群で巨大LLMを動かす分散AIコンピューティング
Mesh LLM: distributed AI computing on iroh
Mesh LLMは、既存のGPUやメモリを複数のマシンでプールし、OpenAI互換のAPIとして公開する分散AIコンピューティングプラットフォームです。irohのP2Pネットワーク上に構築され、中央サーバーを介さずに、ノード間でモデルの実行をローカル実行、ピアへのルーティング、またはパイプライン分割(Skippy)で分散します。最大235Bパラメータのモデルを、単一のマシンでは保持できない場合でも、複数のマシンに分割して実行できます。ユーザーはローカルホストのエンドポイントにリクエストを送るだけで、モデルの実行場所を意識する必要はありません。プライベートなメッシュの構築や公開メッシュへの参加が可能で、データの管理とコスト削減を実現します。
「ルーティング」と「パイプラインの次のステージへのアクティベーションのストリーミング」は、「localhostと話す」のと同じプリミティブになり、エンドポイントIDが異なるだけです。