BitTorrent方式で自宅のGPUから巨大LLMを動かす「Petals」、Llama 3.1 405Bにも対応

Run large language models at home, BitTorrent‑style

BitTorrent方式で自宅のGPUから巨大LLMを動かす「Petals」、Llama 3.1 405Bにも対応

Petalsは、巨大な大規模言語モデル(LLM)を自宅のコンシューマー向けGPUやGoogle Colabで実行できる分散型プラットフォームです。モデルを分割してネットワーク上の他のユーザーと共有し、推論やファインチューニングを行います。Llama 3.1(最大405B)、Mixtral(8x22B)、Falcon(40B+)、BLOOM(176B)などに対応。単一バッチ推論でLlama 2 70Bなら毎秒最大6トークン、Falcon 180Bなら毎秒4トークンを達成し、チャットボットや対話型アプリに十分な速度です。また、PyTorchやTransformersの柔軟性を活かし、カスタムパスや隠れ状態の取得も可能です。BigScience研究ワークショップの一部として開発されています。

あなたはモデルの一部を読み込み、その他の部分を提供する人々のネットワークに参加します。

この日のほかの記事

2026-07-23