ESP32-S3を7台つないで0.4B LLMを動かすクラスタが登場
ESP32S3 cluster running 1.58-bit (BitNet) Language model
7台のESP32-S3をSPIデイジーチェーンで接続し、0.5B LLMを1.58-bit(BitNet)三値量子化で分散推論するプロジェクト。マスターノードがトークナイザと埋め込みを担当し、各ノードがTransformerブロックを分割して実行。アセンブリ最適化されたMAC演算やKVキャッシュなど、マイコン上でのLLM推論を実現する工夫が満載。
マスターノードはトークナイザと埋め込みを実行し、他のアテンション層とMLPはノード上で実行されます。マスターとノードは高速SPIデイジーチェーンを介して通信します。
HNでの議論
31- ladyanita22
これはずっと妄想してきたことだ。
例えばRust、他の言語より並列化を容易にする言語(よくある落とし穴を避けるのに役立つ)を使ったとしよう。たくさんの小さく単純なマイクロコントローラのようなチップで構成される超並列コンピュータシステムを作るのはどれほど難しいだろうか?たくさんの小さなRisc-Vを選んだとしよう。きっと面白い実験になるだろう(経済的に意味があるかどうかはわからないが…)
- tdhz77
まもなくすべての電球の中でKubernetesを動かすAIが登場する
- cameron_b
「圧縮」の度合いが高すぎて、 fancyなLLMノイズメーカーになってしまっているのはちょっと残念だ。それでも魅力的ではある。
- NDlurker
基本的なワープロでの文法チェックにこれがどう対応するのか興味がある。あるいは小さなテキストベースゲーム用の世界を生成するとか。このようなクラスタがどんな能力を持っているのか全く見当がつかない。
- librasteve
はは…これはまさに https://bil-lang.org が目指している種類のプロジェクトだ:並列処理(つまりこの場合はパイプライン処理)のためのGoだ。
ただし、TinyGoバックエンドがビルドされるまではあまり興奮しないでね ;-)