7 ESP32-S3-Mikrocontroller stemmen gemeinsam ein 0,4B-LLM
ESP32S3 cluster running 1.58-bit (BitNet) Language model
Ein verteiltes Inferenzsystem verteilt ein 0,5B-Sprachmodell mit 1,58-Bit-Quantisierung auf sieben ESP32-S3-Boards. Der Master übernimmt Tokenizer und Embedding, sechs Compute-Knoten führen die Transformer-Layer aus und kommunizieren über eine schnelle SPI-Daisy-Chain. Die Gewichte sind ternär quantisiert, die Embeddings in INT4, und der KV-Cache liegt im PSRAM. Das Projekt umfasst Firmware für Master und Knoten sowie Python-Tools zur Quantisierung und Modellvorbereitung.
Dieses Projekt führt ein geslicetes 0,5B-LLM über einen Cluster von 7 ESP32s3 aus.
- ladyanita22
Das ist etwas, wovon ich schon lange träume.
Nehmen wir an, wir hätten Rust, eine Sprache, die Parallelisierung einfacher macht als andere (weil sie einem hilft, einige häufige Fußangeln zu vermeiden). Wie schwierig wäre es, ein massiv paralleles Computersystem aus vielen winzigen, einfachen Mikrocontroller-ähnlichen Chips zu bauen? Sagen wir, wir würden viele kleine Risc-Vs nehmen. Sicherlich wäre das ein interessantes Experiment (obwohl ich mir nicht sicher bin, ob es wirtschaftlich sinnvoll wäre oder nicht ...)
- tdhz77
Bald KI in jeder Glühbirne, die Kubernetes laufen lässt
- cameron_b
Es ist ein bisschen schade zu sehen, dass der Grad der 'Kompression' es zu einem schicken LLM-Rauschgenerator macht. Es ist trotzdem charmant.
- NDlurker
Ich bin neugierig, wie das die Grammatikprüfung in einer einfachen Textverarbeitung bewältigen würde. Oder vielleicht Welten für kleine Text-Basierte Spiele generieren. Ich habe keine Ahnung, was die Fähigkeiten eines solchen Clusters sind.
- librasteve
haha … genau auf diese Art von Projekt zielt https://bil-lang.org ab: Go für parallel (also in diesem Fall Pipeline-Verarbeitung).
Aber nicht zu früh freuen, bis wir das TinyGo-Backend gebaut haben ;-)