Siete ESP32-S3 en clúster ejecutan un LLM de 0.4B con cuantización ternaria de 1.58 bits

ESP32S3 cluster running 1.58-bit (BitNet) Language model

Siete ESP32-S3 en clúster ejecutan un LLM de 0.4B con cuantización ternaria de 1.58 bits

El proyecto ESP32s3-LLM-Cluster distribuye un modelo de lenguaje de 0.5B en siete microcontroladores ESP32-S3 mediante una cadena tipo margarita SPI de alta velocidad. Un nodo maestro maneja el tokenizador y los embeddings INT4, mientras que los nodos de cómputo ejecutan las capas de atención y MLP con cuantización ternaria de 1.58 bits (BitNet). La inferencia se realiza en pipeline, con caché KV en PSRAM y operaciones MAC optimizadas en ensamblador. El repositorio incluye firmware, herramientas de cuantización en Python y scripts de flasheo.

Este proyecto ejecuta un LLM de 0.5B dividido en un clúster de 7 ESP32s3. Uno actúa como maestro y los demás como nodos.
  1. ladyanita22

    Esto es algo con lo que he estado fantaseando durante mucho tiempo.

    Digamos que tomamos Rust, un lenguaje que hace que la paralelización sea más fácil que otros (ya que te ayuda a evitar algunos errores comunes). ¿Qué tan difícil sería tener un sistema informático masivamente paralelo hecho de muchos chips pequeños y simples tipo microcontrolador? Digamos que elegimos muchos Risc-V pequeños. Seguramente sería un experimento interesante (aunque no estoy seguro de si tendría sentido económico o no...)

  2. tdhz77

    Pronto IA en cada bombilla ejecutando Kubernetes

  3. cameron_b

    Es un poco decepcionante ver que el grado de 'compresión' lo convierte en un generador de ruido LLM elegante. Aun así, tiene su encanto.

  4. NDlurker

    Tengo curiosidad por saber cómo manejaría la corrección gramatical en un procesador de textos básico. O quizás generar mundos para pequeños juegos basados en texto. No tengo ni idea de cuáles son las capacidades de un clúster como este.

  5. librasteve

    jaja ... este es precisamente el tipo de proyecto al que apunta https://bil-lang.org: Go para paralelismo (es decir, en este caso procesamiento en pipeline).

    Pero no te emociones demasiado hasta que tengamos construido el backend de TinyGo ;-)

Más de este día

2026-09-29