Un LLM de 28,9 millones de parámetros corre en un microcontrolador de 8 dólares
Running a 28.9M parameter LLM on an $8 microcontroller

Un desarrollador ha logrado ejecutar un modelo de lenguaje de 28,9 millones de parámetros en un ESP32-S3, un microcontrolador de unos 8 dólares. El modelo genera texto a unas 9,5 tokens por segundo, sin conexión a internet. La clave está en almacenar la mayor parte del modelo (25 millones de parámetros) en la memoria flash, usando la técnica Per-Layer Embeddings de Google, en lugar de la RAM. Esto supone un avance de cien veces respecto al modelo anterior de 260.000 parámetros en un chip similar. El modelo se entrenó con TinyStories y escribe cuentos cortos coherentes, pero no responde preguntas ni sigue instrucciones.
La idea es Google's Per-Layer Embeddings, de Gemma 3n y Gemma 4. Aquí se ejecuta en la disposición de memoria de un microcontrolador en lugar de un teléfono o una GPU. Hasta donde sé, nadie lo había intentado en un chip tan pequeño.