28,9-Millionen-Parameter-LLM läuft auf einem 8-Dollar-Mikrocontroller
Running a 28.9M parameter LLM on an $8 microcontroller

Ein Entwickler hat ein Sprachmodell mit 28,9 Millionen Parametern auf einem ESP32-S3 zum Laufen gebracht – einem Mikrocontroller für etwa 8 Dollar. Das Modell läuft komplett auf dem Chip, ohne Serververbindung, und erzeugt etwa 9,5 Token pro Sekunde. Möglich macht das Googles Per-Layer-Embeddings-Technik aus den Gemma-Modellen: Der Großteil der Parameter liegt in einer Flash-Tabelle, von der nur wenige Zeilen pro Token gelesen werden. So passt das Modell in den 512 KB schnellen SRAM des Chips, während 25 Millionen Parameter im Flash gespeichert sind. Das Projekt zeigt, wie große Modelle auf winziger Hardware laufen können, auch wenn die Qualität der Geschichten begrenzt ist.
Das große Modell kostet dann fast nichts im Betrieb, weil man den größten Teil davon nie lädt – es liegt einfach im Flash und wird nach und nach abgetastet.