28.9MパラメータのLLMを約8ドルのマイコンで実行、ESP32-S3で実現
Running a 28.9M parameter LLM on an $8 microcontroller

約8ドルのESP32-S3マイコン上で、28.9Mパラメータの言語モデルが動作する。モデルはチップ内で完結し、サーバーに送信されるデータはない。毎秒約9トークンの速度でテキストを生成する。従来、同クラスのチップで動くモデルは260Kパラメータが限界だったが、GoogleのGemmaモデルで提案されたPer-Layer Embeddingsを応用し、モデルの大部分をフラッシュメモリに格納することで、100倍の規模を実現した。
大きなモデルは、ほぼコストをかけずに実行できる。なぜなら、大部分をロードすることは決してないからだ。それはフラッシュに置かれたまま、少しずつサンプリングされるだけだ。