28.9M 파라미터 LLM을 8달러짜리 마이크로컨트롤러에서 실행하다

Running a 28.9M parameter LLM on an $8 microcontroller

28.9M 파라미터 LLM을 8달러짜리 마이크로컨트롤러에서 실행하다

ESP32-S3(약 8달러)에서 28.9M 파라미터 언어 모델을 실행하는 방법을 소개한다. 이 모델은 온디바이스로 실행되며 초당 약 9.5토큰을 생성한다. 핵심은 Google Gemma 모델의 Per-Layer Embeddings 기법을 적용해 대부분의 파라미터를 플래시 메모리에 저장하고, 토큰당 필요한 행만 읽는 것이다. 이전에는 260K 파라미터가 한계였지만, 이 방법으로 100배 더 큰 모델을 구동할 수 있다. 모델은 TinyStories 데이터로 학습되어 짧은 이야기를 생성하지만, 추론이나 코드 작성은 불가능하다.

대부분의 언어 모델 파라미터는 임베딩 테이블에 있으며, 모델이 계산하는 대신 읽어오는 방식이므로, 2,500만 행 테이블을 느린 플래시에 두고 토큰당 필요한 약 450바이트만 읽으면 된다.

이 날의 다른 글

2026-07-25