브라우저에서 7개의 초소형 LLM을 직접 실행해보는 MicroLLM Lab

MicroLLM Lab – Try 7 tiny LLM's in the browser

MicroLLM Lab은 WebGPU를 활용해 25M~360M 파라미터의 Small Language Model(SLM) 7종을 브라우저에서 바로 실행·벤치마크·비교할 수 있는 실험실이다. Q4 양자화로 모델을 50~84MB 수준으로 압축해 IndexedDB에 캐시하며, 서버나 계정 없이 100% 프라이버시를 보장한다. GPU 가속 시 100~300+ tok/s, 첫 토큰까지 10ms 이하의 속도를 낸다.

프론티어 모델(GPT-4, Claude)은 서빙에 수백만 달러가 들고 네트워크 지연을 추가한다. 소형 모델(25M~360M)은 초고속·효율적인 엣지 레이어로 동작한다.

이 날의 다른 글

2026-09-28