MicroLLM Labが7つの超小型LLMをブラウザで実行、WebGPUで100〜300tok/s

MicroLLM Lab – Try 7 tiny LLM's in the browser

MicroLLM Labは、25M〜360Mパラメータの小型言語モデル7種をブラウザ上で動作・比較できる実験場だ。WebGPU対応で最大100〜300tok/s、Q4量子化により100M超のモデルが50〜84MBに収まる。サーバー不要でデータは端末外に出ず、ベンチマークと性能証明書も生成できる。

フロンティアモデル(GPT-4、Claude)は提供に数百万ドルかかり、ネットワーク遅延も加わる。コンパクトモデル(25M〜360M)は、超高速で効率的なエッジ層として機能する。

この日のほかの記事

2026-09-28