MicroLLM Lab ejecuta siete modelos de lenguaje pequeños en el navegador con WebGPU
MicroLLM Lab – Try 7 tiny LLM's in the browser
MicroLLM Lab permite cargar, chatear y comparar siete Small Language Models de entre 26M y 362M parámetros directamente en el navegador mediante WebGPU, sin servidores ni cuentas. Los modelos se cuantizan a 4 bits y se guardan en IndexedDB, con velocidades de 100 a 300 tokens por segundo en GPU y una caída a 8-20 tok/s en el fallback WASM. Incluye benchmarks objetivos, un certificado de rendimiento y un editor para escribir pruebas en JavaScript.
Con WebGPU, los modelos se ejecutan directamente en la GPU de tu hardware a 100–300+ tok/s (~10–20× más rápido). Los usuarios deberían usar WebGPU, no WASM.