WebLLM ejecuta modelos de IA directamente en el navegador con WebGPU
WebLLM: high-performance in-browser LLM inference engine
WebLLM es un motor de inferencia de LLM de alto rendimiento que ejecuta modelos de lenguaje directamente en el navegador, acelerado por WebGPU y sin necesidad de servidores. Es totalmente compatible con la API de OpenAI, por lo que los desarrolladores pueden usar los mismos endpoints para streaming, generación de JSON y function calling sobre modelos abiertos como Llama 3, Phi 3 y Qwen. Incluye soporte para Web Workers, Service Workers y extensiones de Chrome, y permite verificar la integridad de los modelos con hashes SRI.
Todo se ejecuta dentro del navegador sin soporte de servidor y se acelera con WebGPU.
- TekMol
Esto parece ser la demo:
Me está dando:
WebGPUNotAvailableError: WebGPU no está soportado en
tu entorno actual, pero es necesario para
ejecutar el motor WebLLM.
Tanto en FireFox como en Chromium en Linux.
- MarioMan
Realmente disfruto este motor. Lo he usado para proyectos personales, pero no se ha actualizado desde Gemma 2. Sugiero usar Transformers.js en estos días.
- init0
Te podría gustar webml-kit https://npm.im/webml-kit