WebLLM ejecuta modelos de IA directamente en el navegador con WebGPU

WebLLM: high-performance in-browser LLM inference engine

WebLLM es un motor de inferencia de LLM de alto rendimiento que ejecuta modelos de lenguaje directamente en el navegador, acelerado por WebGPU y sin necesidad de servidores. Es totalmente compatible con la API de OpenAI, por lo que los desarrolladores pueden usar los mismos endpoints para streaming, generación de JSON y function calling sobre modelos abiertos como Llama 3, Phi 3 y Qwen. Incluye soporte para Web Workers, Service Workers y extensiones de Chrome, y permite verificar la integridad de los modelos con hashes SRI.

Todo se ejecuta dentro del navegador sin soporte de servidor y se acelera con WebGPU.
  1. TekMol

    Esto parece ser la demo:

    https://chat.webllm.ai/

    Me está dando:

    WebGPUNotAvailableError: WebGPU no está soportado en

    tu entorno actual, pero es necesario para

    ejecutar el motor WebLLM.

    Tanto en FireFox como en Chromium en Linux.

  2. MarioMan

    Realmente disfruto este motor. Lo he usado para proyectos personales, pero no se ha actualizado desde Gemma 2. Sugiero usar Transformers.js en estos días.

  3. init0

    Te podría gustar webml-kit https://npm.im/webml-kit

Más de este día

2026-09-02