WebLLM: LLM-Inferenz direkt im Browser mit WebGPU

WebLLM: high-performance in-browser LLM inference engine

WebLLM ist eine leistungsstarke Inferenz-Engine für große Sprachmodelle (LLMs), die vollständig im Browser läuft und WebGPU für Hardwarebeschleunigung nutzt. Sie ist vollständig kompatibel mit der OpenAI API und unterstützt Funktionen wie Streaming, JSON-Modus und Funktionen-Aufrufe. Entwickler können WebLLM als npm-Paket integrieren und auf eine Vielzahl von Modellen wie Llama 3, Phi 3, Gemma, Mistral und Qwen zugreifen. Die Engine bietet außerdem Unterstützung für Web Worker, Service Worker und Chrome-Erweiterungen sowie optionale Integritätsprüfung für Modelldateien.

WebLLM ist eine leistungsstarke Inferenz-Engine für große Sprachmodelle, die die Inferenz direkt in Webbrowsern mit Hardwarebeschleunigung ermöglicht.
  1. TekMol

    Das scheint die Demo zu sein:

    https://chat.webllm.ai/

    Ich bekomme:

    WebGPUNotAvailableError: WebGPU is not supported in

    your current environment, but it is necessary to

    run the WebLLM engine.

    Sowohl in FireFox als auch in Chromium unter Linux.

  2. MarioMan

    Ich mag diese Engine wirklich. Ich habe sie für persönliche Projekte genutzt, aber sie wurde seit Gemma 2 nicht mehr aktualisiert. Ich schlage vor, heutzutage stattdessen Transformers.js zu verwenden.

  3. init0

    Dir könnte webml-kit gefallen: https://npm.im/webml-kit

Mehr von diesem Tag

2026-09-02