WebLLM: LLM-Inferenz direkt im Browser mit WebGPU
WebLLM: high-performance in-browser LLM inference engine
WebLLM ist eine leistungsstarke Inferenz-Engine für große Sprachmodelle (LLMs), die vollständig im Browser läuft und WebGPU für Hardwarebeschleunigung nutzt. Sie ist vollständig kompatibel mit der OpenAI API und unterstützt Funktionen wie Streaming, JSON-Modus und Funktionen-Aufrufe. Entwickler können WebLLM als npm-Paket integrieren und auf eine Vielzahl von Modellen wie Llama 3, Phi 3, Gemma, Mistral und Qwen zugreifen. Die Engine bietet außerdem Unterstützung für Web Worker, Service Worker und Chrome-Erweiterungen sowie optionale Integritätsprüfung für Modelldateien.
WebLLM ist eine leistungsstarke Inferenz-Engine für große Sprachmodelle, die die Inferenz direkt in Webbrowsern mit Hardwarebeschleunigung ermöglicht.
- TekMol
Das scheint die Demo zu sein:
Ich bekomme:
WebGPUNotAvailableError: WebGPU is not supported in
your current environment, but it is necessary to
run the WebLLM engine.
Sowohl in FireFox als auch in Chromium unter Linux.
- MarioMan
Ich mag diese Engine wirklich. Ich habe sie für persönliche Projekte genutzt, aber sie wurde seit Gemma 2 nicht mehr aktualisiert. Ich schlage vor, heutzutage stattdessen Transformers.js zu verwenden.
- init0
Dir könnte webml-kit gefallen: https://npm.im/webml-kit