WebLLM: LLM-инференс прямо в браузере с аппаратным ускорением
WebLLM: high-performance in-browser LLM inference engine
WebLLM — это высокопроизводительный движок для инференса больших языковых моделей прямо в браузере. Он использует WebGPU для аппаратного ускорения и полностью совместим с OpenAI API, что позволяет запускать открытые модели локально с поддержкой стриминга, JSON-режима и вызова функций. Движок поддерживает множество моделей, включая Llama 3, Phi 3, Gemma, Mistral и Qwen, а также интеграцию кастомных моделей. Встроенные механизмы кэширования и поддержка Web Workers, Service Workers и Chrome-расширений делают его гибким для различных сценариев.
WebLLM — это высокопроизводительный движок инференса LLM в браузере, который переносит инференс языковых моделей непосредственно в веб-браузеры с аппаратным ускорением.
- TekMol
Похоже, вот демо:
У меня выдаёт:
WebGPUNotAvailableError: WebGPU is not supported in
your current environment, but it is necessary to
run the WebLLM engine.
И в FireFox, и в Chromium на Linux.
- MarioMan
Мне очень нравится этот движок. Я использовал его для личных проектов, но его не обновляли со времён Gemma 2. В наши дни я предлагаю вместо него использовать Transformers.js.
- init0
Возможно, вам понравится webml-kit https://npm.im/webml-kit