WebLLM: LLM-инференс прямо в браузере с аппаратным ускорением

WebLLM: high-performance in-browser LLM inference engine

WebLLM — это высокопроизводительный движок для инференса больших языковых моделей прямо в браузере. Он использует WebGPU для аппаратного ускорения и полностью совместим с OpenAI API, что позволяет запускать открытые модели локально с поддержкой стриминга, JSON-режима и вызова функций. Движок поддерживает множество моделей, включая Llama 3, Phi 3, Gemma, Mistral и Qwen, а также интеграцию кастомных моделей. Встроенные механизмы кэширования и поддержка Web Workers, Service Workers и Chrome-расширений делают его гибким для различных сценариев.

WebLLM — это высокопроизводительный движок инференса LLM в браузере, который переносит инференс языковых моделей непосредственно в веб-браузеры с аппаратным ускорением.
  1. TekMol

    Похоже, вот демо:

    https://chat.webllm.ai/

    У меня выдаёт:

    WebGPUNotAvailableError: WebGPU is not supported in

    your current environment, but it is necessary to

    run the WebLLM engine.

    И в FireFox, и в Chromium на Linux.

  2. MarioMan

    Мне очень нравится этот движок. Я использовал его для личных проектов, но его не обновляли со времён Gemma 2. В наши дни я предлагаю вместо него использовать Transformers.js.

  3. init0

    Возможно, вам понравится webml-kit https://npm.im/webml-kit

Ещё за этот день

2026-09-02