WebLLM: ブラウザ内でLLM推論を高速実行するエンジン

WebLLM: high-performance in-browser LLM inference engine

WebLLMは、WebGPUによるハードウェアアクセラレーションを活用し、ブラウザ内で直接LLM推論を実行する高性能エンジンです。サーバー不要で、OpenAI APIと完全互換のインターフェースを提供し、ストリーミング、JSONモード、関数呼び出しなどの機能をサポートします。Llama 3、Phi 3、Gemma、Mistral、Qwenなど、さまざまなモデルに対応し、カスタムモデルの統合も可能です。プライバシーを保ちながら、GPUアクセラレーションの恩恵を受けることができます。

WebLLMは、WebGPUでハードウェアアクセラレーションを実現し、サーバーサポートなしでブラウザ内で直接言語モデル推論を実行する、高性能なブラウザ内LLM推論エンジンです。
  1. TekMol

    これはデモのようです:

    https://chat.webllm.ai/

    以下のエラーが出ています:

    WebGPUNotAvailableError: WebGPU is not supported in

    your current environment, but it is necessary to

    run the WebLLM engine.

    Linux上のFireFoxとChromiumの両方で発生しています。

  2. MarioMan

    このエンジンは本当に気に入っています。個人プロジェクトで使ってきましたが、Gemma 2以降更新されていません。最近ではTransformers.jsを使うことをお勧めします。

  3. init0

    webml-kit https://npm.im/webml-kit が気に入るかもしれません。

この日のほかの記事

2026-09-02