WebLLM: ブラウザ内でLLM推論を高速実行するエンジン
WebLLM: high-performance in-browser LLM inference engine
WebLLMは、WebGPUによるハードウェアアクセラレーションを活用し、ブラウザ内で直接LLM推論を実行する高性能エンジンです。サーバー不要で、OpenAI APIと完全互換のインターフェースを提供し、ストリーミング、JSONモード、関数呼び出しなどの機能をサポートします。Llama 3、Phi 3、Gemma、Mistral、Qwenなど、さまざまなモデルに対応し、カスタムモデルの統合も可能です。プライバシーを保ちながら、GPUアクセラレーションの恩恵を受けることができます。
WebLLMは、WebGPUでハードウェアアクセラレーションを実現し、サーバーサポートなしでブラウザ内で直接言語モデル推論を実行する、高性能なブラウザ内LLM推論エンジンです。
HNでの議論
16- TekMol
これはデモのようです:
以下のエラーが出ています:
WebGPUNotAvailableError: WebGPU is not supported in
your current environment, but it is necessary to
run the WebLLM engine.
Linux上のFireFoxとChromiumの両方で発生しています。
- MarioMan
このエンジンは本当に気に入っています。個人プロジェクトで使ってきましたが、Gemma 2以降更新されていません。最近ではTransformers.jsを使うことをお勧めします。
- init0
webml-kit https://npm.im/webml-kit が気に入るかもしれません。