WebLLM:浏览器内运行高性能LLM
WebLLM: high-performance in-browser LLM inference engine
WebLLM 是一个革命性的高性能浏览器端 LLM 推理引擎,利用 WebGPU 实现硬件加速,让大型语言模型无需服务器支持即可直接在浏览器中运行。该项目完全兼容 OpenAI API,支持流式输出、JSON 模式及函数调用等功能,涵盖 Llama 3、Phi 3、Gemma、Mistral 和 Qwen 等多种开源模型。开发者可通过 NPM 或 CDN 轻松集成,利用 Web Worker 优化 UI 性能,甚至构建 Chrome 扩展。WebLLM 不仅降低了 AI 应用的部署门槛,更在保障用户隐私的同时,让每个人都能享受 GPU 加速带来的智能体验。
WebLLM 是一个高性能的浏览器内 LLM 推理引擎,它利用 WebGPU 进行硬件加速,将语言模型推理直接带入浏览器,且无需任何服务器支持。
HN 评论区
17- mandeepj
这点其实挺明显的,但可能正因为如此,哪里都没明说:每个浏览器会话都会导致下载 500 MB 到 ~1 GB 的数据,具体取决于你选择的模型。所以,如果你打算在面向客户的网站上使用 WebLLM,最好加个免责声明。
- TekMol
这看起来是演示页面:
我遇到的是:
WebGPUNotAvailableError: WebGPU is not supported in
your current environment, but it is necessary to
run the WebLLM engine.
在 Linux 上的 FireFox 和 Chromium 浏览器上都是这样。
- MarioMan
我真的很喜欢这个引擎。我曾在个人项目中用过它,但它自从 Gemma 2 之后就没更新过了。现在建议改用 Transformers.js。