WebLLM: 브라우저에서 LLM을 실행하는 고성능 엔진
WebLLM: high-performance in-browser LLM inference engine
WebLLM은 WebGPU를 활용하여 브라우저 내에서 LLM 추론을 가능하게 하는 고성능 엔진입니다. 서버 없이 모든 처리를 브라우저에서 수행하며, OpenAI API와 완전히 호환되어 스트리밍, JSON 모드, 함수 호출 등을 지원합니다. Llama 3, Phi 3, Mistral, Qwen 등 다양한 모델을 지원하며, Web Worker, Service Worker, Chrome 확장 프로그램으로도 사용할 수 있습니다. npm 패키지로 제공되어 쉽게 통합할 수 있습니다.
WebLLM은 WebGPU로 가속되는 브라우저 내 LLM 추론 엔진으로, 서버 지원 없이 모든 것이 브라우저 안에서 실행됩니다.
HN 토론
16- TekMol
이것이 데모인 것 같습니다:
저는 다음과 같은 오류를 받고 있습니다:
WebGPUNotAvailableError: WebGPU is not supported in
your current environment, but it is necessary to
run the WebLLM engine.
Linux의 FireFox와 Chromium 둘 다에서 그렇습니다.
- MarioMan
저는 이 엔진을 정말 즐겨 사용합니다. 개인 프로젝트에 사용해 왔지만, Gemma 2 이후로 업데이트되지 않았습니다. 요즘에는 대신 Transformers.js를 사용할 것을 권장합니다.
- init0
webml-kit https://npm.im/webml-kit 을(를) 좋아하실 수도 있습니다.