MicroLLM Lab lässt sieben winzige LLMs direkt im Browser laufen
MicroLLM Lab – Try 7 tiny LLM's in the browser
MicroLLM Lab führt Small Language Models mit 25 bis 360 Millionen Parametern per WebGPU direkt im Browser aus – ohne Server, ohne Konto, vollständig privat. Die 4-Bit-Quantisierung schrumpft die Modelle auf 15 bis 216 MB, sodass sie in den IndexedDB-Cache passen. Nutzer können laden, chatten, benchmarken und ein Leistungszertifikat teilen. Ohne WebGPU läuft alles im WASM-Fallback mit 8–20 statt 100–300 Tokens pro Sekunde.
Ein 135M-Modell darf ruhig scheitern – genau das ist die Messung.