Ternary Bonsai 2 27B schrumpft ein 27B-Modell auf 5,9 GB – bei 98,2 % der Leistung
Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint

Prism ML veröffentlicht Ternary Bonsai 2 27B, ein auf Qwen3.8 27B basierendes Modell mit ternären Gewichten und FP16-Skalierung. Es benötigt nur 1,76 effektive Bits pro Gewicht, passt in 5,9 GB und erreicht 98,2 % der Benchmark-Leistung des Vollpräzisionsmodells – bei über 9-fach kleinerem Speicherbedarf. Das Modell unterstützt 262K-Token-Kontext, multimodale Eingaben und läuft auf NVIDIA-GPUs sowie Apple-Geräten. Die Effizienz: 143 Tokens/s auf einer RTX 5090 und 40 % weniger Energieverbrauch pro Token als ein 8B-Modell in Vollpräzision.
Die entscheidende Frage wird zunehmend nicht nur sein, wie leistungsfähig ein Modell ist, sondern wie viel nutzbare Intelligenz sich innerhalb eines gegebenen Speicher-, Rechen- und Energiebudgets bereitstellen lässt.