colibrì - Run GLM-5.2 on 25GB RAM via disk streaming
Show HN: Getting GLM 5.2 running on my slow computer
colibrì ist eine in reinem C geschriebene Engine ohne Abhängigkeiten, die es ermöglicht, das 744B-Parameter-MoE-Modell GLM-5.2 auf einem Consumer-Rechner mit nur 25 GB RAM auszuführen. Die clevere Idee: Da nur etwa 40B Parameter pro Token aktiv sind, bleiben die dichten Teile im RAM (ca. 9,9 GB), während die 21.504 Experten bei Bedarf von der Festplatte gestreamt werden. Das Ergebnis: Ein Modell in Frontier-Klasse, das auf Hardware läuft, die weniger kostet als ein einzelner H100-Lüfter. Die Engine bietet echte Sampling-Unterstützung, spekulative Dekodierung und eine lernende Cache-Optimierung, die das System bei häufiger Nutzung beschleunigt. Perfekt für alle, die große Modelle ohne teure GPUs ausprobieren möchten.
Dies ist nicht schnell. Es ist ein 744B-Modell der Frontier-Klasse, das auf einer Maschine korrekt antwortet, die weniger kostet als ein einzelner H100-Lüfter.