picchio entlarvt stille CPU-Fallback und falsche tok/s-Angaben bei lokalen LLMs
Same model, same Q4_K_M label: 5.02, 5.07 and 5.27 bits per weight
Das Open-Source-Tool picchio (eine einzelne Python-Datei, keine Abhängigkeiten) misst lokale LLMs präzise: effektive Bits pro Gewicht, getrennte Prefill-, Decode- und Wallclock-Geschwindigkeiten sowie stille CPU-Fallbacks. Es deckt auf, dass dieselbe Modell-Quantisierung (Q4_K_M) je nach Quantizer zwischen 5,02 und 5,27 Bits pro Gewicht variiert und dass ein einzelner tok/s-Wert oft irreführend ist. picchio vergleicht Engine-Logs mit GPU-Messwerten des Betriebssystems und gibt ein klares Urteil ab, ob die GPU tatsächlich gearbeitet hat. Verfügbar für llama.cpp und ollama, mit Befehlen wie Diagnose, Vergleich und Überwachung.
Ein Mac-Screenshot mit 500 tok/s ist fast immer Prefill.