Neun Coding-Harnesses gegen deinen Laptop: Warum lokale Modelle scheitern
Nine coding harnesses vs. your laptop

Ein Entwickler testet neun Coding-Harnesses mit einem lokalen Qwen-3.8-27B-Modell auf einem M4 MacBook Pro. Das Ergebnis: Große System-Prompts und Tool-Schemas treiben die Prefill-Zeit auf dem Laptop auf bis zu 226 Sekunden, während sie im Rechenzentrum nur 1,8 Sekunden kostet. Schwere Harnesses wie opencode und crush überlasten die GPU mit parallelen Anfragen. Leichte Harnesses wie pi, mini-swe-agent und chad nutzen den Prefix-Cache zu 96–99 % und bleiben stabil. chads In-Process-MLX-Engine erreicht 17,4 Token/s – mehr als doppelt so viel wie über den Standard-Client-Server-Pfad.
Es ist nicht deine Schuld: Die meisten Coding-Harnesses wurden nicht mit einem lokalen Modell im Hinterkopf entwickelt.
- OleksandrC
Wenn du nach einem Coding-Agenten suchst, der gut in ressourcenbeschränkte Umgebungen passt (etwa Laptops, winzige VPS-Server oder winzige Single-Board-Computer usw.) und auch mit lokalen Modellen hervorragend funktioniert – dann könnte dir auch hax gefallen (https://usehax.dev/). Eine 0,7 MB große dynamisch gelinkte native C-Binary, wenige MBs RAM-Verbrauch im Betrieb, entdeckt die Konfiguration automatisch vom laufenden lokalen llama-server und verwendet einen minimalistischen System-Prompt und Tools für einen schlanken Kontextverbrauch.
- julesrms
Auf HN scheint eine ganze Serie von Agent-Harness-Benchmarks vorbeigezogen zu sein. Und jedes Mal frage ich mich, wo die Leute, die diese Tests erstellen, hinschauen, wenn sie entscheiden, welche Harnesses getestet werden? Denn im Moment scheint sich niemand die Mühe zu machen, meinen zu testen! (https://juggler.studio)
Ich weiß, Juggler ist sehr neu, aber in diesem Bereich geht so viel Umbruch vor sich, dass es schwer zu wissen ist, wo ich ansetzen sollte. Es ist schwer einzuschätzen, ob die Stärken von Juggler bei einem bestimmten Test wie diesem gut zur Geltung gekommen wären oder ob sie ihn schlecht aussehen ließen; jedes Feedback zu der Art von Parametern, an denen die Leute interessiert sind, ist nützlich zu wissen, wenn ich entscheide, was ich optimieren soll.
- alex_john_m
Was soll das bedeuten?
"es breitet sich bis zu 50 % zwischen den Nächten aus, also ist nichts zwischen den Lean-Arms ein Befund."
- toasty228
Etwas off-topic, weil ich keine lokalen Modelle verwende, aber ich habe kürzlich codex vs pi vs omp mit meiner Workload gebenchmarkt und festgestellt, dass codex sowohl schneller als auch token-effizienter als pi/omp ist. Es gab keinen einzigen Fall, in dem pi schneller/günstiger war.
- larodi
Ich sehe dieses Muster, dass viele Leute Qwen 3.8 27B für lokale Inferenz sowohl auf Apple Silicon als auch auf x86 verwenden. Das impliziert, dass das Modell sehr gut sein muss, wenn sich die Meinungen all dieser Leute darauf konvergieren.