Kontextmanagement entscheidet, wie weit Coding-Agents kommen

An Empirical Study of Harness Design for Coding Agents

Eine Studie auf arXiv untersucht, wie einzelne Komponenten von Coding-Harnesses die Leistung autonomer Coding-Agents beeinflussen. In 176 vergleichbaren Einstellungen mit vier Modellen auf SWE-Bench Verified und Terminal-Bench 2.1 wurden Planung, Aktionsraum und Kontextmanagement variiert. Ergebnis: Kontextmanagement wird wichtiger, je knapper das Kontextfenster ist, und verhindert vor allem Kontextüberläufe. Rule-based Elision vor LLM-Summarization ist am effizientesten. Planung dient schwächeren Modellen als Genauigkeitsgerüst, stärkeren als Kostensparer. Vordefinierte Tools helfen Modellen mit schwächeren Bash-Kenntnissen, während bash-starke Modelle mit einer reinen Bash-Schnittstelle deutlich günstiger arbeiten.

Planung verschiebt sich von einem Genauigkeitsgerüst für schwächere Modelle zu einem Kostensparer für stärkere Modelle, wobei sich die Genauigkeit kaum ändert.

Mehr von diesem Tag

2026-09-18