El contexto, no el modelo, decide cuándo falla un agente de código
An Empirical Study of Harness Design for Coding Agents
Un estudio empírico descompone el harness de coding agents en tres piezas —planificación, espacio de acción y gestión de contexto— y las evalúa por separado en 176 configuraciones sobre SWE-Bench Verified y Terminal-Bench 2.1 con cuatro modelos. La gestión de contexto gana valor a medida que se estrecha la ventana, sobre todo al evitar desbordamientos; la elisión por reglas antes del resumen con LLM resulta la estrategia más eficiente; la planificación pasa de andamio de precisión para modelos débiles a ahorro de coste para los fuertes; y los modelos con buen dominio de bash rinden igual con una interfaz solo-bash a menor coste.
La planificación pasa de ser un andamio de precisión para modelos débiles a un ahorro de coste para modelos fuertes, con poco cambio en la precisión.