Coding Agent 的 Harness 设计实证研究
An Empirical Study of Harness Design for Coding Agents
这篇研究深入剖析了 Coding harness 如何决定自主编码 Agent 的长期工程表现。研究固定执行循环,单独测试了 planning、action space 和 context management 三个组件。在 SWE-Bench Verified 和 Terminal-Bench 2.1 上,通过 176 组匹配设置对比发现:当 context-window 预算收紧时,context management 的价值凸显,主要防止溢出失败;先规则后 LLM 的摘要策略效率最高;planning 对弱模型是精度支架,对强模型则是成本节省器;bash 能力强的模型用纯 bash 接口成本更低。轨迹分析揭示了各组件对执行路径的具体影响,为模型和预算感知的 harness 设计提供了模块化框架。
Planning 从弱模型的精度支架转变为强模型的成本节省器,而精度几乎没有变化。