FrontierHarness Eval - Comprehensive harness evaluation platform
Show HN: FrontierHarness Eval – 9 harness, same model, cost per pass varies 17x
FrontierHarness Eval은 동일한 모델과 런타임 환경에서 9개의 AI 코딩 하네스를 12가지 구성으로 테스트한 포괄적인 평가 플랫폼입니다. 모든 360회의 실행은 동일한 콜드 스타트 상태에서 시작되어 공정한 비교를 보장합니다. 품질, 비용, 속도, 캐시 적중률 등 다양한 지표를 제공하여 사용자가 자신의 작업에 가장 적합한 하네스를 선택할 수 있도록 돕습니다. 예를 들어, Codex는 66.7%의 높은 통과율을 보이지만 비용이 높고, Exo Harness는 작업당 1.05달러로 가장 경제적입니다. 이 플랫폼은 하네스 선택에 있어 비용과 품질 사이의 트레이드오프를 명확히 보여줍니다.
동일한 모델과 런타임으로 9가지 하네스를 테스트한 결과, 작업당 비용이 최대 17배까지 차이가 났습니다. 이는 하네스 선택이 비용에 미치는 영향이 얼마나 큰지 보여줍니다.
HN 토론
46- vidarh
Kimi를 대상으로 테스트하면 숫자가 크게 왜곡될 가능성이 있습니다. Kimi는 Claude나 GPT에는 없는 특정 동작을 요구하는 여러 특이한 특성이 있습니다. '이상한' 모델과 함께 작동하도록 구축된 하네스는 Kimi가 도구 호출 루프에 빠지는 경향과 같은 문제를 처리해야 합니다. 주로 Anthropic 모델을 처리하도록 구축된 하네스는 그럴 필요가 없습니다. 블로그에서 이것이 Kimi Code에게 홈 필드 이점을 주지 않는다고 주장하는 것은 위험한 가정으로 보입니다. 최신 Kimi Code를 깊이 파헤치지는 않았지만, 이전 Kimi CLI에는 분명히 이 동작을 해결하기 위한 도구가 여러 개 포함되어 있었습니다. 제 하네스에 그들의 체크포인트와 'dmail' 메커니즘을 복사했을 때 Kimi 성능이 극적으로 향상되었지만 Anthropic 모델에는 전혀 차이가 없었습니다. 그렇다고 데이터가 가치 없는 것은 아닙니다. Clade Code를 Kimi에 사용해서는 안 된다는 것은 분명합니다. 그러나 이것은 그 유용성을 크게 제한합니다.
- joshheitzman
비용이 중앙값으로만 제공된 것을 보고 흥미가 꺾였습니다. 공급업체는 모든 작업에 대해 비용을 청구하며, 평균에 작업 수를 곱하면 총액을 구할 수 있습니다. 중앙값으로는 이 계산이 불가능하며, 중앙값이 평균보다 낮을 가능성이 높아 실제 비용을 과소평가할 것으로 의심됩니다.
- nijave
시스템 프롬프트를 통제하려고 시도하는 것도 흥미로울 것입니다. 물론 하네스가 제공하는 기능과 모델이 받는 사용 지침 사이에는 어느 정도 연관성이 있지만요.
- nsingh2
Pi와 같은 것을 포함할 때의 한 가지 문제는 그것이 의도적으로 최소한의 기능만 갖추고 있다는 것입니다. Pi를 기본적인 맞춤 확장(서브에이전트, 체크리스트 등) 없이 사용하는 사람은 없다고 생각하므로, 이 벤치마크는 현실적인 설정을 대표하지 않을 수 있습니다. 또한 어떤 종류의 절제(ablation) 테스트도 흥미로울 것입니다. 예를 들어, Codex의 어떤 부분이 성능에 가장 크게 기여하는지, 그리고 그것을 Pi와 같은 곳에서 더 최소한으로 재현할 수 있는지 말입니다.
- markbao
훌륭합니다. 사람들은 항상 하네스가 얼마나 중요한지 말하면서도 하네스 벤치마크는 거의 없습니다. 형제 댓글 작성자의 '하네스 x 모델'이 필요하다는 의견에 동의합니다. 사람들은 항상 Cursor 하네스에 비밀 소스가 있다고 말하는데, 그것이 어떻게 비교되는지 보고 싶습니다. 이것을 만들어 실제 격차를 메워 주셔서 감사합니다!