FrontierHarness Eval – Vergleicht 9 Coding-Harnesses fair

Show HN: FrontierHarness Eval – 9 harness, same model, cost per pass varies 17x

FrontierHarness Eval ist eine umfassende Evaluierungsplattform, die neun verschiedene Coding-Harnesses unter identischen Bedingungen testet. Alle 360 Durchläufe starten von demselben frischen Checkpoint, wodurch Warm-Cache-Vorteile ausgeschlossen werden. Mit dem gleichen Modell (Kimi K3) und identischer Laufzeitumgebung auf Runta werden Qualität, Kosten und Geschwindigkeit gemessen. Die Ergebnisse zeigen enorme Unterschiede: Die Kosten pro Aufgabe variieren um das 17-fache, von $1,05 (Exo Harness) bis $18,34 (Claude Code). Codex führt mit 66,7% Bestehensquote, während Exo Harness am kostengünstigsten ist. FrontierHarness Eval bietet neutrale Einblicke für Entwickler, um den optimalen Harness für ihre Bedürfnisse zu wählen.

Die Kosten pro Aufgabe variieren um das 17-fache – eine neutrale Evaluierung ist entscheidend, um die richtige Wahl zu treffen.
  1. vidarh

    Das Testen gegen Kimi könnte die Zahlen massiv verzerren. Kimi hat eine Reihe von Eigenheiten, die Verhaltensweisen erfordern, die z.B. Claude oder GPT nicht haben.

    Harnesses, die darauf ausgelegt sind, mit "seltsamen" Modellen zu arbeiten, müssen damit umgehen, wie z.B. Kimis Tendenz, in Tool-Call-Schleifen stecken zu bleiben.

    Harnesses, die hauptsächlich für die Modelle von z.B. Anthropic entwickelt wurden, müssen damit nicht umgehen.

    Die Behauptung im Blog, dass dies Kimi Code keinen Heimvorteil verschafft, scheint eine gewagte Annahme zu sein. Ich habe mich noch nicht intensiv mit dem neuesten Kimi Code beschäftigt, aber die ältere Kimi-CLI enthielt mehrere Tools, die eindeutig darauf abzielten, dieses Verhalten zu umgehen – als ich ihre Checkpoints und den "dmail"-Mechanismus in meine eigene Harness kopierte, verbesserte sich die Leistung mit Kimi dramatisch, aber es machte keinen Unterschied bei Anthropic-Modellen.

    Das macht die Daten nicht wertlos – es ist klar, dass man Clade Code nicht gegen Kimi verwenden sollte. Aber es schränkt den Nutzen erheblich ein.

  2. joshheitzman

    Ich war begeistert, bis ich sah, dass die Kosten nur als Median angegeben wurden. Dein Anbieter wird dir alle Aufgaben in Rechnung stellen, und man kann von dem Mittelwert zurück auf die Gesamtsumme kommen, indem man ihn mit der Anzahl der Aufgaben multipliziert. Das ist mit dem Median nicht möglich, und ich vermute, dass der Median wahrscheinlich unter dem Mittelwert liegt, sodass die tatsächlichen Kosten unterbewertet werden.

  3. nijave

    Es wäre interessant, zu versuchen, das System-Prompt zu kontrollieren, obwohl es offensichtlich eine Kopplung zwischen dem, was die Harness bietet, und den Anweisungen gibt, die das Modell zur Nutzung erhält.

  4. nsingh2

    Ein Problem, das ich bei der Aufnahme von etwas wie Pi sehe, ist, dass es absichtlich minimalistisch ist. Ich glaube nicht, dass irgendjemand Pi ohne einige grundlegende benutzerdefinierte Erweiterungen (Subagents, Checklisten usw.) verwendet, daher ist dieser Benchmark möglicherweise nicht repräsentativ für ein realistisches Setup.

    Es wäre auch interessant, eine Art Ablationsstudie zu sehen. Z.B. welche Teile von Codex am meisten zur Leistung beitragen und ob sie minimaler in so etwas wie Pi nachgebaut werden können.

  5. markbao

    Das ist großartig. Die Leute reden immer darüber, wie wichtig die Harness ist, und doch gibt es so wenige Harness-Benchmarks. Ich stimme dem anderen Kommentator zu, dass 'Harness x Modell' nötig ist.

    Die Leute reden immer darüber, dass die Cursor-Harness eine geheime Zutat hat; ich würde gerne sehen, wie sie sich schlägt.

    Danke, dass du das gemacht und eine echte Lücke gefüllt hast!

Mehr von diesem Tag

2026-09-02