FrontierHarness Eval - Comprehensive harness evaluation platform
Show HN: FrontierHarness Eval – 9 harness, same model, cost per pass varies 17x
FrontierHarness Eval — это платформа для всестороннего сравнения агентных обвязок (harness) для программирования. Она позволяет оценить 9 различных обвязок в 12 конфигурациях на идентичных задачах с одной и той же моделью и окружением. Благодаря холодным запускам и нейтральным условиям, результаты объективны. Выявляет значительные различия в стоимости и качестве: например, стоимость за задачу варьируется в 17 раз, а лучшая обвязка (Codex) достигает 66.7% прохождения, в то время как самая дешевая (Exo Harness) стоит всего $1.05 за задачу. Платформа помогает разработчикам выбирать оптимальные инструменты для своих задач.
Одинаковая модель, одинаковые задачи, но стоимость прохождения варьируется в 17 раз — FrontierHarness Eval показывает, что выбор обвязки может быть важнее выбора модели.
- vidarh
Тестирование на Kimi может сильно исказить цифры. У Kimi есть ряд особенностей, требующих поведения, которого нет, например, у Claude или GPT. Харнессы, созданные для работы со "странными" моделями, должны учитывать это, например, склонность Kimi зацикливаться в циклах вызова инструментов. Харнессам, созданным в первую очередь для работы с моделями Anthropic, не нужно с этим справляться. Утверждение в блоге, что это не дает Kimi Code преимущества своего поля, выглядит сомнительным. Я не углублялся в новейший Kimi Code, но в более старом Kimi CLI было несколько инструментов, явно предназначенных для обхода этого поведения — когда я скопировал их чекпоинты и механизм "dmail" в свой харнесс, производительность с Kimi резко возросла, но на моделях Anthropic это не дало никакого эффекта. Это не делает данные бесполезными — ясно, что не стоит использовать Clade Code для работы с Kimi. Но это существенно ограничивает их полезность.
- joshheitzman
Я был воодушевлен, пока не увидел, что стоимость указана только как медиана. Ваш провайдер выставит счет за все ваши задачи, и можно получить общую сумму из среднего, умножив его на количество задач. С медианой это невозможно, и я подозреваю, что медиана, скорее всего, ниже среднего, так что реальные затраты занижаются.
- nsingh2
Одна проблема, которую я вижу во включении чего-то вроде Pi, заключается в том, что он намеренно минималистичен. Я не думаю, что кто-то использует Pi без базовых пользовательских расширений (субагенты, чек-листы и т.д.), так что этот бенчмарк может быть не показателен для реальной конфигурации. Было бы интересно также провести абляционный тест. Например, какие части Codex вносят наибольший вклад в производительность, и можно ли их воссоздать более минималистично в чем-то вроде Pi.
- nijave
Было бы интересно попытаться контролировать системный промпт, хотя, очевидно, есть некоторая связь между тем, что предоставляет харнесс, и инструкциями, которые модель получает по его использованию.
- markbao
Это отлично. Люди постоянно говорят о том, как важен харнесс, и при этом у нас так мало бенчмарков для харнессов. Согласен с комментатором выше, что нужен бенчмарк "харнесс × модель". Люди постоянно говорят, что у харнесса Cursor есть какой-то секретный соус; хотелось бы увидеть, как он покажет себя. Спасибо, что сделали это и заполнили реальный пробел!