FrontierHarness Eval - Evaluación integral de 9 harnesses con el mismo modelo

Show HN: FrontierHarness Eval – 9 harness, same model, cost per pass varies 17x

FrontierHarness Eval es una plataforma de evaluación exhaustiva que compara 9 harnesses de codificación en 12 configuraciones, utilizando el mismo modelo (Kimi K3) y entorno de ejecución para garantizar una comparación justa. Con 360 pruebas desde un checkpoint idéntico, ofrece métricas objetivas de tasa de éxito, costo por tarea, velocidad y tasa de caché. Los resultados revelan una variación de 17x en el costo por tarea entre harnesses, destacando opciones como Codex por su calidad (66.7% de éxito) y Exo Harness por su bajo costo ($1.05 por tarea). Ideal para desarrolladores que buscan optimizar sus herramientas de codificación con datos fiables.

La variación de 17x en el costo por tarea entre harnesses demuestra que elegir la herramienta adecuada puede transformar drásticamente la eficiencia y el presupuesto de tus proyectos de codificación.
  1. vidarh

    Probarlo contra Kimi podría estar sesgando los números de forma masiva. Kimi tiene una serie de peculiaridades que requieren comportamientos que, por ejemplo, Claude o GPT no necesitan.

    Los harnesses que están construidos para trabajar con modelos "raros" tendrán que lidiar con eso, como la tendencia de Kimi a quedarse atascado en bucles de llamadas a herramientas.

    Los harnesses construidos principalmente para tratar con modelos como los de Anthropic no necesitan lidiar con eso.

    Afirmar en el blog que esto no le da a Kimi Code ninguna ventaja de local parece una suposición arriesgada. No he profundizado en el último Kimi Code, pero el CLI anterior de Kimi incluía varias herramientas que claramente estaban destinadas a sortear ese comportamiento: cuando copié sus checkpoints y el mecanismo "dmail" en mi propio harness, el rendimiento con Kimi mejoró drásticamente, pero no hizo ninguna diferencia con los modelos de Anthropic.

    Eso no hace que los datos sean inútiles; está claro que no deberías usar Clade Code para trabajar con Kimi. Pero sí limita significativamente su utilidad.

  2. joshheitzman

    Estaba emocionado hasta que vi que el costo solo se proporcionaba como mediana. Tu proveedor te facturará por todas tus tareas y se puede volver a ese total a partir de la media multiplicando por el número de tareas. Esto no es posible con la mediana y sospecho que la mediana probablemente esté por debajo de la media, por lo que subestima los costos reales.

  3. nsingh2

    Un problema que veo con incluir algo como Pi es que está deliberadamente reducido a lo esencial. No creo que nadie use Pi sin algunas extensiones personalizadas básicas (subagentes, listas de verificación, etc.), por lo que este benchmark puede no ser representativo de una configuración realista.

    También sería interesante ver algún tipo de prueba de ablación. Por ejemplo, qué partes de Codex contribuyen más al rendimiento y si se pueden recrear de manera más mínima en algo como Pi.

  4. nijave

    Sería interesante intentar controlar el prompt del sistema, aunque obviamente hay cierto acoplamiento entre lo que proporciona el harness y las instrucciones que recibe el modelo sobre cómo usarlo.

  5. markbao

    Esto es genial. La gente siempre habla de lo importante que es el harness y, sin embargo, tenemos tan pocos benchmarks de harnesses. Estoy de acuerdo con el comentario hermano de que se necesita un 'harness x modelo'.

    La gente siempre dice que el harness de Cursor tiene alguna salsa secreta; me gustaría ver cómo se compara.

    Gracias por hacer esto y llenar un vacío real.

Más de este día

2026-09-02