GitHub presenta HydraFusion: orquestación de modelos que iguala a Opus 5 con un 67% menos de costo

Project HydraFusion: Frontier quality via multi-model orchestration

GitHub presenta HydraFusion: orquestación de modelos que iguala a Opus 5 con un 67% menos de costo

GitHub ha presentado Project HydraFusion, una vista previa de investigación que orquesta múltiples modelos de IA en tiempo de ejecución para ofrecer calidad de frontera en tareas de codificación. HydraFusion selecciona automáticamente entre tres patrones de ejecución —single, cascade y critique— según la tarea, equilibrando rendimiento, costo y latencia. En evaluaciones comparativas, logró una calidad superior a Claude Opus 5 en TerminalBench 2.1 (+4.9 puntos) con un costo estimado un 67% menor, y se mantuvo a la par en otros benchmarks con reducciones de costo de hasta el 65%. El sistema aprende de sesiones reales de GitHub Copilot y promete simplificar la elección de modelos para los desarrolladores.

HydraFusion trata la selección del flujo de trabajo como un problema de optimización: utiliza señales de capacidad para razonamiento, generación de código, depuración y uso de herramientas para elegir el patrón de ejecución más eficiente que cumpla con el estándar de calidad.
  1. gopalv

    > Un modelo redacta un resultado, un crítico independiente de solo lectura de otra familia de modelos lo revisa

    Aquí es clave tener múltiples proveedores de modelos; el patrón de cascada no lo necesita, pero el patrón de crítica sí.

    En noviembre pasado, mi equipo escribió un artículo ("Team of Rivals") sobre la diferencia entre usar un modelo de OpenAI para criticar la salida de un modelo de Anthropic versus ejecutar un bucle de auto-revisión con el mismo proveedor.

    Las ablaciones [1] demostraron que ninguna empresa por sí sola era mejor que usar ambas.

    El artículo fue una respuesta general a "¿Qué hace tu empresa que Anthropic no pueda?" pero más que nada una demostración de cómo lograr algo 90%+ bueno con modelos que evalúan en un 60% más o menos (y el post de Gas Town desbloqueó nuestro argumento de "esto es un secreto comercial" sobre el artículo).

    [1] - https://github.com/t3rmin4t0r/critique-evals

  2. Roark66

    Cuestiono sus resultados. No se necesita mucho para superar a la frontera en benchmarks individuales si uno pone software extra entre el modelo y el arnés.

    Esta es también una razón por la que comparar "modelos desnudos" cuyos pesos están disponibles con la frontera donde los proveedores pueden hacer lo que quieran detrás de escena es injusto.

    Específicamente, todo lo que se necesitó para impulsar a Qwen3.8-27B a obtener un 10% más de puntos en SWEbench Pro y Terminal Bench 2.0 con un proxy que solo tiene estos conceptos básicos:

    - ajusta algunas configuraciones de decodificación como una temperatura ligeramente más alta

    - detecta cuando el modelo se atasca y le dice "continúa"

    - detecta respuestas cortadas a la mitad, respuestas vacías que contienen solo razonamiento, formatos que no pasan la verificación, etc., y le dice al modelo "inténtalo mejor"

    Y eso es todo. 10% más. Admito que en un subconjunto de tareas, pero los resultados son resultados, incluso en un subconjunto.

  3. guybedo

    He estado usando crítica y revisiones adversariales para muchos pasos de planificación, diseño de soluciones e implementación dentro de flujos de trabajo.

    Es tan efectivo y ayuda a detectar tantos defectos de diseño, fallos de implementación, etc... que me pregunto cómo logra la gente construir proyectos complejos/grandes con agentes sin este tipo de proceso. Bueno, en realidad construí esto porque no podía obtener buenos resultados, así que tuve que encontrar una manera.

    Voy a abrir todo el código, pero necesita una limpieza; hay una página de aterrizaje básica aquí https://kodfactory.com si alguien quiere ser notificado cuando se publique en GitHub. Sí, lo sé, el mundo realmente necesita otra fábrica de software :-)

Más de este día

2026-09-04