GitHub представил HydraFusion: оркестрация моделей повышает качество на 4,9 п.п. и снижает стоимость на 67%

Project HydraFusion: Frontier quality via multi-model orchestration

GitHub представил HydraFusion: оркестрация моделей повышает качество на 4,9 п.п. и снижает стоимость на 67%

GitHub анонсировал HydraFusion — исследовательский предпросмотр, который в рантайме выбирает и комбинирует модели от разных провайдеров для решения задач кодинга. Система сама строит план выполнения: выбирает одну модель, каскад «черновик → проверка → эскалация» или схему с независимым критиком. В офлайн-тестах на TerminalBench 2.1 HydraFusion улучшил качество на 4,9 процентных пункта при снижении стоимости на 67% по сравнению с Claude Opus 5. На DeepSWE и внутреннем CheckpointBench качество почти не уступает Opus 5, но стоимость ниже на 36% и 65% соответственно. Для разработчика HydraFusion выглядит как обычная модель: он сам решает, какой workflow оптимален по качеству, цене и задержке.

Мы считаем, что следующий реальный прирост в агентном кодинге произойдет за счет сочетания передового интеллекта с рантайм-оркестрацией.
  1. gopalv

    Один модель создает результат, а независимый критик, доступный только для чтения, из другой семейства моделей его рецензирует. Ключевое здесь — несколько поставщиков моделей: каскадному паттерну это не нужно, а паттерну критики — нужно.

    В ноябре прошлого года моя команда написала статью («Team of Rivals») о разнице между использованием модели OpenAI для критики вывода модели Anthropic и запуском цикла самопроверки у того же поставщика.

    Абляции [1] доказали, что ни одна компания по отдельности не превосходит использование обеих.

    Статья была общим ответом на вопрос «Что ваша компания делает такого, чего не может Anthropic?», но в большей степени демонстрацией того, как добиться результата с точностью 90%+ с помощью моделей, которые оцениваются примерно в 60% (и пост Gas Town разблокировал наш аргумент о том, что статья является коммерческой тайной).

    [1] - https://github.com/t3rmin4t0r/critique-evals

  2. Roark66

    Я сомневаюсь в их результатах. Не нужно много усилий, чтобы обойти передовые модели в отдельных бенчмарках, если поместить дополнительное ПО между моделью и тестовой средой.

    Это также причина, почему сравнение «голых моделей», для которых доступны веса, и передовых моделей, где провайдеры могут делать за кулисами всё, что захотят, несправедливо.

    В частности, чтобы поднять Qwen3.8-27B и получить на 10% больше баллов в SWEbench Pro и Terminal Bench 2.0, потребовался лишь прокси с такими базовыми возможностями:

    - подстройка нескольких параметров декодирования, например, немного более высокая температура;

    - обнаружение, когда модель застревает, и команда «продолжай»;

    - обнаружение ответов, обрывающихся на середине, пустых ответов, содержащих только рассуждения, форматов, не прошедших проверку, и т.п., и команда «постарайся лучше».

    И всё. На 10% больше. Признаю, на подмножестве задач, но результат есть результат, даже на подмножестве.

  3. guybedo

    Я использую состязательную критику и рецензирование на многих этапах планирования, проектирования решений и реализации в рабочих процессах.

    Это настолько эффективно и помогает выявлять так много недостатков в проектировании, пробелов в реализации и т.д., что я задаюсь вопросом, как люди умудряются строить сложные/крупные проекты с агентами без такого процесса. Ну, на самом деле я создал эту штуку, потому что не мог получить хороших результатов, и мне пришлось найти способ.

    Я собираюсь открыть исходный код всего этого, но нужно немного прибраться; есть простая целевая страница здесь https://kodfactory.com, если кто-то хочет получить уведомление, когда это будет выпущено на GitHub. Да, я знаю, миру действительно нужна ещё одна программная фабрика :-)

Ещё за этот день

2026-09-04