GitHub представил HydraFusion: оркестрация моделей повышает качество на 4,9 п.п. и снижает стоимость на 67%
Project HydraFusion: Frontier quality via multi-model orchestration

GitHub анонсировал HydraFusion — исследовательский предпросмотр, который в рантайме выбирает и комбинирует модели от разных провайдеров для решения задач кодинга. Система сама строит план выполнения: выбирает одну модель, каскад «черновик → проверка → эскалация» или схему с независимым критиком. В офлайн-тестах на TerminalBench 2.1 HydraFusion улучшил качество на 4,9 процентных пункта при снижении стоимости на 67% по сравнению с Claude Opus 5. На DeepSWE и внутреннем CheckpointBench качество почти не уступает Opus 5, но стоимость ниже на 36% и 65% соответственно. Для разработчика HydraFusion выглядит как обычная модель: он сам решает, какой workflow оптимален по качеству, цене и задержке.
Мы считаем, что следующий реальный прирост в агентном кодинге произойдет за счет сочетания передового интеллекта с рантайм-оркестрацией.
- gopalv
Один модель создает результат, а независимый критик, доступный только для чтения, из другой семейства моделей его рецензирует. Ключевое здесь — несколько поставщиков моделей: каскадному паттерну это не нужно, а паттерну критики — нужно.
В ноябре прошлого года моя команда написала статью («Team of Rivals») о разнице между использованием модели OpenAI для критики вывода модели Anthropic и запуском цикла самопроверки у того же поставщика.
Абляции [1] доказали, что ни одна компания по отдельности не превосходит использование обеих.
Статья была общим ответом на вопрос «Что ваша компания делает такого, чего не может Anthropic?», но в большей степени демонстрацией того, как добиться результата с точностью 90%+ с помощью моделей, которые оцениваются примерно в 60% (и пост Gas Town разблокировал наш аргумент о том, что статья является коммерческой тайной).
- Roark66
Я сомневаюсь в их результатах. Не нужно много усилий, чтобы обойти передовые модели в отдельных бенчмарках, если поместить дополнительное ПО между моделью и тестовой средой.
Это также причина, почему сравнение «голых моделей», для которых доступны веса, и передовых моделей, где провайдеры могут делать за кулисами всё, что захотят, несправедливо.
В частности, чтобы поднять Qwen3.8-27B и получить на 10% больше баллов в SWEbench Pro и Terminal Bench 2.0, потребовался лишь прокси с такими базовыми возможностями:
- подстройка нескольких параметров декодирования, например, немного более высокая температура;
- обнаружение, когда модель застревает, и команда «продолжай»;
- обнаружение ответов, обрывающихся на середине, пустых ответов, содержащих только рассуждения, форматов, не прошедших проверку, и т.п., и команда «постарайся лучше».
И всё. На 10% больше. Признаю, на подмножестве задач, но результат есть результат, даже на подмножестве.
- guybedo
Я использую состязательную критику и рецензирование на многих этапах планирования, проектирования решений и реализации в рабочих процессах.
Это настолько эффективно и помогает выявлять так много недостатков в проектировании, пробелов в реализации и т.д., что я задаюсь вопросом, как люди умудряются строить сложные/крупные проекты с агентами без такого процесса. Ну, на самом деле я создал эту штуку, потому что не мог получить хороших результатов, и мне пришлось найти способ.
Я собираюсь открыть исходный код всего этого, но нужно немного прибраться; есть простая целевая страница здесь https://kodfactory.com, если кто-то хочет получить уведомление, когда это будет выпущено на GitHub. Да, я знаю, миру действительно нужна ещё одна программная фабрика :-)