GitHubがHydraFusionを発表:複数モデルを自動編成し、Claude Opus 5比67%のコスト削減を実現

Project HydraFusion: Frontier quality via multi-model orchestration

GitHubがHydraFusionを発表:複数モデルを自動編成し、Claude Opus 5比67%のコスト削減を実現

GitHubは、複数のAIモデルを実行時に自動で編成する研究プレビュー「Project HydraFusion」を発表した。タスクに応じてモデルを選択するだけでなく、ドラフト作成、批評、修正、エスカレーションを含む実行プランを動的に構築し、品質とコストのバランスを最適化する。3つのエージェントコーディングベンチマークでの評価では、Claude Opus 5と同等以上の品質を維持しつつ、推定コストを最大67%削減した。

コーディングエージェントにおける次の真の進歩は、フロンティアインテリジェンスとランタイムオーケストレーションの組み合わせから生まれると信じています。
  1. gopalv

    > あるモデルが結果をドラフトし、別のモデルファミリーの独立した読み取り専用の批評家がそれをレビューする

    ここで重要なのは複数のモデルベンダーを使うことです。カスケードパターンにはそれは必要ありませんが、批評パターンには必要です。

    昨年11月、私のチームは、OpenAIのモデルを使ってAnthropicのモデルの出力を批評する場合と、同じベンダーで自己レビューエージェントループを実行する場合の違いについて論文(「Team of Rivals」)を書きました。

    アブレーション研究[1]により、どちらか一方の会社だけを使うよりも、両方を使う方が優れていることが証明されました。

    この論文は、「あなたの会社はAnthropicにできない何ができるのか」という問いに対する一般的な回答でしたが、それ以上に、評価で60%程度のモデルを使って90%以上の成果を上げる方法のデモンストレーションでした(そして、Gas Townの投稿が、この論文に関する「これは営業秘密だ」という私たちの主張のブロックを解除しました)。

    [1] - https://github.com/t3rmin4t0r/critique-evals

  2. Roark66

    彼らの結果には疑問を感じています。モデルとハーネスの間に追加のソフトウェアを挟めば、単一のベンチマークでフロンティアモデルを上回るのは難しくありません。

    これは、ウェイトが公開されている「裸のモデル」と、プロバイダーが舞台裏で何でもできるフロンティアモデルを比較することが不公平である理由でもあります。

    具体的には、Qwen3.8-27BをSWEbench ProとTerminal Bench 2.0で10%ポイント向上させるのに、以下の基本機能だけを備えたプロキシで十分でした:

    - わずかに高い温度など、いくつかのデコード設定を微調整する

    - モデルが行き詰まったことを検出し、「続けて」と指示する

    - 途中で切れた応答、推論のみを含む空の応答、検証に合格しない形式などを検出し、「もっとうまくやれ」と指示する

    そして、それだけです。10%向上しました。タスクのサブセットに限られることは認めますが、結果は結果です。サブセットであっても。

  3. guybedo

    私はワークフロー内の多くの計画、ソリューション設計、実装ステップで敵対的批評とレビューを使ってきました。

    それは非常に効果的で、多くの設計上の欠陥や実装の見落としなどを発見するのに役立つので、この種のプロセスなしでエージェントを使って複雑/大規模なプロジェクトをどのように構築しているのか疑問に思うほどです。まあ、実際、私は良い結果が得られなかったので、この方法を見つけなければならず、この仕組みを構築しました。

    全体をオープンソース化する予定ですが、少しクリーンアップが必要です。GitHubで公開されたときに通知を受け取りたい人のために、基本的なランディングページがここにあります: https://kodfactory.com。ええ、わかっています、世界は本当に別のソフトウェアファクトリーを必要としているのです :-)

この日のほかの記事

2026-09-04