GitHubが、複数の提供元のAIモデルを実行時に組み合わせて1つの回答を作る研究プレビュー「Project HydraFusion」を公開しました。下書きを別系統のモデルに批評させたり、手に負えないと判断したら上位モデルへ引き継いだりする動きを、開発者から見えないところで自動的に決めます。社内評価ではClaude Opus 5と同等の品質を保ちながら、推定コストを最大67パーセント下げたとしています。

モデルを選ぶのではなく、解き方を組み立てる

GitHub Copilotには、依頼内容を見て最適なモデルを割り当てるAuto model selectionが先行して用意されていました。HydraFusionはその発想を一段進めたもので、選ぶ対象が単体のモデルではなく作業の進め方そのものになります。1件のリクエストごとに実行計画を作り、複数の提供元にまたがるモデルの中から、下書き役、批評役、必要なら引き継ぎ役を割り当てます。

利用者側の操作は増えません。モデル一覧からHydraFusionを選ぶだけで、あとは品質と費用と応答時間の釣り合いを見ながら、内部で工程が決まります。GitHubはこれを、局所モデルとクラウドモデル、そして複合的なモデルの間を意味的に振り分ける仕組みの一部と位置付けています。

3つの実行パターンを使い分ける

HydraFusionは工程の選択を最適化問題として扱い、推論、コード生成、デバッグ、ツール操作といった能力の指標をもとに、品質の基準を満たす最も軽い進め方を選びます。現時点で用意されているのは次の3種類です。

Singleは、1つのモデルがそのまま解き切る形です。素直な依頼なら余計な工程を挟まないほうが速く、安く済みます。

Cascadeでは、まず効率のよいモデルが下書きを作り、品質のゲートがそれを受け入れるか、より強力なモデルへ引き継ぐかを判断します。簡単な依頼を安く処理しつつ、難しい場合の逃げ道を残す構えです。

Critiqueは、下書きを作ったモデルとは別系統のモデルが読み取り専用の批評役として内容を確認し、そのうえで下書き役が1度だけ書き直します。批評役はツールを持たない隔離された環境で動くため、レビューの過程でリポジトリが書き換わることはありません。

工程の途中で出てくる下書きは、確定するまで利用者には見せない設計です。あとで破棄されるかもしれない内容が完成品に見えてしまう事故を避ける狙いがありますが、待ち時間の見通しが立ちにくいという指摘は社内でも認識されており、進捗表示の改善は今後の課題として挙げられています。

ベンチマークではOpus 5に肉薄しつつコストを圧縮

固定した振り分け方針を、3つのエージェント型コーディング用ベンチマークで評価した結果が公開されています。比較対象はClaude Opus 5とGPT-5.6 Solで、いずれも同じ推論の強さに揃えたうえで、下書き、批評、修正、引き継ぎ、再試行、代替実行まで含めた総額を計上しています。

ベンチマーク Opus 5比のコスト Opus 5比の品質
TerminalBench 2.1 67パーセント減 4.9ポイント増
DeepSWE 36パーセント減 1.5ポイント減
CheckpointBench 65パーセント減 0.1ポイント減

端末上での多段作業を見るTerminalBench 2.1では、品質を上回りながら費用が3分の1に収まりました。大規模なコードベースを横断して修正まで通すDeepSWEでは1.5ポイント届いていませんが、その差でコストが36パーセント下がるなら選ぶ場面はありそうです。CheckpointBenchは実際のCopilotの利用記録から作られた社内用の評価セットで、公開リポジトリと特定のコミットに紐付けて再現できるようにしてあります。

なお振り分けの方針は、しきい値を人手で調整するのではなく、ビームサーチで探索して決めています。8月11日から25日にかけては評価基盤側の不具合で無効な実行が2回発生しており、その分を除外したうえで改善が続いた、という開発経過も併せて示されました。

試せる範囲と使い方

HydraFusionはGitHub Copilotの全プランで利用でき、GitHub Copilot CLIの実験機能として提供されます。料金は使ったモデルのトークン量に応じ、それぞれの通常単価が適用されます。

/update
/experimental on
/model

最後に一覧からHydraFusion (Research Preview)を選べば準備は完了です。現時点で向いているのは、1回のプロンプトで渡し切れる、範囲のはっきりしたコーディング作業とされています。何度もやり取りする長い作業への対応は次の段階に回っており、名称や挙動、提供範囲も研究の進み方によって変わる可能性があります。

まとめ

HydraFusionは、どのモデルが一番強いかを競う話ではなく、複数のモデルをどう組み合わせれば同じ結果を安く出せるかという話です。TerminalBench 2.1で品質を上げながら費用を3分の1にした結果は、その方向にまだ余地があることを示しています。研究プレビューの段階なので数字がそのまま日々の開発に当てはまるとは限りませんが、コーディング支援の競争軸がモデル単体の性能から運用の設計へ広がりつつあることは読み取れます。