Sakana AIが9月11日、複数のAIモデルを束ねて使う「Sakana Fugu」の新版として、低コスト重視の「Fugu Max」と性能重視の「Fugu Ultra v2」を同時公開しました。どちらも単体の巨大モデルではなく、仕事の内容に応じて手持ちのモデル群へ処理を振り分ける仕組みです。Fugu Maxは出力トークンの単価を競合より40から60パーセント低く設定し、Fugu Ultra v2は複数のベンチマークで数倍高価なモデルを上回りました。

同じ設計を「安さ」と「強さ」に振り分けた

AI業界はこの10年、モデルを大きくして性能を伸ばす方向に資源を集めてきました。Sakana AIはこれに対し、実務で効いてくる軸は性能とコストの2つで、単純な検索をするために数兆パラメータのモデルを起動するのは賢さではなく無駄だという立場を取ります。同社が押し出しているのは、問題の解き方だけでなく、その問題にどの機械を当てるのが最も安いかを判断する仕組みです。

今回の2つは別製品ではなく、同じオーケストレーション基盤を異なる目的に最適化したものだと説明されています。Fugu Maxが担うのは「最も安い費用で出せる最良の出力はどこか」という問い、Fugu Ultra v2が担うのは「複雑で手数の多い作業でどこまで能力を引き上げられるか」という問いです。

Fugu Max: 選べるモデルを増やして単価を下げる

Fugu Maxでは、Fuguが振り分け先として使えるモデルの数を大きく広げました。オープンウェイトのモデルと特定用途に特化したモデルを、これまでにない規模で取り込んでおり、NVIDIAとの協業によってNVIDIA Nemotronファミリーも組み込まれています。解ける範囲で最も軽いモデルへ動的に仕事を回すことで、トークン消費を抑えたまま最上位級の結果を狙う設計です。

価格は入力100万トークンあたり2ドル(約310円)、出力100万トークンあたり6ドル(約930円)です。Sakana AIは、この出力単価がSonnet 5、GPT 5.6 Terra、Kimi K3より40から60パーセント安いとしています。性能面では、Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench、および同社内製のSWEFishを含む6つのベンチマークで総合最高スコアを記録し、10のベンチマークのうち7つでコストと性能の効率の限界線を押し広げたと説明しています。

※1ドル155円換算(2026年9月11日時点)

Fugu Ultra v2: 最上位モデルを抱えずに上位へ

一方のFugu Ultra v2は、複雑な多段推論や自律的な調査、ソフトウェア開発の一連の工程といった用途で、出力品質を優先した構成です。強みが出るのは、図表や構造化されたデータを読み込んで考え続ける種類の作業だといいます。

視覚的な推論とデータ解釈を測るChartographyでは48.3点を記録し、Opus 5の27.3点、Fable 5の29.5点を上回りました。実際のソフトウェア開発を対象としたDeepSWEでは74.3点で、トークン単価が3倍から5倍高いモデルを超えたとしています。8つのベンチマークのうち5つで最高または同率最高、7つで上位2位以内に入ったという整理です。

注目したいのは、この結果をFable 5、Fable 5.1、GPT-6 Astraを振り分け先に含めずに出しているという点です。最上位の商用モデルを内部に抱えなくても最上位級の出力が作れるのであれば、特定ベンダーへの依存や、API提供の突然の終了といったリスクから距離を取れます。Sakana AIが供給網の強靭さを繰り返し強調しているのは、この構造を指しています。

既存ユーザーは1行の変更で移行できる

2つのモデルは公開と同時に、OpenAI互換のAPIから利用できます。すでにFuguを動かしている場合、MaxやUltra v2への切り替えはパラメータを1行書き換えるだけで済み、移行作業は不要とされています。アーキテクチャは新しくなってもAPIは変わらないという整理です。

Sakana Fuguの歩みも公開されました。4月にベータとしてマルチエージェントのオーケストレーションが単一の基盤モデルとして機能することを示し、6月に一般提供とFugu Ultra v1でクローズドな最上位モデルに並ぶ水準を示しました。7月にはFugu-CyberとClaude Code向けのインターフェースで専門領域への適用を進め、8月にはSakana Chatで日常利用へ広げつつ、NVIDIAのオープンモデルの統合を開始しています。今回の公開はその延長線上にあります。

数字の読み方に注意したい点

もっとも、示されたスコアの大半はSakana AI自身による計測であり、6つのうち1つ(SWEFish)は同社が自社の開発課題を反映して作った内製ベンチマークです。自社の使い方に合わせて設計した指標で高い数値が出るのは自然なことなので、外部の第三者による再現がどこまで揃うかは今後の材料になります。

振り分け型の仕組みそのものにも読み方があります。安さは「軽いモデルで足りる仕事を正しく見抜けた場合」に効く性質のもので、判断を誤れば余計な往復が増えます。自分の業務でどの程度の割合が軽い処理に落ちるのかを測ってから、単価の比較に進むのが現実的でしょう。

まとめ

Sakana AIは、同じオーケストレーション基盤からコスト重視のFugu Maxと性能重視のFugu Ultra v2を同時に公開しました。Fugu Maxは出力100万トークン6ドルで競合より40から60パーセント安く、Fugu Ultra v2はChartographyで48.3点、DeepSWEで74.3点を記録しています。最上位の商用モデルを振り分け先に含めずにこの水準へ届いた点は、モデルを大きくする以外の道筋を示す結果と言えます。