9 月 11 日,Sakana AI 同時推出多模型調度系統 Sakana Fugu 的兩個新版本:以低成本為重心的 Fugu Max,以及以效能為重心的 Fugu Ultra v2。兩者都不是單一的超大模型,而是依照工作內容,把處理分派給手上的一群模型。Fugu Max 把輸出 token 的單價壓到比競爭產品低 40 至 60%,Fugu Ultra v2 則在多項基準測試中超越了價格高出數倍的模型。
同一套架構,分別走向便宜與強悍
過去十年,AI 產業把資源集中在把模型做得更大這條路上。Sakana AI 的立場不同:真正影響實務工作的是效能與成本這兩個面向,為了完成一次簡單的資料查詢而啟動數兆參數的模型並不聰明,而是浪費。這家公司推動的,是一套不只判斷該如何解決問題,還會判斷用哪一台機器解決最便宜的機制。
這次推出的兩個版本並非各自獨立的產品,而是同一套調度架構針對不同任務所做的最佳化。Fugu Max 回答的是:在成本最低的前提下,能交出的最好結果是什麼。Fugu Ultra v2 回答的是:在複雜且步驟繁多的工作上,能力可以被推到多高。
Fugu Max:可選模型變多,單價往下壓
Fugu Max 大幅擴充了 Fugu 可以分派工作的模型範圍,以前所未有的規模納入開放權重模型與特定用途的專用模型,並透過與 NVIDIA 的合作接上 NVIDIA Nemotron 系列。藉由把工作動態導向足以解決它的最輕量模型,這套設計希望在壓低 token 消耗的同時,取得頂級水準的結果。
價格方面,每百萬輸入 token 為 2 美元(約 310 日圓),每百萬輸出 token 為 6 美元(約 930 日圓)。Sakana AI 表示,這個輸出單價比 Sonnet 5、GPT 5.6 Terra 與 Kimi K3 低 40 至 60%。效能方面,Fugu Max 在包含 Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench 以及該公司自行開發的基準 SWEFish 在內的 6 項基準測試中拿下綜合最高分,並在 10 項基準中的 7 項拓展了成本與效能的效率邊界。
※1 美元 = 155 日圓(截至 2026 年 9 月 11 日)
Fugu Ultra v2:手上沒有頂級模型也能衝上前段
Fugu Ultra v2 針對複雜的多步推理、自主研究,以及軟體開發的完整流程,優先確保輸出品質。它的強項出現在需要持續讀取圖表與結構化資料並反覆推理的那一類工作上。
在檢驗視覺推理與資料解讀的 Chartography,它取得 48.3 分,高於 Opus 5 的 27.3 分與 Fable 5 的 29.5 分。在針對真實軟體工程的 DeepSWE,它取得 74.3 分,超越了每 token 價格高出 3 至 5 倍的模型。在 8 項基準測試中,它有 5 項拿到最高分或並列最高分,7 項進入前兩名。
值得留意的是,這些成績是在調度池中不包含 Fable 5、Fable 5.1 與 GPT-6 Astra 的情況下取得的。如果不必在系統內部握著頂級商用模型也能產出頂級水準的結果,那麼對單一廠商的依賴,以及 API 供應突然中止的風險,都比較容易迴避。Sakana AI 一再強調供應鏈韌性,指的就是這樣的結構。
現有使用者改一行就能轉換
兩個模型在推出當天就能透過標準的 OpenAI 相容 API 使用。已經在運行 Fugu 的使用者,要切換到 Max 或 Ultra v2 只需改寫一行參數,不需要額外的移轉作業。架構換新,API 不變。
Sakana AI 也公開了 Fugu 一路走來的過程。4 月的測試版證明多代理調度可以當成統一的基礎模型運作;6 月的正式提供與 Fugu Ultra v1 顯示調度層能在高難度基準上與閉源頂級模型並駕齊驅;7 月的 Fugu-Cyber 與 Claude Code 介面把它推進到專業領域;8 月則透過 Sakana Chat 擴展到日常消費級使用,並開始整合 NVIDIA 的開放模型。這次推出是這條線的延續。
這些數字該怎麼看
不過,公布的分數大多由 Sakana AI 自行量測,6 項基準中有 1 項(SWEFish)是該公司依照自身開發課題所建立的內部基準。在按自己使用情境設計的指標上拿到高分是很自然的事,因此外部第三方能複現到什麼程度,仍是接下來值得觀察的材料。
調度型架構本身也有讀法。成本優勢成立的前提,是系統能正確看出哪些工作交給輕量模型就足夠;一旦判斷失誤,多餘的往返反而會增加。在比較單價之前,先量一量自己的業務中有多少比例真的屬於輕量處理,才是比較實際的順序。
總結
Sakana AI 從同一套調度架構同時推出以成本為重心的 Fugu Max 與以效能為重心的 Fugu Ultra v2。Fugu Max 每百萬輸出 token 收費 6 美元,比競爭產品低 40 至 60%;Fugu Ultra v2 在 Chartography 取得 48.3 分,在 DeepSWE 取得 74.3 分。在調度池中不含頂級商用模型的前提下達到這個水準,代表除了把模型做大之外還存在另一條路徑。
