Snowflake 於 8 月 18 日宣布,將在 Cortex AI Gateway 中加入動態模型路由。這項功能會檢視每一筆請求的內容,把簡單的處理交給較輕量的模型,只有真正需要深度推理的任務才會送往前沿模型。依該公司內部測試,在維持相同品質的前提下,token 效率最高可提升到 3 倍。
只在真正有幫助的時候才動用昂貴模型
企業把 AI 代理推上正式環境之後,往往會用同一個頂級模型跑完所有處理。例行的摘要與複雜的設計判斷,按同樣的單價計費。Snowflake 這次要處理的正是這一段。
Cortex AI Gateway 在 7 月發表,負責統一治理代理的連線、聰明地分派請求,並最佳化 AI 的消耗。加上動態模型路由之後,閘道會針對每一筆請求,自行選出品質與成本平衡最佳的模型。開發團隊不必再逐一為每次呼叫指定模型名稱。
適用範圍不只限於閘道。動態模型路由已內建於該公司的旗艦 AI 產品 Snowflake CoCo 與 Snowflake CoWork,透過 Cortex AI Gateway 接入的第三方 AI 代理同樣能夠使用。
管理者這一側仍保有裁量空間。哪些模型、哪些供應商要開放給自家使用者,都可以指定,這樣的設計是為了因應各地區模型供應狀況不同的跨國企業,以及法規要求嚴格的受管制產業。當模型效能或價格出現變動時,閘道會更新路由判斷,應用程式與代理不需要重建。
dbt 資料流水線提升 3 倍,Pull Request 提升 25%
此次公布的成效有兩個數字,都來自該公司的內部測試。
第一個來自讓代理建置 dbt 資料流水線的評估。與只使用前沿模型的路徑相比,採用動態模型路由後,在維持品質的同時,token 效率最高提升到 3 倍。
第二個更貼近軟體開發的日常:工程團隊在完成同樣數量的 Pull Request 時,token 效率提高了 25%。效率的量測使用 ADE-bench,這是 dbt 開發的框架,用於在實務的分析與資料工程任務上評估 AI 代理。
兩項數字都出自自家測試,該公司也註明結果會隨工作負載與設定而改變。不過,混合使用多種模型能在不犧牲品質的情況下減少 token 消耗這個說法,確實足以讓企業重新檢視對單一高價模型的依賴。
新增 DeepSeek 與 GLM,也公開了開放模型的評測結果
可用的模型同樣在擴充。這次加入 Snowflake Cortex AI 的是 DeepSeek-V4-Flash 0731 與 GLM-5.3。此前平台上已有 Anthropic、OpenAI、Google、SpaceXAI、Meta、Mistral 等供應商的模型,這次再補上開放模型的選項。
值得留意的是,Snowflake 公開了自家 AI 研究團隊的評測數字。DeepSeek-V4-Flash 在資料工程任務上取得 74.4% 的成績,超越評測中所使用的主要專有模型。GLM-5.2 也有 62.8%的表現,而且是所有受測模型中 token 消耗最少的。
該公司表示,與其把每一次開放模型的發表都當成獨立的整合案,不如直接打造一個能跟上開放模型生態演進的環境。模型更替時不必重做應用程式與基礎架構,開放模型與專有模型也適用同一套存取控制與治理規則。
供應狀態分為幾個階段。DeepSeek-V4-Flash 0731 已進入私人預覽,動態模型路由即將進入私人預覽,GLM-5.3 同樣預計進入私人預覽,但該公司註明這項安排可能依模型供應狀況調整。
誰用了多少,可以細到部門層級
成本這件事,並不會因為路由自動化就此結束。Cortex AI Gateway 讓管理者看得見 token 的使用量與成本,也能跨 AI 應用程式與代理設定支出上限。
Snowflake CoCo 把這些能力接到既有的角色存取控制與標籤架構上,管理者可以設定預設模型、把使用量歸屬到團隊或成本中心、為每位使用者設定配額,並在消耗接近上限時收到通知。對於常常搞不清楚 AI 費用出自誰的預算的組織來說,這才是最實際的部分。
該公司執行長 Sridhar Ramaswamy 表示,企業對 AI 的經濟性已經變得嚴謹許多,問題不再是用了多少 AI,而是這些 AI 有沒有轉化成有意義的商業價值。Snowflake 把這樣的想法稱為 intelligence efficiency(智慧效率),用來衡量企業把運算資源、模型、資料與脈絡轉換成商業成果的效率。
分析師 Sanjeev Mohan(SanjMo 創辦人)也指出,企業真正棘手的並不是模型選項太多,而是要為每一項任務持續挑出對的那一個所帶來的營運負擔。
總結
Snowflake 在 Cortex AI Gateway 以及 Snowflake CoCo、Snowflake CoWork 中加入動態模型路由,讓平台能依任務的複雜度自動配對模型。內部測試顯示,建置 dbt 資料流水線時 token 效率最高提升 3 倍,Pull Request 的情境則提升 25%。同時新增 DeepSeek-V4-Flash 0731 與 GLM-5.3,並備妥使用量可視化與部門配額等成本管理工具。這是一項要等代理真正進入正式環境之後,才會顯出價值的更新。
