Snowflakeが8月18日、Cortex AI Gatewayに動的モデルルーティングを追加すると発表しました。リクエストの中身を見て、簡単な処理は軽いモデルへ、深い推論が要る処理だけをフロンティアモデルへ振り分ける仕組みです。社内検証では、同じ品質を保ったままトークン効率が最大3倍になったとしています。
高価なモデルを「効いているときだけ」使う
企業がAIエージェントを本番に載せていくと、どうしても同じ最上位モデルであらゆる処理を回すことになりがちです。定型的な要約も、込み入った設計判断も、同じ単価で処理される。Snowflakeが今回手を入れたのは、まさにその部分です。
Cortex AI Gatewayは7月に発表された基盤で、エージェントの接続を統制し、リクエストを振り分け、AIの消費量を最適化する役割を担ってきました。ここに動的モデルルーティングが乗ることで、リクエストごとに品質とコストのバランスが最も良いモデルをゲートウェイ側が選ぶようになります。開発チームがリクエスト単位でモデル名を書き分ける必要はありません。
適用先はゲートウェイだけに留まりません。Snowflake CoCoとSnowflake CoWorkという同社の主力AI製品にも組み込まれ、Cortex AI Gatewayを経由するサードパーティ製エージェントからも利用できます。
管理者側の裁量も残されています。どのモデル、どのプロバイダーを自社のユーザーに開放するかは指定でき、地域ごとにモデルの提供状況が異なる多国籍企業や、コンプライアンス要件が厳しい規制業種を想定した作りになっています。モデルの性能や価格が変わったときは、ゲートウェイ側がルーティングの判断を更新するため、アプリやエージェントを作り直す必要はないとしています。
dbtのパイプライン構築で3倍、プルリクエストで25パーセント
効果として示されたのは2つの数字です。いずれも同社の社内検証によるものです。
1つ目は、エージェントにdbtのデータパイプラインを構築させた評価です。フロンティアモデルだけで処理する経路と比べ、動的モデルルーティングを使った場合は品質を維持したままトークン効率が最大3倍になったとしています。
2つ目はソフトウェア開発の現場に近い数字で、エンジニアリングチームが同じ本数のプルリクエストを、25パーセント高いトークン効率で完了したというものです。効率の測定にはADE-benchが使われています。これはdbtが作ったフレームワークで、実務のアナリティクスやデータエンジニアリングの課題でAIエージェントを評価するものです。
いずれも自社テストの結果であり、条件や構成によって数字が変わる旨は同社も注記しています。とはいえ、モデルを混ぜて使うと品質を落とさずにトークンが減るという主張は、単価の高いモデルへの一極集中を見直す材料にはなりそうです。
DeepSeekとGLMを追加、オープンモデルの評価も公開
同時に、Cortex AIで使えるモデルも増えます。追加されるのはDeepSeek-V4-Flash 0731とGLM-5.3です。既にAnthropic、OpenAI、Google、SpaceXAI、Meta、Mistralといった提供元のモデルが並んでおり、そこにオープンモデルの選択肢が加わる形になります。
興味深いのは、Snowflakeが自社のAIリサーチチームによる評価結果を数字で出している点です。DeepSeek-V4-Flashはデータエンジニアリングの課題で74.4パーセントを記録し、評価に使った主要なプロプライエタリモデルを上回ったとしています。GLM-5.2も62.8パーセントと健闘し、テストした中で最も少ないトークン数で処理したという結果でした。
同社は、オープンモデルのリリースを1つずつ個別の統合案件として扱うのではなく、次々と出てくる新モデルに追随できる環境そのものを作る方針を掲げています。モデルが入れ替わってもアプリや基盤を組み直さずに済み、オープンとプロプライエタリの両方に同じアクセス制御とガバナンスをかけられる、という整理です。
なお提供状況には段階があります。DeepSeek-V4-Flash 0731は既にプライベートプレビューに入っており、動的モデルルーティングはまもなくプライベートプレビュー、GLM-5.3もまもなくプライベートプレビューの予定ですが、モデルの提供状況次第で変わる可能性があると注記されています。
誰がどれだけ使ったかを、部門単位で追える
コストの話は、振り分けの自動化だけでは終わりません。Cortex AI Gatewayは管理者に対してトークンの使用量とコストの可視性を提供し、AIアプリやエージェントをまたいだ支出上限を設定できるようにしています。
Snowflake CoCoはこれを既存のロールベースアクセス制御とタグ付けの枠組みに接続し、既定のモデルを決める、使用量をチームやコストセンターに割り当てる、ユーザーごとの割当量を設ける、上限に近づいたら通知を出す、といった運用を可能にします。AIの費用が誰の予算から出ているのか分からなくなりがちな組織にとっては、実務的な部分です。
同社CEOのSridhar Ramaswamy氏は、企業がAIの経済性に対してかなり厳密になってきており、問いは「どれだけAIを使っているか」ではなく「そのAIが意味のあるビジネス価値に変わっているか」に移ったと述べています。Snowflakeはこの考え方をintelligence efficiency(知能効率)と呼び、計算資源、モデル、データ、コンテキストをどれだけ効率よくビジネスの成果へ変えられているかを測る指標として位置づけています。
アナリストのSanjeev Mohan氏(SanjMo創業者)も、企業が困っているのはモデルの選択肢の多さそのものではなく、あらゆるタスクに対して適切な1つを選び続ける運用負荷のほうだと指摘しています。
まとめ
Snowflakeは、Cortex AI GatewayとSnowflake CoCo、Snowflake CoWorkに動的モデルルーティングを追加し、タスクの複雑さに応じてモデルを自動で選ぶ仕組みを整えました。社内検証ではdbtパイプラインの構築で最大3倍、プルリクエストで25パーセントのトークン効率改善を報告しています。あわせてDeepSeek-V4-Flash 0731とGLM-5.3が加わり、使用量の可視化や部門別の割当といったコスト管理の道具も揃います。エージェントを本番運用に載せる段階で効いてくる更新と言えそうです。
