Snowflake 于 8 月 18 日宣布,将在 Cortex AI Gateway 中加入动态模型路由。该功能会检查每个请求的内容,把简单的处理交给更轻量的模型,只有真正需要深度推理的任务才会送往前沿模型。据该公司内部测试,在保持同等质量的前提下,令牌效率最高提升到 3 倍。

只在真正有效的时候才动用昂贵模型

企业把 AI 智能体推向生产环境之后,往往会用同一个顶级模型跑完所有处理。常规的摘要和复杂的设计判断,按同样的单价计费。Snowflake 这次要解决的正是这个问题。

Cortex AI Gateway 于 7 月发布,承担着统一治理智能体连接、智能路由请求、优化 AI 消耗的角色。加入动态模型路由后,网关会针对每个请求,自行选出质量与成本平衡最佳的模型。开发团队不必再为每次调用逐一指定模型名称。

适用范围并不止于网关。动态模型路由已经内建到该公司的旗舰 AI 产品 Snowflake CoCo 和 Snowflake CoWork 中,通过 Cortex AI Gateway 接入的第三方 AI 智能体同样可以使用。

管理员一侧仍保留了控制权。哪些模型、哪些供应商对本企业用户开放,都可以指定,这一设计面向的是需要应对各地区模型供应差异的跨国企业,以及合规要求严格的受监管行业。当模型性能或价格发生变化时,网关会更新路由判断,应用和智能体无需重建。

dbt 流水线提升 3 倍,拉取请求提升 25%

此次公布的效果有两个数字,均来自该公司内部测试。

第一个来自让智能体构建 dbt 数据流水线的评估。与只使用前沿模型的路径相比,采用动态模型路由后,在保持质量的同时令牌效率最高提升到 3 倍。

第二个更贴近软件开发的日常:工程团队在完成同样数量的拉取请求时,令牌效率提高了 25%。效率测量使用的是 ADE-bench,这是 dbt 开发的框架,用于在真实的分析与数据工程任务上评估 AI 智能体。

两项数字都来自自家测试,该公司也注明结果会随工作负载和配置而变化。不过,混合使用多种模型能够在不牺牲质量的情况下减少令牌消耗这一说法,足以让企业重新审视对单一高价模型的依赖。

新增 DeepSeek 与 GLM,并公开了开放模型的评测结果

可用模型也在扩充。此次加入 Snowflake Cortex AI 的是 DeepSeek-V4-Flash 0731 和 GLM-5.3。此前该平台已经汇集了 Anthropic、OpenAI、谷歌、SpaceXAI、Meta、Mistral 等供应商的模型,这次又补上了开放模型的选项。

值得注意的是,Snowflake 公开了自家 AI 研究团队的评测数字。DeepSeek-V4-Flash 在数据工程任务上取得 74.4% 的成绩,超过了评测中所用的主要专有模型。GLM-5.2 也有 62.8%的不俗表现,而且是所有受测模型中令牌消耗最少的。

该公司表示,与其把每一次开放模型的发布都当作一个独立的集成项目,不如直接搭建一个能够跟上开放模型生态演进的环境。模型更替时不必重做应用和基础设施,开放模型与专有模型也适用同一套访问控制和治理规则。

供应状态分为几个阶段。DeepSeek-V4-Flash 0731 已进入私有预览,动态模型路由即将进入私有预览,GLM-5.3 同样计划进入私有预览,但该公司注明这一安排可能随模型供应情况调整。

谁用了多少,可以细化到部门

成本这件事,并不会因为路由自动化就此打住。Cortex AI Gateway 向管理员提供令牌用量与成本的可见性,并支持跨 AI 应用和智能体设定支出上限。

Snowflake CoCo 把这些能力接入既有的基于角色的访问控制与标签框架,管理员可以设定默认模型、把用量归属到团队或成本中心、为每位用户设置配额,并在消耗接近上限时收到通知。对于常常搞不清 AI 费用出自谁的预算的组织来说,这才是最实用的部分。

该公司首席执行官 Sridhar Ramaswamy 表示,企业对 AI 的经济性变得严格得多,问题已经从用了多少 AI,转向这些 AI 是否转化为有意义的业务价值。Snowflake 把这种思路称为 intelligence efficiency(智能效率),用来衡量企业把算力、模型、数据和上下文转化为业务成果的效率。

分析师 Sanjeev Mohan(SanjMo 创始人)也指出,企业真正头疼的并不是模型选项太多,而是要为每一项任务持续挑出合适那一个所带来的运营负担。

总结

Snowflake 在 Cortex AI Gateway 以及 Snowflake CoCo、Snowflake CoWork 中加入动态模型路由,让平台能够按任务复杂度自动匹配模型。内部测试显示,构建 dbt 流水线时令牌效率最高提升 3 倍,拉取请求场景提升 25%。同时新增 DeepSeek-V4-Flash 0731 和 GLM-5.3,并配套了用量可视化与部门配额等成本管理工具。这是一项在智能体真正进入生产阶段后才会显出价值的更新。