博通(Broadcom)发布了 VMware Private AI Cloud,这是一套让企业在自有基础设施上运行 AI 推理与 AI 智能体的平台。它的出发点是不把敏感数据送往外部模型服务商,而是把模型搬到数据已经存放的地方。该发布在美国拉斯维加斯举行的年度活动 VMware Explore 上公布,通过验证的模型清单中还出现了 NEC 面向日语优化的模型。

不搬数据,搬模型

企业把 AI 推向生产环境时,第一道坎往往不是性能,而是数据的落脚点。客户信息、设计资料能不能直接送进外部 API,在部分行业里这个问题一提出来就没有下文了。VMware Private AI Cloud 把顺序反过来,把模型拉进企业内部封闭的环境。

它的构成是对既有产品的重新整合。底座是 VMware Cloud Foundation 9,再叠加面向 AI 的 VMware AI Factory、承载应用与智能体的 VMware Tanzu Platform、负责网络防护的 VMware vDefend,以及做负载均衡的 VMware Avi Load Balancer。推理、智能体、容器和传统虚拟机由此纳入同一套运维体系。博通基础设施软件事业部总裁 Ram Velaga 表示,这是私有云与私有 AI 基础设施汇合到一起的结果。

博通自己的调研显示,已经在私有云上运行生产推理、或计划这样做的企业占到 56%。换个角度看,越是走出试验阶段的组织,越倾向于把这部分工作留在内部。

把看不见的 Token 开销搬到运维面板上

博通点名要处理的成本有 3 项:硬件采购、运维复杂度,以及随用量不断累积的 Token 消耗。第 3 项是传统虚拟化平台没有考虑过的科目,从试点走向生产的那一刻就会显现出来。

VMware Cloud Foundation 9 引入了把高速 NVMe 存储当作内存延伸的分层机制,以及跨集群的存储去重。面对大模型对内存和存储的高占用,它选择先提升效率,而不是直接堆硬件。平台同时支持 CPU、GPU 及其他加速器混合部署,企业可以按供货情况和价格挑选设备,不必被单一配置绑住。

运维层面提供了跟踪模型使用情况的 Token 监控、让多个部门或应用共用同一模型服务的多租户机制、GPU 与 vGPU 分配情况的可视化,以及把这些指标汇总起来的仪表板。谁用了哪个模型、用了多少能在管理界面上查到,内部计费和额度设置才有落地的可能。

性能方面,博通援引依据 MLPerf Inference v5.1 的第三方测试,称 VCF 达到了与裸金属相当的水平。言下之意是,企业不必因为担心虚拟化拖慢速度而另建一套裸金属 AI 环境。

通过验证的模型清单里出现了日语专用的 cotomi

这次发布最直观的一点,是把完成验证的模型逐一点名。博通表示 VMware Cloud Foundation 上可运行超过 150 个开源与商用模型,并将谷歌、英伟达、NEC、阿里云、Z.ai 的模型列为已验证。

  • 英伟达 Nemotron 3:采用 Mamba 与 Transformer 混合的 Mixture-of-Experts 架构的多模态开放模型族,上下文长度最高 100 万 Token,面向长时间运行的智能体
  • 谷歌 DeepMind Gemma 4:权重开放的多模态模型族,适合希望在自有环境中搭建自主智能体的场景
  • NEC cotomi:面向日语优化的模型。博通称其 Token 效率提升 40%
  • 阿里云 Qwen 3.7-Max:具备 100 万 Token 上下文的商用多模态模型,面向多模态推理与智能体用途
  • Z.ai GLM 5.2:面向本地编码与推理智能体的开源模型

推理执行层采用 vLLM,让受支持的模型可以按统一方式提供。由此,把模型以 Model-as-a-Service 的形式分发给内部用户就变得现实可行。对日本的组织而言,承担日语处理的模型进入已验证名单,是一个具体的判断依据。

智能体从零权限开始

自主智能体会解读指令、自行查询数据、调用工具,并向外部系统伸手。与传统应用不同,它有超出预期范围行动的余地,权限设计一旦出错,既可能造成信息泄露,也可能让预算失控。

Tanzu Platform 对此采用默认拒绝的运行模型。API、网络、MCP 服务器和互联网,智能体一开始都看不到,只有明确授予的才能使用。凭据放在隔离的存储区,不交给智能体本身,从源头切断了通过提示注入套取凭据的路径。

在其之上是新发布的管理平面 AgentMinder。它把智能体当作和员工一样的独立身份来对待,将任务、可用工具和可访问资源绑定在一起管理。运行时按最小权限原则控制工具调用,行为也会留下审计记录。当各部门的智能体不断增加时,没有这样一份台账,状况就很难掌握。

网络侧由 vDefend 负责微分段与虚拟补丁,并通过流量走向发现未经许可的 AI 使用。Avi Load Balancer 在 WAF 与 API 防护之外,还承担识别智能体接近越权工具及异常行为的职责。管理开源来源的 TrueSource 也得到扩展,除 Java、Python、Node.js 之外,PostgreSQL、RabbitMQ、MySQL、Valkey 等数据基础组件也纳入了覆盖范围。

供应时间

AgentMinder 已经开始提供。在 VMware Explore 上发布的 Tanzu Platform 新功能群,计划于 2026 年秋季正式提供。

总结

VMware Private AI Cloud 不是一场发布新模型的活动,而是把既有模型在企业内部安全运行、且成本可以算清楚的底座重新整合了一遍。点名已验证模型、让 Token 消耗可见、对智能体默认拒绝,这 3 点谈的都不是试验而是运维,越是拥有自建基础设施的企业,越容易把它放上评估清单。实际好不好用,还要看今年秋季正式提供之后陆续出现的落地案例。