Broadcom 發表了 VMware Private AI Cloud,這是一套讓企業在自有基礎架構上執行 AI 推論與 AI 代理的平台。它的出發點是不把機密資料送到外部的模型供應商,而是把模型帶到資料原本存放的位置。這項發表是在美國拉斯維加斯舉辦的年度活動 VMware Explore 上公布,通過驗證的模型清單中也出現了 NEC 針對日語最佳化的模型。

不搬資料,改搬模型

企業要把 AI 推上正式營運時,第一道關卡往往不是效能,而是資料要放在哪裡。客戶資訊、設計文件能不能直接送進外部 API,在某些產業裡光是提出這個問題就談不下去了。VMware Private AI Cloud 把順序反過來,改成把模型拉進企業內部封閉的環境。

內容則是既有產品的重新整併。底層是 VMware Cloud Foundation 9,再搭配面向 AI 的 VMware AI Factory、執行應用程式與代理的 VMware Tanzu Platform、負責網路防護的 VMware vDefend,以及做負載平衡的 VMware Avi Load Balancer。推論、代理、容器與傳統虛擬機器因此被納入同一套維運體系。Broadcom 基礎架構軟體事業群總裁 Ram Velaga 表示,這是私有雲與私有 AI 基礎架構匯流到同一點的結果。

該公司自行進行的調查顯示,已在私有雲上執行正式推論、或正計劃這麼做的企業達到 56%。換個角度看,越是走出實驗階段的組織,越傾向把這部分工作留在內部。

把看不見的 Token 費用放上維運畫面

Broadcom 明確指出要處理的成本有 3 項:硬體採購費用、維運的繁瑣程度,以及隨著使用量不斷累積的 Token 消耗。第 3 項是傳統虛擬化平台沒有設想過的科目,從試行走向正式營運的那一刻就會浮現。

VMware Cloud Foundation 9 導入了把高速 NVMe 儲存當成記憶體延伸的分層機制,以及跨叢集的儲存重複資料刪除。面對大型模型對記憶體與儲存空間的高消耗,它選擇先把效率拉起來,而不是直接增加設備數量。平台同時支援 CPU、GPU 與其他加速器混用,企業可依供貨狀況與價格挑選機器,不必被單一組態綁死。

維運方面提供了追蹤模型使用狀況的 Token 監控、讓多個部門或應用程式共用同一模型服務的多租戶機制、GPU 與 vGPU 配置狀況的可視化,以及把這些指標彙整起來的儀表板。誰用了哪個模型、用了多少能在管理畫面上查到,內部計費與上限設定才有辦法落實。

效能部分,Broadcom 援引依據 MLPerf Inference v5.1 的第三方驗證,指出 VCF 達到與裸機架構同等的水準。言下之意是,企業不必因為擔心虛擬化拖慢速度,而另外建置一套裸機的 AI 環境。

通過驗證的模型清單裡出現了日語專用的 cotomi

這次發表最容易理解的一點,是把完成驗證的模型逐一點名。Broadcom 表示 VMware Cloud Foundation 上可執行超過 150 個開放原始碼與商用模型,並將 Google、NVIDIA、NEC、Alibaba Cloud、Z.ai 的模型列為已驗證。

  • NVIDIA Nemotron 3:採用 Mamba 與 Transformer 混合的 Mixture-of-Experts 架構的多模態開放模型系列,脈絡長度最高 100 萬 Token,鎖定長時間執行的代理用途
  • Google DeepMind Gemma 4:權重公開的多模態模型系列,適合想在自有環境中打造自主代理的情況
  • NEC cotomi:針對日語最佳化的模型。Broadcom 表示其 Token 效率提升 40%
  • Alibaba Cloud Qwen 3.7-Max:具備 100 萬 Token 脈絡長度的商用多模態模型,設定用於多模態推理與代理工作
  • Z.ai GLM 5.2:鎖定本地端程式撰寫與推理代理的開放原始碼模型

推論的執行層採用 vLLM,讓支援的模型能以共同的方式提供。如此一來,把模型以 Model-as-a-Service 的形式發給內部使用者就變得可行。對日本的組織來說,負責日語處理的模型進入已驗證名單,是一個具體的判斷依據。

讓代理從零權限開始

自主代理會解讀指令、自行查詢資料、呼叫工具,並向外部系統伸手。與傳統應用程式不同,它有超出預期範圍行動的空間,權限設計一旦出錯,既可能造成資訊外洩,也可能讓預算失控。

Tanzu Platform 對此採用預設拒絕的執行模型。API、網路、MCP 伺服器與網際網路,代理一開始通通看不到,只有明確授予的才能使用。憑證放在隔離的保管區,不會交到代理本身手上,從源頭切斷透過提示注入套取憑證的路徑。

架在其上的是新發表的管理平面 AgentMinder。它把代理當成與員工一樣的單一身分來看待,將任務、可使用的工具與可存取的資源綁在一起管理。執行時依最小權限原則控制工具呼叫,行為也會留下稽核紀錄。當各部門的代理不斷增加時,少了這樣一份台帳,狀況就很難掌握。

網路端由 vDefend 負責微分段與虛擬修補,並從流量走向找出未經許可的 AI 使用。Avi Load Balancer 除了 WAF 與 API 防護之外,還負責偵測代理接近越權工具的動作與可疑行為。管理開放原始碼來源的 TrueSource 也擴大範圍,除了 Java、Python、Node.js 之外,PostgreSQL、RabbitMQ、MySQL、Valkey 等資料基礎元件也納入對象。

供應時程

AgentMinder 已經開始供應。在 VMware Explore 上發表的 Tanzu Platform 新功能群,預計於 2026 年秋季正式提供。

總結

VMware Private AI Cloud 不是一場發表新模型的活動,而是把既有模型要在企業內部安全執行、成本又算得清楚所需要的底層重新整併了一次。點名已驗證模型、讓 Token 消耗看得見、對代理採預設拒絕,這 3 點談的都不是實驗而是維運,越是擁有自建基礎架構的企業,越容易把它放上評估清單。實際好不好用,還要看今年秋季正式提供之後陸續出現的導入案例。