Broadcomが、企業の自社インフラ上でAIの推論とAIエージェントを動かすための基盤「VMware Private AI Cloud」を発表しました。機密データを外部のモデル提供事業者へ送るのではなく、データが置かれている場所にモデルのほうを持ち込む、という考え方を土台にしています。米国ラスベガスで開催された年次イベント VMware Explore に合わせた発表で、検証済みモデルの一覧にはNECの日本語特化モデルも並びました。
データを動かさず、モデルを動かす
企業がAIを本番運用に乗せようとしたとき、最初にぶつかるのは性能の問題ではなく置き場所の問題です。顧客情報や設計資料をそのまま外部のAPIへ流せるかというと、業種によってはその時点で話が止まります。VMware Private AI Cloudは、この順番を逆にして、モデルのほうを社内の閉じた環境へ引き込む構成を取ります。
中身は既存製品の束ね直しです。基盤となる VMware Cloud Foundation 9 に、AI向けの土台となる VMware AI Factory、アプリとエージェントを動かす VMware Tanzu Platform、ネットワーク防御の VMware vDefend、負荷分散の VMware Avi Load Balancer を組み合わせ、推論もエージェントもコンテナも従来の仮想マシンも同じ運用体系で扱えるようにした、という位置づけになります。Broadcomでインフラソフトウェア部門を率いるRam Velaga氏は、プライベートクラウドとAI基盤が一点に合流したものだと説明しています。
同社が自社調査として示した数字では、本番の推論をプライベートクラウドで動かしている、あるいは動かす計画があると答えた企業は56パーセントに達しています。実験段階を抜けた組織ほど、外に出さない選択に傾いているという読み方ができます。
見えにくい「トークン代」を運用画面に載せる
Broadcomが手を入れると宣言しているコストは3つあります。ハードウェアの購入費、運用の煩雑さ、そして使うほど積み上がるトークン消費です。3つ目は従来の仮想化基盤が想定していなかった費目で、パイロットから本番へ移った途端に効いてきます。
VMware Cloud Foundation 9 では、高速なNVMeストレージをメモリの延長として扱う階層化と、クラスター全体をまたぐ重複排除が入りました。大きなモデルを抱えるほどメモリと保存領域を食う構造に対して、物量を増やす前に効率を上げにいく作りです。CPU・GPU・その他アクセラレーターを混在させられるため、単一構成に縛られず調達しやすい機材を選べる点も併せて打ち出しています。
運用面では、モデルの利用状況を追うトークン監視、複数の部署やアプリで同じモデルサービスを共有する仕組み、GPUとvGPUの割り当て状況の可視化、そしてそれらをまとめて表示するダッシュボードが用意されます。誰がどのモデルをどれだけ使ったかが管理画面で追えることは、社内課金や上限設定を考える段階では効いてくるはずです。
性能については、MLPerf Inference v5.1 に基づく第三者検証でベアメタル構成と同等の結果が出たとしています。仮想化を挟むと遅くなるのでAI専用に別建てのサーバー群を組む、という判断を取らなくてよい、という主張になります。
検証済みモデルの一覧に日本語特化のcotomiが入った
今回の発表でわかりやすいのは、動作確認を済ませたモデルを名指しで並べた点です。VMware Cloud Foundation 上では150を超えるオープンソースおよび商用モデルが動くとしたうえで、Google、NVIDIA、NEC、Alibaba Cloud、Z.aiの各モデルを検証済みとして挙げました。
- NVIDIA Nemotron 3:MambaとTransformerを組み合わせた Mixture-of-Experts 構成のマルチモーダルモデル群で、文脈長は最大100万トークン。長時間動き続けるエージェント向けとされています
- Google DeepMind Gemma 4:重みが公開されたマルチモーダルモデル群。自前の環境で自律エージェントを組み立てたい場合の選択肢になります
- NEC cotomi:日本語に最適化されたモデル。Broadcomはトークン効率が40パーセント改善するとしています
- Alibaba Cloud Qwen 3.7-Max:100万トークンの文脈長を持つ商用のマルチモーダルモデルで、マルチモーダル推論とエージェント用途を想定しています
- Z.ai GLM 5.2:ローカルでのコーディングや推論エージェントを想定したオープンソースモデルです
推論の実行層には vLLM を採用しており、対応モデルを共通の作法で提供できます。これにより、社内利用者へモデルを Model-as-a-Service として配る使い方が現実的になります。日本の組織にとっては、日本語処理を担うモデルが検証済みの枠に入っている点が判断材料になりそうです。
エージェントには何も許可しない状態から始めさせる
自律エージェントは、指示を解釈して勝手にデータを読み、ツールを呼び、外部システムへ手を伸ばします。従来のアプリケーションと違って、想定外の範囲まで動いてしまう余地があり、権限の設計を誤ると情報漏えいにも予算の暴発にもつながります。
Tanzu Platform はここに対して、既定では何も許さない実行モデルを敷きました。API、ネットワーク、MCPサーバー、インターネットのいずれもエージェントには最初から見えず、明示的に与えたものだけが使えます。認証情報は隔離された保管領域に置かれ、エージェント本体には渡りません。プロンプトインジェクションで資格情報を吐かせる、という攻撃の筋道をあらかじめ潰す狙いです。
その上に置かれるのが、新発表の管理基盤 AgentMinder です。エージェントを社員と同じように1つの識別子として扱い、任務、使ってよいツール、触ってよいリソースを結び付けて管理します。実行時には最小権限の考え方でツール呼び出しを制御し、何をしたかの監査記録も残ります。部署ごとにエージェントが増えていく段階では、こうした台帳がないと状況の把握が難しくなります。
ネットワーク側では vDefend がマイクロセグメンテーションと仮想パッチを担い、通信の流れから許可されていないAI利用を見つけ出します。Avi Load Balancer はWAFとAPI保護に加えて、エージェントが許可外のツールへ近づく動きや不審な挙動を検知する役割を持ちます。オープンソースの供給元を管理する TrueSource も拡張され、Java・Python・Node.js に加えて PostgreSQL、RabbitMQ、MySQL、Valkey といったデータ基盤の部品が対象に入りました。
提供時期
AgentMinder はすでに提供が始まっています。VMware Explore で発表された Tanzu Platform の新機能群については、2026年秋の一般提供が予定されています。
まとめ
VMware Private AI Cloud は、新しいモデルを出す発表ではなく、既にあるモデルを社内で安全かつ計算できるコストで回すための土台をまとめ直した発表です。検証済みモデルの明示、トークン消費の可視化、エージェントへの既定拒否という3点は、いずれも実験ではなく運用を前提にした話題で、社内に据えたインフラを持つ企業ほど検討の俎上に乗せやすい内容といえます。実際の使い勝手は、秋の一般提供以降に出てくる導入事例を待つことになります。
