NVIDIAが、AIを生み出すための新しいインフラ「AIファクトリー」の考え方を公式ブログで詳しく解説しました[1]。発電所が電力を生み出したように、AIファクトリーは電力を「トークン」に変えて知能を生産し続ける施設だと位置づけています[1]。性能はワットあたりのトークン量やトークンあたりのコストで測られ、その効率がそのまま収益に直結するという主張です[1]。
AIファクトリーとは何か
NVIDIAは、AIはもはや単なるソフトウェアではなく、社会を支える不可欠なインフラになったと説明しています[1]。その中心にあるのがAIファクトリー(AIによる知能生産に特化した大規模なコンピューティング基盤)です[1]。産業革命の時代に発電所がエネルギーを電力へ変換したように、AIの時代にはAIファクトリーがエネルギーをトークン(推論モデルやエージェントが処理を行う際の生産単位)へと変換すると位置づけています[1]。
ここで重視されるのが、1秒あたりのトークン数、ワットあたりのトークン数、トークンあたりのコスト、稼働率、そして稼働時間という指標です[1]。NVIDIAは、ワットあたりの性能がそのまま収益に結び付き、トークンあたりのコストがすべてのAIファクトリーの採算性を左右すると述べています[1]。施設はモデル、計算資源、ネットワーク、メモリ、ソフトウェア、ストレージ、電力、冷却まで、全体を一体で最適化して知能を出し続ける構成になっているとしています[1]。
エージェント型AIが処理の中身を変える
AIファクトリーが想定するのは、単に質問へ答えるだけではない常時稼働の推論(inference、学習済みのAIが実際に答えを導き出す処理)です[1]。エージェント型AI(自律的に手順を組み立てて作業を進めるAI)は、推論や計画立案だけでなく、検索、ツールの利用、データ取得、コードの記述、そして実際の操作までを担います[1]。さらに自分専用のサブエージェントを作り出し、特定分野のツールの使い方を学んでいくため、処理はより長く、深く、計算負荷の高いものになると説明されています[1]。
こうした作業を支えるには、高速なメモリ、文脈を保持するストレージ、連携のためのネットワーク、調整役のソフトウェア、そして処理を実行するCPUを、加速された計算資源と組み合わせる必要があるとしています[1]。NVIDIAは、ワークフロー全体を滞りなく動かし続けることが性能を決めると述べ、推論はもはや機械全体にまたがる「リアルタイムの調整作業」になったと表現しています[1]。
競争力はワットあたりの性能で測る
NVIDIAは、AIファクトリーの競争力を測る最終的なものさしが「ワットあたりの性能」になったと主張しています[1]。調査会社SemiAnalysisのInferenceXベンチマークを引き合いに、同社のBlackwell Ultra世代のGPUがトークンあたりのコストを最も低く抑えたとしています[1]。
具体的な数値も示されました。Blackwell Ultraを採用した「NVIDIA GB300 NVL72」システムは、前世代と比べてメガワットあたり最大50倍のトークンを生成し、従来のHopper世代と比べてトークンあたりのコストを35分の1に下げられるとしています[1]。長文の推論や大量の推論処理の調整には「NVIDIA Dynamo」と呼ぶソフトウェア基盤が使われ、稼働率を高く保つ役割を担うと説明しています[1]。次世代の「NVIDIA Vera Rubin」プラットフォームではこの流れがさらに進み、「LPX」によってワットあたりの性能を最大35倍に高め、全体最適化を深めることでトークンのコストを一段と引き下げる設計だとしています[1]。
チップから全体設計へ、パートナーとデジタルツインで支える
NVIDIAは、GPUから始まった取り組みが、加速された計算資源、高速な相互接続、液冷システム、推論用ソフトウェア、自律エージェント、そして参照アーキテクチャまでを含む「全体設計のAIファクトリー」へ広がったと説明しています[1]。企業のデータセンターへ届けるため、Cisco、Dell、HPE、Lenovo、Supermicroといったシステムパートナーと密に連携しているとしています[1]。同社は自社でもエンタープライズ向けのAIファクトリーを運用し、数百の自律エージェントが開発や運用の業務を支援していると述べ、実例として示しています[1]。
大規模な施設の建設には、計算資源の最適化だけでは足りないとも指摘します[1]。「NVIDIA DSX」の参照設計は、ギガワット規模のAIファクトリーをメガワットあたり最小のトークンコストで構築することを狙ったものです[1]。さらに「NVIDIA Omniverse DSX Blueprint」では、設備、ハードウェア、ソフトウェアをつなぐデジタルツイン(現実の設備を仮想空間に再現する技術)を使い、建設前の設計検証から稼働後の運用改善までを支援するとしています[1]。NVIDIAは「前回の産業革命はエネルギーを仕事に変えたが、今回はエネルギーを知能に変える」とまとめています[1]。
なお同社は、こうしたAIファクトリーの全体像について、6月1日(台北時間午前11時)に予定されている「NVIDIA GTC Taipei at COMPUTEX」での創業者ジェンスン・フアンCEOによる基調講演で詳しく語るとしています[2]。
まとめ
NVIDIAが提示したのは、データセンターを「ファイルを保管する場所」から「トークンを生産する工場」へと捉え直す発想です。ワットあたりのトークン量とトークンあたりのコストを軸に、チップ単体ではなく電力や冷却まで含めた全体最適で競争力を測るという考え方は、生成AIの普及で膨らむ計算需要を見据えたものと言えそうです。6月1日の基調講演でどこまで具体像が示されるかが、次の注目点になります。
出典:https://blogs.nvidia.com/blog/ai-factories-the-new-infrastructure-of-intelligence/
出典:https://blogs.nvidia.com/blog/nvidia-gtc-taipei-computex-2026-news/
