AI推論の評価会社Artificial Analysisが、エージェントAIの実行性能を測る業界初のベンチマーク「AgentPerf」の初回結果を公開しました。NVIDIAのBlackwell世代システム「GB300 NVL72」が首位となり、同社の前世代システムと比べて電力1メガワットあたり最大20倍のAIエージェントを動かせることが示されました[1]。チャット型AIとは負荷の質が異なるエージェント特有の処理を、実際の作業に即して測る点が特徴です。
エージェントAIは「短距離走」ではなく「リレー」
NVIDIAはエージェントAIの負荷を、従来の対話型AIと根本的に違うものだと説明します。1回のチャット応答は、1度の大規模言語モデル(LLM)呼び出しで1つの答えを返す「短距離走」に近い処理です。これに対してエージェントは、与えられた目標を多数の手順に分解し、タスクが終わるまで動き続ける「リレー」のように振る舞います[1]。
その結果、数十から数百回のLLM呼び出しが連鎖し、それぞれが膨らんでいく文脈(コンテキスト)を次へ受け渡します。さらに各工程では、コードのコンパイルや実行、データベース検索、ウェブ閲覧といったツール呼び出しが挟まります。負荷は単純に足し算で増えるのではなく、掛け算で膨らんでいくとNVIDIAは指摘します[1]。
問題は、既存のAI推論ベンチマークの多くが1回のLLM呼び出ししか測っていない点です。単一の要求への応答速度や同時処理数を測る設計のため、呼び出しが連鎖しツール待ちや文脈の肥大化が起きるエージェント特有の負荷を捉えきれません[1]。
実際のコーディング作業を再現した「AgentPerf」
AgentPerfは、実在するコーディングエージェントの作業記録をもとに作られています。エージェントがタスクを受け取り、ファイルを読み、コードを書いて修正し、コマンドを実行して結果から学びながら反復する——こうした一連の流れを、12以上のプログラミング言語にまたがる実際の公開リポジトリから集めて再現しています[1]。
評価では、一定の応答性と出力速度の基準を満たしながら、システムが同時に何件のエージェントタスクを支えられるかを測ります。基準となる出力トークン速度は毎秒20〜300トークン、最初のトークンが返るまでの時間(TTFT)は3〜10秒の範囲が設定されています[2]。ツール呼び出しそのものは実行せず、代表的なCPU処理時間で模擬するため、結果には計算基盤の性能差だけが表れる仕組みです[1]。
初回のテストには、大規模なMoE(混合エキスパート)型モデル「DeepSeek V4 Pro」が使われました。現在の高性能エージェントを支える最前線モデルの代表例という位置づけです[1]。Artificial Analysisの知能指標では、このモデルはスコア52でオープンウェイトの推論モデルの中で2番手につけています[2]。
GB300 NVL72が電力あたり20倍のエージェントを処理
この初回ラウンドで最高性能を記録したのが、NVIDIAのGB300 NVL72でした。前世代システム「HGX H200」と比べ、電力1メガワットあたり最大20倍のエージェントを動かせるという結果です[1]。Artificial Analysisの集計では、電力1メガワットあたり約6万1,000のエージェントを同時に処理できたとされ、これがH200比で20倍の水準にあたります[2]。
この差は、ハードウェアとソフトウェアを一体で設計する「コデザイン」によるものだとNVIDIAは説明します。GB300 NVL72は72基のGPUを1つのラック規模のシステムとして接続し、DeepSeek V4 Proのような大規模MoEモデルの実行を効率よく分散させます。さらにCUDAカーネルが通信と計算を重ね合わせて処理し、推論ソフトウェア「TensorRT LLM」が入力の処理と出力の生成を切り分けて、同時に動くエージェント数が増えても効率を保つよう最適化しています[1]。
実サービスでの採用も進む
すでに複数の推論事業者が、Blackwell上でDeepSeek V4 Proを使ったエージェント向けの処理を提供しています。Baseten、DeepInfra、Together AIなどが該当します[1]。
具体例として、Together AIはAIコーディング基盤「Cursor」のリアルタイム推論をBlackwell上で動かしています。開発者が作業を続ける裏側で、エージェントが不具合の調査や機能の生成、リファクタリングをこなす使われ方です。DeepInfraは、自動車ディーラー向けのAI人材プラットフォーム「Pam.ai」をBlackwellだけで運用しており、点検予約の受け付けや電話対応、アウトバウンドの営業活動をエージェントが担っています[1]。
NVIDIAは、次世代アーキテクチャ「Vera Rubin」がすでに本格生産に入っており、拡大するエージェントAIの需要に応える次世代の処理能力を投入していくとしています[1]。
まとめ
AgentPerfは、連鎖する呼び出しやツール待ちといったエージェント特有の負荷を、実際のコーディング作業に即して測る初のベンチマークです。その初回結果でNVIDIAのGB300 NVL72が電力あたり20倍のエージェント処理という首位を獲得し、Blackwell世代がエージェントAIの実行基盤として優位にあることが示されました。今後の比較対象が増えれば、AIエージェントを大規模に動かす際の指標として定着していきそうです。
出典:https://blogs.nvidia.com/blog/nvidia-blackwell-agentperf-artificial-analysis/
