AIの活用が試験導入から本番の「AIファクトリー」へと移るなかで、性能を測る軸はチップの最大スペックから「トークンあたりのコスト」へと変わりつつあります。NVIDIAは、GPUやCPU、ネットワークと一体で設計したフルスタックの推論ソフトウェアによって、Blackwell上でDeepSeek V4のトークンコストをわずか1か月で最大5分の1に下げたと説明しています[1]。なぜハードウェアだけでなくソフトウェアが推論の経済性を左右するのか、要点を整理します。

トークンあたりのコストが新たな指標に

これまでの指標は、チップ単体のピーク性能が中心でした。しかしNVIDIAは、本番運用では「1ドルあたり、1ワットあたり、そして求められる遅延の範囲内で、どれだけ役に立つトークンを返せるか」が重視されるようになったと指摘します[1]。

背景にあるのが、エージェント型AIの広がりです。従来のWebや検索、SaaSのような処理は、ページの読み込みやデータベースの読み書きといった似た経路をたどり、同じサーバーを増やせば対応できる予測しやすいものでした。一方でエージェント型AIは、推論し、計画を立て、ツールを呼び出し、専門の補助エージェントを起動し、複数ターンにわたって膨大な文脈を管理します[1]。

その結果、1つの要求が、数百の補助エージェントと数千のタスク、複数の大規模言語モデルにまたがる分散処理の問題へと変わります。GPUやCPU、DPU、ストレージを横断するこの複雑さを、無駄な処理能力に終わらせるのか、それともトークンあたりのコスト低減につなげるのか。NVIDIAは、その分かれ目を決めるのがソフトウェアだと位置づけています[1]。

ソフトウェアが性能を底上げする3つの層

NVIDIAの推論ソフトウェアは、個別の最適化をシステム全体の性能へとつなげるために、3つの層を連携させる構成だと説明されています[1]。

1つ目は本番運用の層で、分散処理やオーケストレーション、オートスケーリング、メモリ管理を調整し、適切な計算資源とストレージ上で推論を走らせます。2つ目はアプリケーション高速化の層で、計算と通信を重ね合わせる手法やカーネル融合といった実行時の最適化を行いながら、開発者が細かく調整できる余地も残します。3つ目はインフラへのアクセス層で、開発者が機器ごとの命令セットやデータ転送の手順を個別に扱わなくても、GPUやネットワーク、メモリ、システムの機能を引き出せるようにします[1]。

これらが1つのシステムとして働くと、個々の最適化が積み上がって効いてきます。NVIDIAによれば、処理を役割ごとに分ける分散サービングや、NVLinkを介した大規模なエキスパート並列処理、NVFP4と呼ぶ精度形式、複数トークンを同時に予測する手法は、それぞれ単独でも効果がありますが、組み合わせるとスループットを最大20倍に高めるとしています[1]。こうしたソフトウェアの積み重ねが、Blackwell上でDeepSeek V4のトークンコストを1か月で最大5分の1に下げた成果につながったと説明されています[1]。

採用企業とオープンソースの弾み車

実際の導入も進んでいます。Basetenは、オープンソースのライブラリーであるNVIDIA TensorRT-LLMを使い、推論やコーディング、長文脈の処理に向けてDeepSeek V4 ProをBlackwell上で提供し、独自の実行時最適化を加えることで毎秒のトークン数を最大50%増やしたとされます。Cognitionは推論フレームワークのNVIDIA Dynamoで推論用GPUを管理し、強化学習の処理を拡張する道筋を得ています。Deep InfraはBlackwell上で最先端のオープンソースモデルを公開初日から高い性能で提供し、Together AIはTensorRT-LLMを用いてCursorのリアルタイムなコーディング体験を本番環境へと素早く橋渡ししました[1]。

この基盤を増幅させているのがオープンソースの広がりです。現在広く使われている多くのAIフレームワークや推論プロジェクトはNVIDIA CUDAを土台に作られているため、新しい研究や最適化がNVIDIAのGPU上で初日から高い性能で動きます[1]。代表例がPyTorchで、2016年にCUDA対応で登場して以来、NVIDIAのアーキテクチャと歩調を合わせて進化し、Tensor CoreやTransformer Engine、NVFP4といった技術を使えるようにしてきました[1]。

その効果は具体的な数字にも表れています。NVIDIAは、投機的デコードの手法であるDFlashが既存のハードウェアでスループットを最大15倍に高め、FastVideoが1080pの動画を5秒未満で生成できると紹介しています。新しいオープンモデルのDeepSeek V4が公開された際にも、推論フレームワークのvLLMとSGLangがBlackwell向けの導入手順を初日から用意し、約1か月でBlackwell上の性能が最大5倍に向上して、トークンコストはおよそ5分の1まで下がったとしています[1]。開発者がCUDAに最適化された経路を磨くほど、その改善が本番運用を通じて生態系全体に還元される。NVIDIAはこの循環を「オープンソースの弾み車」と表現しています[1]。

なお、ここで示した倍率やコスト削減の数値は、いずれもNVIDIA自身が公表したものです。読者が実際の効果を見極めるうえでは、第三者による検証や、扱うモデルや負荷の条件による違いも踏まえて受け止める必要があります。

まとめ

NVIDIAは、推論の競争力がチップ単体の性能から、ソフトウェアによる「トークンあたりのコスト」へと移ったと位置づけています。3つの層を連携させるフルスタックの設計とCUDAを軸にしたオープンソースの広がりが、Blackwell上でDeepSeek V4のコストを1か月で最大5分の1に下げた成果の背景にあります。ハードウェアの世代交代だけでなく、ソフトウェアの継続的な改善が推論経済の鍵を握る局面に入ったと言えそうです。

出典:https://blogs.nvidia.com/blog/inference-software-lowest-token-cost/