GPUを並べる数を増やすだけでは、AIの処理能力がそのまま伸びる段階ではなくなってきました。NVIDIAは、Vera Rubinプラットフォームの一部として設計したイーサネットスイッチ「Spectrum-6」を、世界の大規模AIデータセンターへ投入すると明らかにしました[1]。1システムあたり102.4Tbpsで、前世代の2倍にあたる容量です。CoreWeaveやMicrosoftなどが早期の導入企業として名前を挙げています[1]。
ボトルネックはGPUではなくネットワークへ移った
数十万規模のGPUとCPUを1つの計算機として動かす、いわゆるギガスケールのAI工場では、ピーク性能の高いGPUを揃えることが、そのまま成果に直結しなくなっています。大規模な学習や推論では、多数のアクセラレータが絶えずデータを交換し続けるためです[1]。
厄介なのは、その通信の形が一般的な業務システムとまるで違う点です。GPU同士が計算結果を突き合わせる集合通信(コレクティブ通信)では、多数のノードが同じタイミングで一斉に送信を始めます。イーサネットはもともと、利用者とサーバー、サーバーとストレージのあいだを行き来する南北方向のトラフィックを想定して設計された規格で、こうした同期的で偏った通信のために作られたものではありません[1]。1本のリンクが詰まれば、その遅れがジョブ全体を待たせることになります。
NVIDIAがSpectrum-Xという専用の枠組みをイーサネットの上に載せてきたのは、この差を埋めるためです。Spectrum-6はその次世代版の中核にあたります[1]。
102.4Tbpsをどう作っているのか
Spectrum-6は、スイッチチップ1個あたりの帯域を102.4Tb/sへ倍増させています。信号の伝送には200G PAM4 SerDesを使い、200Gb/sのポートを512本束ねる構成です[2]。ポート密度を上げることで、AI特有の通信パターンに合わせた大規模なファブリックを組みやすくする狙いがあります。
もう1つの特徴が、光の扱い方です。Spectrum-6は従来型の抜き差しできる光トランシーバー(プラガブル)に加えて、光エンジンをチップと同じパッケージに載せるコパッケージドオプティクス(CPO)の形態にも対応します[1]。CPO版では、3.2Tb/sを担うシリコンフォトニクスの光エンジンを32基搭載し、微小リング変調器と着脱可能なファイバーコネクターを組み合わせています[2]。液冷にも対応しており、ネットワーク機器まで含めてAI工場全体を1つの冷却系で扱えるようにしています[1]。
チップ単体ではなく、ConnectX-9 SuperNICと組み合わせて次世代のSpectrum-Xイーサネットを構成する点も設計の前提です。Vera Rubinという枠組みでは、Vera CPU、Rubin GPU、NVLink 6スイッチ、ConnectX-9 SuperNIC、BlueField-4 DPU、そしてSpectrum-6が同じ世代として並びます[1]。
光モジュールを外したことで何が変わるのか
プラガブルの光モジュールとDSPリタイマーを取り払う構成には、はっきりした見返りがあります。NVIDIAによれば、Spectrum-X Ethernet Photonicsはネットワークの電力効率をおよそ5倍に改善し、光の損失を約22dBから約4dBまで下げることで、信号品質を最大64倍まで引き上げるとしています[2]。部品点数と故障箇所が減ることは、長時間走り続ける学習ジョブにとって地味に効いてきます。
ファブリック全体の数字としては、汎用のイーサネットに対してAI向けのネットワーク性能が最大1.6倍、10万GPUを超える規模でもネットワーク効率を最大95パーセント維持できるとNVIDIAは説明しています[1]。ハードウェアで加速するマルチプレーン構成により、データセンターに必要なスイッチ台数を1.7分の1に減らせるとも述べています[1]。
もっとも、これらはいずれもNVIDIA自身が示した数値です。比較対象となる汎用イーサネットの構成や測定条件までは公開されておらず、実運用でそのまま再現される保証はありません。判断材料としては、早期導入した事業者側から出てくる報告を待つ必要があります。
早期導入はクラウド事業者と自前でインフラを組む企業
Spectrum-6を最初に取り込む事業者として、NVIDIAはCoreWeave、Microsoft、Nebius、SpaceXAI、Teslaを挙げています[1]。このうちCoreWeave、Microsoft、Nebiusの3社は、Spectrum-6を組み込んだVera Rubinベースのインフラを最初に展開する提供者になるとされています[1]。
CoreWeaveでネットワーク製品を担当するMin Jun氏は、Spectrum-6と液冷のSpectrum-Xイーサネット基盤を自社のAI工場へ持ち込むことで、フロンティアモデルの学習と推論の展開に必要な帯域や耐障害性、効率を届けやすくなるとコメントしています[1]。Nebiusでグローバルパートナーシップを統括するLaurelle Roseman氏は、ギガスケールでの性能は結局のところ足並みを揃えられるかどうかで決まり、1本の遅いリンクがジョブ全体を止めないことが要点だと述べています[1]。
クラウド事業者にとっては、より多くの計算資源を1つの高性能なプールとして扱えることが導入の理由になります。一方、自前でインフラを組む側にとっては、同時に動くGPUの数、負荷の高い集合通信中の稼働率、長時間ジョブの粘り強さが実利になります[1]。
まとめ
Spectrum-6は、Vera Rubinプラットフォームの一員として設計された102.4Tb/sのイーサネットスイッチで、前世代比2倍の容量を持ちます。200G PAM4 SerDesで200Gb/sのポートを512本まとめ、コパッケージドオプティクスと液冷にも対応します。NVIDIAは汎用イーサネット比で最大1.6倍の性能、10万GPU超の規模で最大95パーセントの効率を掲げていますが、数値はいずれも自社発表であり、検証は実際の展開待ちです。CoreWeave、Microsoft、Nebius、SpaceXAI、Teslaが早期導入に名を連ねています。
出典:https://blogs.nvidia.com/blog/nvidia-spectrum-six-arrives-in-gigascale-ai-factories/
