OpenAI は 2026 年 5 月 5 日、AI スーパーコンピューターの GPU 間ネットワーク向けに新しく開発したプロトコル「MRC (Multipath Reliable Connection)」を Open Compute Project (OCP) に公開したと発表しました。AMD、Broadcom、Intel、Microsoft、NVIDIA との 2 年がかりの共同開発で生まれたもので、すでに OpenAI が運用する NVIDIA GB200 ベースの最大級スーパーコンピューターに導入され、Stargate の Abilene 拠点や Microsoft の Fairwater にも展開されています[1][2]。
MRC とは何か—RoCE を拡張した AI 訓練向けプロトコル
MRC は、GPU と CPU の間で高速なメモリ直接転送を行う標準規格 RDMA over Converged Ethernet (RoCE) を拡張したものです。Ultra Ethernet Consortium (UEC) で議論されてきた技術を取り込み、その上に SRv6 (IPv6 Segment Routing) によるソース ルーティングを重ねることで、大規模 AI 訓練クラスター向けのネットワーク ファブリックを構築できるよう設計されています[1]。
OpenAI は、最新の 800Gb/s ネットワーク インターフェースに組み込んだうえで、1 件の転送を数百経路に分散できる仕組みを実装しました。リンクやスイッチが故障しても数マイクロ秒で別経路に切り替わり、ネットワーク制御プレーンを単純化できる点が特徴とされています[1]。1 週間あたり 9 億人以上が使う ChatGPT を支える計算基盤として、訓練ジョブを止めない予測可能な通信が要求されたことが背景にあります[1]。
多面ネットワーク + パケット スプレーで輻輳を抑える
MRC の中身は大きく 3 つに分かれます。1 つ目は「マルチプレーン (multi-plane) トポロジー」で、800Gb/s のリンク 1 本を 100Gb/s × 8 本の経路に分けて 8 枚の独立した平面を作る発想です。これにより、64 ポートで 800Gb/s しか通せなかったスイッチを、512 ポートで 100Gb/s ずつ受けられるスイッチとして使えるようになります[1]。
その結果、約 13 万 1,000 枚の GPU を 2 段だけ のスイッチ階層で全結線できる計算で、従来の 800Gb/s 単一ネットワークが要求していた 3〜4 段構成よりも消費電力・故障部品数・総コストを下げられるとしています[1]。OpenAI は AMD・Microsoft らと共著した論文「Resilient AI Supercomputer Networking using MRC and SRv6」でこの設計を詳述しています[1][3]。
2 つ目は「適応型パケット スプレー」です。従来の RoCE では 1 件の転送が単一経路を通る必要があり、多面ネットワークの空き経路を使い切れないという欠点がありました。MRC は同じ転送のパケットを数百経路に意図的にばらして送り、出側の GPU メモリには到達順を意識せず書き込みます。経路の混雑を検知すると別経路に切り替え、パケット ロス時は安全側に倒してその経路をいったん停止し、プローブ パケットで復旧を確認する設計です[1]。輻輳によるドロップは「パケット トリミング」で扱い、スイッチがパケット本体だけ削ってヘッダーを宛先に届けることで、再送要求のシグナルとして使います[1]。
SRv6 ソース ルーティングと実運用の手応え
3 つ目の柱は、動的ルーティング プロトコルを置き換える「SRv6 ソース ルーティング」です。従来は BGP (Border Gateway Protocol) などの動的ルーティングがスイッチ群で経路を計算し、障害時に再計算する形でしたが、MRC では送信側がパケットの通る経路をあらかじめ指定します。具体的にはスイッチ識別子の並びを IPv6 アドレスに埋め込み、宛先までの経路を明示的に決め打ちする方式です[1]。
OpenAI は実環境での効果として、Tier 0 と Tier 1 の間で 1 分間に複数回のリンク フラップが起きても、同期事前学習ジョブには測定可能な影響が出なかったと報告しています。直近のフロンティア モデル訓練では Tier 1 スイッチを 4 台再起動した場面もありましたが、訓練チームと事前調整しなくてもジョブは継続できたとされています[1]。従来のファブリックでは障害復旧に数秒〜数十秒かかっていたのに対し、MRC はマイクロ秒単位で経路を切り替えることで、同期型訓練の停止リスクを大きく抑えられるとしています[1]。
導入先としては、OCI が Abilene (テキサス州) に建設した Stargate スーパーコンピューターが代表例です。同拠点では NVIDIA GB200 GPU が最終的に 45 万枚規模で配備される計画が公表されており、MRC はこの規模感の訓練ジョブを支える土台に据えられています[2][4]。Microsoft 側でも、AI 専用に設計された Fairwater データセンター群を結ぶ「AI WAN」上で MRC を使い、複数拠点を仮想的に 1 台のスーパーコンピューターとして扱う運用が進んでいます[3]。
まとめ
OpenAI が公開した MRC は、AI 訓練ネットワークを「壊れない前提で速度を出す」から「壊れることを前提に速度を保つ」設計へ切り替える試みです。マルチプレーン トポロジー、パケット スプレー、SRv6 ソース ルーティングという 3 点の組み合わせで、10 万 GPU 超を 2 段スイッチで結ぶ大規模クラスターを現実的に運用できるとしています。OCP 経由で仕様が公開された以上、今後はクラウド事業者やハードウェア ベンダー側の実装がどこまで揃うかが普及の鍵になりそうです。
出典:[1] OpenAI「Supercomputer networking to accelerate large scale AI training」 https://openai.com/index/mrc-supercomputer-networking/
出典:[2] AMD「AMD and OpenAI Advance AI Networking at Scale with MRC」 https://www.amd.com/en/blogs/2026/amd-advances-ai-networking-at-scale-with-mrc.html
出典:[3] SDxCentral「Microsoft details 'AI WAN' connecting distributed Fairwater AI superfactory」 https://www.sdxcentral.com/news/microsoft-details-ai-wan-connecting-distributed-fairwater-ai-superfactory/
出典:[4] DataCenterDynamics「OpenAI and Oracle to deploy 450,000 GB200 GPUs at Stargate data center in Abilene, Texas」 https://www.datacenterdynamics.com/en/news/openai-and-oracle-to-deploy-450000-gb200-gpus-at-stargate-abilene-data-center/
