NVIDIAが、家庭に眠っているGPUを1つの推論環境としてまとめるソフト「NVIDIA PAIR」をベータ版として公開しました。ドイツ・ベルリンで開幕したIFA 2026に合わせた9月3日(米国時間)の発表で、ライセンスはApache 2.0、費用はかかりません。モデルを分割して複数のGPUにまたがらせるのではなく、リクエストを丸ごと空いている機器へ回すという、割り切った設計が特徴です。
遊んでいるGPUを1つの窓口にまとめる
PAIRはPersonal AI Routerの略で、日本語に直せば個人向けの推論ルーターです。家庭内の各PCにインストールすると、mDNSで同じネットワーク上の機器を自動的に見つけ出します。接続は6桁のコードを使った手動のペアリングで確立するため、意図しないPCが勝手にクラスタへ加わることはありません。機器同士の通信はmTLSで暗号化されます。
推論を担当させずに、リクエストを出すだけのノードとして設定することもできます。作業用のノートPCから投げた処理を、別室に置いたデスクトップのGPUが引き受ける、といった構成が組めるわけです。
既存のローカル推論ツールに割り込む形で動く
面白いのは、PAIRが既存の環境に手を入れずに済むよう設計されている点です。PAIRはOllamaやLM Studioのポートを引き継ぐプロキシとして動作します。AIエージェント側は普段どおりOllamaやLM Studioへリクエストを送るだけで、それをPAIRが横取りし、各ノードで動いているOllamaやLM Studioへ配り直します。エージェント側の設定を書き換える必要はありません。
振り分けの判断材料はキューの深さとGPU使用率です。ゲームや動画のレンダリングで手が塞がっているノードは自動的に避けられるため、家族が誰かのPCを使っている最中に推論が割り込んでカクつく、という事態を防げます。モデルシャーディングやテンソル並列で複数のGPUを1つの巨大なGPUに見せる手法とは違い、リクエスト単位で丸ごと別のPCへ回すため、家庭のイーサネットやWi-Fiでも成立するという理屈です。
Macも推論ノードになる
対応OSはWindows、Linux、macOSの3種類です。NVIDIA製のGPUに限らず、Apple M4を積んだMacも推論ノードとして参加できます。同社はGeForce RTX 20シリーズまでさかのぼって検証済みとしており、最大18台のGPUでの動作を確認したとしています。数世代前のゲーミングPCが物置に残っている家庭でも、そのまま戦力に数えられる可能性があります。
実演では、Hermes Desktop上で「Qwen3.6-35B-A3B」を使い、5つのサブエージェントを並列で動かす処理を用意しました。GeForce RTX 5090搭載デスクトップ、RTX Sparkノート、DGX Sparkの3台に分散させたところ、1台だけで動かした場合と比べて約2倍の速度が出たとしています。複数のサブエージェントが同時に考えるマルチエージェント処理や、セッションの同時実行が、PAIRが想定する主な用途です。
165TFLOPSが毎日遊んでいるという試算
背景にあるのは、ローカルで動かせるモデルの急速な充実です。NVIDIAは2026年のHugging Face上位20モデルのダウンロード数が13億回に達し、前年の4倍のペースで伸びていると分析しています。Claude Opus 4.7と同等の性能をうたうローカルモデルが数カ月のうちに複数登場したことが、その原動力になったという見方です。
一方で、演算資源は余っています。同社の試算では、米国の家庭の半数以上が2台以上のPCを持ちながら、平均の利用率は1日あたり17パーセント程度、時間にして4時間強にとどまります。RTX Spark搭載ノート2台、DGX Spark、RTX 5090搭載ノート、RTX搭載ゲーミングPC、MacBook Proを持つ家庭を例にすると、約165TFLOPSの演算能力が使われないまま放置されている計算になります。
これらを稼働率60パーセントでQwen3.8-27Bに充てた場合、1日あたり約1億2,000万トークンを生成できるとNVIDIAは見積もっています。同社はこれをGPT 5.6 Lunaのクラウド利用に換算すると月額1,200ドル(約18万6,000円)相当で、対する電気代は米国の多くの地域で月120ドル(約1万9,000円)程度だとしています。
※1ドル155円換算
まとめ
NVIDIA PAIRは、家庭内に散らばったPCのGPUを1つの推論の入り口にまとめるルーターです。mDNSで機器を見つけ、6桁コードでペアリングし、mTLSで通信を守りながら、キューの深さとGPU使用率を見てリクエストを配ります。OllamaやLM Studioのポートを引き継ぐ方式なので、エージェント側の作り直しは不要です。Apple M4搭載Macも含めて最大18台のGPUで検証済みとされており、手元に複数台のPCがある人ほど恩恵が大きい設計といえます。Apache 2.0で公開されている点も含めて、ローカルAIの実用性を一段引き上げる道具になりそうです。
