NVIDIA 釋出了測試版軟體 NVIDIA PAIR,能把家裡閒置的 GPU 整合成單一的推論環境。這項消息在 9 月 3 日(美國時間)配合德國柏林開幕的 IFA 2026 公布,採用 Apache 2.0 授權,完全免費。它並非把模型拆開跨多張 GPU 執行,而是把整個請求原封不動交給當下有空的機器,設計相當乾脆。
把閒置的GPU整合成一個窗口
PAIR 是 Personal AI Router 的縮寫,直譯就是個人用的推論路由器。在家中各台電腦上安裝後,它會透過 mDNS 自動找出同一網路上的裝置。連線是以 6 位數代碼手動配對建立,因此不會有非預期的電腦擅自加入叢集。裝置之間的通訊以 mTLS 加密。
也可以把某個節點設定成只發出請求、不負責推論。如此一來,就能從工作用的筆電丟出處理,交給放在另一個房間的桌機 GPU 接手。
以插進既有本地推論工具的形式運作
有意思的是,PAIR 的設計讓使用者不必更動既有環境。它以代理的形式接手 Ollama 與 LM Studio 使用的連接埠。AI 代理程式照常向 Ollama 或 LM Studio 送出請求,PAIR 從中攔下,再分配給各節點上執行的 Ollama 或 LM Studio。代理程式那一端的設定不必改寫。
分配的判斷依據是佇列深度與 GPU 使用率。正在跑遊戲或影片算圖而分身乏術的節點會被自動避開,可避免推論插隊害家人正在用的電腦頓卡。與把多張 GPU 偽裝成一張巨大 GPU 的模型分片、張量平行不同,PAIR 是以請求為單位整包轉給另一台電腦,因此家用乙太網路或 Wi-Fi 也足以成立。
Mac也能當推論節點
支援的作業系統為 Windows、Linux 與 macOS 三種。不限於 NVIDIA 自家 GPU,搭載 Apple M4 的 Mac 同樣能以推論節點的身分加入。該公司表示已回溯驗證到 GeForce RTX 20 系列,並確認最多 18 張 GPU 的運作。就算是放在儲藏室、落後幾個世代的遊戲電腦,也有機會直接算進戰力。
在實機展示中,團隊在 Hermes Desktop 上使用 Qwen3.6-35B-A3B,讓 5 個子代理程式平行運作。工作被分散到搭載 GeForce RTX 5090 的桌機、RTX Spark 筆電與 DGX Spark 這 3 台裝置上,速度比只用 1 台時快了約 2 倍。多個子代理程式同時思考的多代理處理,以及多個工作階段同時執行,正是 PAIR 設想的主要用途。
每天有165TFLOPS閒置的試算
這一切的背景,是可在本地執行的模型迅速成熟。NVIDIA 分析指出,2026 年 Hugging Face 上前 20 名模型的下載次數達到 13 億次,成長速度是前一年的 4 倍。推動力在於短短數個月內出現了多款宣稱效能與 Claude Opus 4.7 相當的本地模型。
另一方面,運算資源卻在閒置。依該公司試算,美國半數以上的家庭擁有 2 台以上電腦,但平均使用率僅為每天 17 個百分點左右,換算成時間是 4 小時出頭。以擁有 2 台 RTX Spark 筆電、DGX Spark、搭載 RTX 5090 的筆電、搭載 RTX 的遊戲電腦與 MacBook Pro 的家庭為例,約 165TFLOPS 的運算能力就這樣被閒置。
NVIDIA 估算,若以 60 個百分點的使用率把這些運算力投入 Qwen3.8-27B,每天可生成約 1 億 2,000 萬個 token。該公司表示,這相當於 GPT 5.6 Luna 雲端使用每月約 1,200 美元(約 18.6 萬日圓),而對應的電費在美國多數地區約為每月 120 美元(約 1.9 萬日圓)。
※以 1 美元 = 155 日圓換算
總結
NVIDIA PAIR 是一款把散落在家中各台電腦的 GPU 整合成單一推論入口的路由器。它以 mDNS 找出裝置,用 6 位數代碼配對,以 mTLS 保護通訊,並依佇列深度與 GPU 使用率分配請求。由於採用接手 Ollama 與 LM Studio 連接埠的方式,代理程式那一端不必重做。包含搭載 Apple M4 的 Mac 在內,最多 18 張 GPU 已通過驗證,手邊電腦愈多,好處愈大。加上以 Apache 2.0 公開這點,它有望把本地 AI 的實用性再往上推一個層級。
