英伟达发布了测试版软件 NVIDIA PAIR,可以把家里闲置的 GPU 汇聚成一个统一的推理环境。该消息于 9 月 3 日(美国时间)配合德国柏林开幕的 IFA 2026 公布,采用 Apache 2.0 许可证,完全免费。它并不把模型拆分到多块 GPU 上运行,而是把整个请求原封不动地交给当下空闲的设备,设计思路相当干脆。
把闲置的GPU汇聚成一个入口
PAIR 是 Personal AI Router 的缩写,直译过来就是面向个人的推理路由器。在家中各台电脑上安装后,它会通过 mDNS 自动发现同一网络内的设备。连接需要用 6 位数字码手动配对建立,因此不会有意料之外的电脑擅自加入集群。设备之间的通信由 mTLS 加密。
也可以把某个节点设置成只发出请求、不承担推理。这样就能从办公用的笔记本电脑发出任务,交给放在另一个房间的台式机 GPU 来处理。
以插入既有本地推理工具的方式运行
有意思的是,PAIR 的设计让用户无需改动现有环境。它作为代理接管 Ollama 和 LM Studio 使用的端口。AI 智能体照常向 Ollama 或 LM Studio 发送请求,PAIR 从中截获,再分发给各节点上运行的 Ollama 或 LM Studio。智能体一侧的配置无需改写。
分配的判断依据是队列深度和 GPU 使用率。正在跑游戏或视频渲染而腾不出手的节点会被自动避开,从而避免推理插队导致家人正在使用的电脑卡顿。与把多块 GPU 伪装成一块巨型 GPU 的模型分片、张量并行不同,PAIR 是按请求整体转交给另一台电脑,因此家用以太网或 Wi-Fi 也足以支撑。
Mac也能充当推理节点
支持的操作系统包括 Windows、Linux 和 macOS 三种。不限于英伟达自家 GPU,搭载 Apple M4 的 Mac 同样可以作为推理节点加入。该公司表示已向前验证到 GeForce RTX 20 系列,并确认最多 18 块 GPU 的运行情况。哪怕是压在储藏室里、落后几代的游戏电脑,也有可能直接算作战力。
在演示中,团队在 Hermes Desktop 上使用 Qwen3.6-35B-A3B,让 5 个子智能体并行运行。任务被分散到搭载 GeForce RTX 5090 的台式机、RTX Spark 笔记本电脑和 DGX Spark 这 3 台设备上,速度比只用 1 台时提升约 2 倍。多个子智能体同时思考的多智能体处理,以及多会话并发执行,正是 PAIR 设想的主要用途。
每天有165TFLOPS在闲置的估算
这一切的背景,是可在本地运行的模型迅速充实。英伟达分析称,2026 年 Hugging Face 上排名前 20 的模型下载量达到 13 亿次,增速是前一年的 4 倍。其推动力在于短短几个月内出现了多款宣称性能与 Claude Opus 4.7 相当的本地模型。
另一方面,算力却在闲置。据该公司估算,美国半数以上的家庭拥有 2 台以上电脑,但平均使用率仅为每天 17 个百分点左右,换算成时间是 4 小时出头。以拥有 2 台 RTX Spark 笔记本电脑、DGX Spark、搭载 RTX 5090 的笔记本电脑、搭载 RTX 的游戏电脑和 MacBook Pro 的家庭为例,约 165TFLOPS 的算力就这样闲置着。
英伟达估算,如果按 60 个百分点的利用率把这些算力用于 Qwen3.8-27B,每天可以生成约 1.2 亿个 token。该公司称,这相当于 GPT 5.6 Luna 云端使用每月约 1,200 美元(约 18.6 万日元),而对应的电费在美国多数地区约为每月 120 美元(约 1.9 万日元)。
※按 1 美元 = 155 日元换算
总结
NVIDIA PAIR 是一款把散落在家中各台电脑上的 GPU 汇聚成单一推理入口的路由器。它通过 mDNS 发现设备,用 6 位数字码配对,以 mTLS 保护通信,并依据队列深度和 GPU 使用率分配请求。由于采用接管 Ollama 和 LM Studio 端口的方式,智能体一侧无需重做。包括搭载 Apple M4 的 Mac 在内,最多 18 块 GPU 已通过验证,手头电脑越多,收益越大。加上以 Apache 2.0 开放这一点,它有望把本地 AI 的实用性再抬高一个台阶。
