9 月 15 日,英伟达在美国加利福尼亚州圣克拉拉举行的 AI Infra Summit 上,公布了 AI 工厂能效方面的新实测结果与合作进展[1]。最新平台 Vera Rubin NVL72 在还原真实智能体工作负载的基准测试中,每兆瓦吞吐量达到上一代的 30 倍。衡量 AI 基础设施的标尺,正在从峰值算力转向每兆瓦电力能产出多少 token。

评价指标从峰值性能转向每兆瓦 token

演讲者是英伟达超大规模与高性能计算副总裁 Ian Buck。今年的 AI Infra Summit 参会人数超过 8,000 人,较上一年的 3,500 人大幅增长[1]。会场关注的核心问题,是如何在电力约束下持续运行 AI 基础设施。

背后的推动力是智能体 AI 的普及。智能体会把推理步骤串联起来,不断调用外部工具来组织答案。英伟达表示,单次会话累积数十万输入 token 并不罕见,大约是一次普通聊天请求的 15 倍[1]。处理量增加,用电量也随之攀升。

为此,英伟达提出了从芯片到电网一体化协同设计的思路。Vera Rubin 系统、推理软件 Dynamo、NeMo 库,以及包含 NVLink、Spectrum-X 以太网、ConnectX SuperNIC 和 BlueField DPU 在内的网络与存储底座,被整体视为一座 AI 工厂[1]

Lambda 实测:同样电力预算下运行 19 个节点

负责动态优化电力分配的软件是 NVIDIA DSX MaxLPS。它持续监测 GPU 与机架的功耗,把空余电力调配到最需要的位置,回收静态分配下闲置的容量[1][2]。由于训练与推理的功耗特征不同,混合负载的 AI 工厂受益最明显。

AI 云服务商 Lambda 在峰会上公布了在 Blackwell 世代服务器上验证 DSX MaxLPS 的结果。在通常只分配给 16 个节点的电力预算内,Lambda 运行了 19 个节点,集群整体 token 吞吐量从每秒约 400 万提升到 500 万,提高 24%,每瓦性能改善 23%[1]。对于下一代 Vera Rubin NVL72 构建的 AI 工厂,英伟达预计在合适的部署环境下,同样的兆瓦预算可以多容纳最高 40% 的 GPU 容量[1][3]

在机架层面,名为 Intelligent Power Smoothing 的软件配合扩展的储能缓冲,可吸收短时功率尖峰。无需为瞬时峰值预留过多余量,系统就能更贴近持续负载运行[1]

真实智能体负载实测达到上一代的 30 倍

最受关注的是 SemiAnalysis AgentX 的测量结果。AgentX 记录真实的智能体编程会话,并完整保留上下文增长、工具调用延迟和子智能体派生,以此衡量推理性能,捕捉单次请求类基准难以体现的智能体负载形态[1]

在 AgentX 上运行 DeepSeek V4 Pro 模型时,Vera Rubin NVL72 相较 GB300 NVL72 实现了最高 30 倍的每兆瓦吞吐量,每百万 token 成本最多降至 1/45[1]。在电力受限的部署中,每兆瓦吞吐量决定了 AI 工厂的营收上限,每百万 token 成本则决定其利润率。英伟达将这一成果归因于极致的协同设计:NVL72 纵向扩展域、第六代 NVLink、第五代 Tensor Core 的 NVFP4 精度,以及由 TensorRT LLM 与 Dynamo 组成的推理栈[1]

在低延迟推理方面,NVIDIA Groq 3 LPX 与 Vera Rubin 形成互补。在长上下文下运行 2 万亿参数以上的模型时,组合平台的每兆瓦 token 吞吐量最高可达 GB200 NVL72 的 35 倍;在 10 万上下文的 Qwen 3.8 27B 工作负载中,Groq 3 LPX 实现了每用户每秒 2,529 个输出 token[1]

AI 工厂与电网协同运行

另一项发布是把 AI 工厂变成电网的灵活调节资源。Emerald AI 与英伟达合作,在电力公司 Silicon Valley Power 的柔性负荷接入计划中演示了自动降载。系统响应了数百次需求信号,同时保障了 AI 工作负载的性能[1]

支撑这一能力的是 DSX Flex。它接收电网的降载请求、需求响应事件和电价信号,并按照预设的工作负载优先级自动调整。最关键的任务继续运行,优先级较低的任务临时暂停、随后恢复[1]。数据中心由此从单纯的耗电方,转变为能够根据电网状况调节自身用电的资源。

英伟达还披露,亚马逊旗下 Annapurna Labs 正与其合作开发 NVHBM 定制高带宽内存技术,d-Matrix 正在将 NVLink Fusion 集成到自家的 Raptor XPU 中,Pinterest 则借助 Blackwell 与 Dynamo 把对话式 AI 引入视觉发现场景[1]

Vera CPU 实测结果与 NVLink 6 的可靠性

CPU 侧同样交出了成绩。Perplexity 针对面向智能体 AI 的安全沙箱平台 SPACE 评测了 Vera CPU,沙箱启动速度提升 1.9 倍。Redpanda 表示延迟为其他 CPU 的 1/5.5、吞吐量高出 73%,Starburst 称查询吞吐量提升 3 倍,Kinetica 测得分析查询快 2.7 倍。ClickHouse 则表示,在自家开放基准 ClickBench 上,Vera 是迄今测过最快的机器[1]

规模越大,能否持续不中断运行就越关键。当数十万块 GPU 串联在一起,瞬态错误、信号衰减与硬件故障不可避免。NVLink 6 采用多层容错架构:物理层提供定制前向纠错、物理层重传与链路恢复;网络层则通过基于信用的流控、动态路由和链路再平衡,把故障限制在局部[1]。不让单点故障拖停整个集群,对 AI 工厂的实际产出与能效同样重要。

总结

AI Infra Summit 传递出的信号是,AI 基础设施的标尺正从比拼速度转向比拼每兆瓦能完成多少工作。Vera Rubin NVL72 与 DSX MaxLPS 的组合,在同样的电力范围内容纳更多 GPU,并在真实智能体负载下录得最高 30 倍于上一代的每兆瓦吞吐量。加上与电网协同的 DSX Flex 实证,AI 工厂正把设计重心转移到如何用好每一瓦电力这一课题上。

来源[1]:https://blogs.nvidia.com/blog/ai-infra-summit-vera-rubin-dsx-energy-efficiencies-tokens-per-watt-ai-factories/

来源[2]:https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps

来源[3]:https://blogs.nvidia.com/blog/vera-rubin-nvl72-efficiency-ai-agents/