英伟达的新一代机架级AI系统「Vera Rubin NVL72」已进入量产阶段。CoreWeave、谷歌云、微软Azure和甲骨文云基础设施的数据中心已有机架投入运行,其供应链覆盖30个国家、超过350个生产基地[1]。同一天,微软与Mistral宣布了一项将使用数千块该GPU的欧洲合作计划[2]。
主张每兆瓦令牌数提升10倍
英伟达为Vera Rubin主推的指标不是峰值性能,而是每兆瓦能处理多少令牌。对于电力供给存在上限的AI数据中心而言,这个数字更直接地决定是否扩建。
早期采用者CoreWeave在DeepSeek-R1上的基准测试显示,相比上一代Grace Blackwell NVL72,每兆瓦吞吐量提升到10倍[1]。英伟达自身也表示,与GB200 NVL72相比,每兆瓦令牌数最高提升10倍,每百万令牌成本降至十分之一[1]。
背景在于,智能体式系统的令牌消耗量最高可达传统AI应用的15倍[1]。如果单位成本不下降而消耗量持续膨胀,运营预算会先于算力触及上限。
不过,这些数字均由英伟达及其合作伙伴提供。比较条件和模型运行配置并未公开,无法保证在其他工作负载上同样成立,仍需等待第三方验证。
把7颗芯片当作一个系统来设计
英伟达表示,Vera Rubin并非把7种芯片和5种机架托盘作为独立产品拼装而成,而是从一开始就按单一系统进行设计[1]。
核心是全新的英伟达Vera CPU。它采用名为Olympus的自研核心,面向智能体时代的AI工厂,相比竞争对手的芯粒设计,单线程性能提升2倍,核间带宽提升3倍,内存延迟降低40%[1]。在GPU周边运行的预处理、调度以及智能体控制循环,正是单线程性能容易见效的领域。
网络方面,第六代NVLink负责纵向扩展,在复杂工作负载上吞吐量提升2倍以上,延迟降低到三分之一[1]。横向扩展则由102.4Tbps的Spectrum-6交换系统与1.6Tbps的ConnectX-9 SuperNIC组合完成,英伟达称其RDMA带宽比通用以太网高1.6倍[1]。跨站点的Spectrum-XGS则可将多站点吞吐量提升1.9倍[1]。
此外,NVLink Fusion向第三方XPU开放了NVLink的纵向扩展基础[1]。这与完全依赖自家芯片的路线相反,为外部加速器留出了接入口。
托盘里没有线缆和风扇
在物理结构上最引人注目的,是计算托盘去掉了线缆、风扇和水管。英伟达称这是三代机架级协同设计的成果,托盘组装时间从数小时缩短到1分钟[1]。在需要部署数万台的数据中心里,这个差距会直接体现在上线周期上。
散热设计也发生了变化。将液冷进水温度设定为摄氏45度,使得仅靠干式冷却器、不使用冷机的运行方式成为可能[1]。对于新建的AI工厂,配合闭环液冷系统,每兆瓦每年可节约数百万加仑水[1]。水资源正在成为影响数据中心选址的条件,这构成了性能数字之外的另一重说服力。
在欧洲成为Mistral的算力基础
7月21日,微软与Mistral宣布扩大战略合作[2]。这份面向欧洲AI基础设施扩张的数十亿美元级(约数千亿日元级)协议中,Mistral将把数千块Vera Rubin GPU纳入自身算力,并提供用于训练、推理和大规模部署的共享平台[1][2]。微软方面则将利用Mistral扩容后的欧洲GPU基础设施,支撑自家云与AI服务的交付[2]。
※1美元=162日元换算(截至2026年7月21日)
在模型层面,Mistral Medium 3.5与OCR 4已可在Microsoft Foundry中使用,Mistral Medium 3.5也已集成进Microsoft Copilot Studio[1][2]。通过Azure Local和Foundry Local,客户可以在云端与自主管控的环境中运行相同的模型和工具[1]。
目标客户是金融、医疗、制造等监管严格的行业[2]。在数据存放位置和运行流程受到监管的领域,仅仅性能出色的模型往往难以中选,能否提供从公有云到完全离线环境的完整选项才是判断依据。对英伟达而言,向欧洲的开放模型路线供应算力,等于为量产找到了一个明确的出口。
总结
Vera Rubin NVL72已进入量产阶段,并在四家主要云服务商处投入运行。覆盖30国350个以上基地的供应链、CoreWeave给出的每兆瓦10倍吞吐量、1分钟托盘组装以及免冷机散热设计,是本次的要点。在欧洲,它将支撑微软与Mistral数十亿美元级的合作。所有性能数值均来自厂商方面的发布,仍有必要等待第三方验证。
