英伟达宣布,在最新一轮 MLPerf Training 6.0 中,其平台在全部七个项目上都取得了最快的训练时间[1]。它还是唯一一个将提交规模扩展到 8,192 块 GPU 的平台,最新一代的「GB300 NVL72」系统相比上一代实现了最高 1.6 倍的训练加速。在 AI 模型规模持续膨胀的背景下,英伟达借这一轮把训练基础设施的性能、规模与可靠性一并展示了出来。

什么是 MLPerf Training 6.0

MLPerf Training 是一项经过同行评审的业界标准基准测试,用统一的条件来比较 AI 模型的训练性能[1]。由于各家都在相同任务上比拼谁能更快达到目标质量,因此可以横向衡量某一计算平台的真实实力。

本次 6.0 版本新增了两个 MoE(混合专家,根据输入只激活部分专家网络的方式)预训练任务:「DeepSeek-V3 671B」与「GPT-OSS-20B」,反映出 MoE 架构正逐渐成为大规模模型的核心[1]。

七项全部最快,唯一全项目提交

英伟达是唯一一个在测试套件的全部七个项目上都提交结果的平台,并且在所有项目上都取得了最快的训练时间[1]。本轮中,公司使用「GB200 NVL72」和「GB300 NVL72」两种机架级系统进行提交。

在每个机架内部,第五代 NVLink 交换机以高带宽将 72 块 GPU 连成一个统一的计算与显存资源池,使这 72 块 GPU 如同一块巨型 GPU 一样运作[1]。大规模 MoE 训练需要在 GPU 之间进行全连接式通信,把输入令牌路由到正确的专家子网络,而 NVLink 的带宽正是高效完成这一过程的关键。英伟达还展示了名为「NVFP4」的低精度训练方法,可在满足严格精度要求的同时提升性能;最近它就用 NVFP4 预训练了拥有 5,500 亿参数的大模型「NVIDIA Nemotron 3 Ultra」[1]。

GB300 NVL72 较上代最高快 1.6 倍

在本轮中,GB300 NVL72 在相同规模下相比 GB200 NVL72 实现了最高 1.6 倍的训练加速[1]。NVFP4 带来的更高计算密度、扩展后的显存容量,以及让 GPU 更易维持峰值性能的更高功耗上限等 Blackwell Ultra 世代的强化点,共同造就了这一差距。英伟达另外发布了对相关结果更深入的技术解读[2]。

扩展到 8,192 块 GPU 与合作伙伴纪录

面向大规模分布式训练,英伟达提供了两种横向扩展网络平台:「NVIDIA Quantum InfiniBand」与「NVIDIA Spectrum-X Ethernet」,数据中心可据此构建契合自身架构的大规模集群[1]。

在套件中最大的 MoE 模型 DeepSeek-V3 671B 上,英伟达使用 GB200 NVL72 系统将提交规模扩展到 8,192 块 GPU,这是迄今为止 MLPerf Training 中规模最大的 Blackwell 平台提交。在套件中最大的稠密 LLM 之一 Llama 3.1 405B 上,它也以 5,120 块 GPU 提交了结果[1]。

合作伙伴的纪录同样亮眼。微软 Azure 在 GB200 NVL72 上将 Llama 3.1 405B 训练扩展到 8,192 块 GPU,以 7.07 分钟达到参考质量目标,创下该项目的最快训练时间。CoreWeave 在该项目中取得 DeepSeek-V3 671B 的最快训练时间,使用以 Spectrum-X Ethernet 连接的 GB300 NVL72,在 8,192 块 GPU 规模下用 2.02 分钟达到质量目标[1]。

支撑大规模运行的可靠性

在生产环境中,训练任务可能横跨数十万块 GPU,并持续数周甚至数月。在这种规模下,有效训练吞吐量不仅取决于系统性能,也取决于让任务能长期复现的容错能力[1]。

英伟达表示,它从两个方向打磨容错能力。其一是减少故障本身:每块 GPU 在进入数据中心之前都要经过 30 多道制造测试工序的筛选,部署之后,「RAS(可靠性、可用性、可维护性)引擎」会监控芯片的几乎全部区域,自愈功能则在不中断工作负载的情况下绕开检测到的故障。在网络层面,Spectrum-X Ethernet 能以毫秒级速度绕过故障链路,在不影响任务的前提下保持网络健康[1]。

其二是加快故障发生后的恢复。「NVIDIA Resiliency Extension(NVRx)」会在性能下降的节点拖累整个集群之前就加以检测和管理,一旦发生中断,它会从最近的检查点(训练状态的保存快照)恢复,而非重启整个任务,从而把损失的时间降到最低[1]。

不断壮大的 Blackwell 生态

本轮合作伙伴参与踊跃,共有 19 家机构提交了结果,包括微软 Azure、CoreWeave、戴尔(Dell Technologies)、谷歌云、富士通和超微(Supermicro)等[1]。

具体成果也已公开。Cohere 在 GB200 NVL72 上为其智能体 AI 平台「North」实现了 3 倍的训练加速。曾在 Blackwell 集群上训练图像生成模型「v8」的 Midjourney,如今正在 CoreWeave 上扩展大规模 Blackwell Ultra GPU 集群,用于即将推出的图像与视频模型。Thinking Machines Lab 在谷歌云的 GB300 NVL72 上,相比上一代获得了 2 倍的训练与服务速度。Nebius 则在 Blackwell 基础设施上将 Higgsfield 的训练时间缩短了 30%,支撑起一个如今服务 2,200 万用户、每天生成超过 600 万条 AI 内容的平台[1]。

总结

在 MLPerf Training 6.0 中,英伟达 Blackwell 在全部七个项目上都取得了最快训练时间,并且是唯一扩展到 8,192 块 GPU 的平台。GB300 NVL72 相比上一代提升最高达 1.6 倍,再加上新增的 MoE 任务、NVFP4 低精度训练,以及毫秒级绕开故障的可靠性,这些结果展现了该平台作为训练基础设施的综合实力。

来源:https://blogs.nvidia.com/blog/blackwell-mlperf-training-6-0/

来源:https://developer.nvidia.com/blog/nvidia-blackwell-enables-3x-faster-training-and-nearly-2x-training-performance-per-dollar-than-previous-gen-architecture/