英伟达宣布,美国洛斯阿拉莫斯国家实验室(LANL)新部署的三台超级计算机"Mission""Vision""Veritas"将采用该公司首款独立CPU"Vera"[1]。三台超算均与慧与(HPE)联合构建,作为面向科学研究的计算平台,预计于2027年投入运行。在实验室的实测中,Vera CPU相较现役x86架构超算所用的CPU展现出最高7倍的性能,为计算科学领域带来了一项新的选择。
面向科学的三台超算,基于Vera Rubin平台构建
这三台超级计算机将慧与的"Cray Supercomputing GX5000"架构与英伟达的"Vera Rubin"平台结合在一起[1]。Vera Rubin整合了CPU"Vera"、GPU"Rubin"以及高速网络技术"Quantum-X800 InfiniBand",目标是将计算与通信作为一个整体加速。
作为核心的"Mission",除了采用Vera Rubin的GPU节点外,还将集成2300颗不搭配GPU的独立Vera CPU[1]。Mission计划于2027年投入运行,作为美国国家核安全管理局(NNSA)先进仿真与计算项目中的第五台先进技术系统,替换现役机型"Crossroads",承担涉及国家安全的机密工作负载[1]。
"Veritas"将搭载约1150颗独立Vera CPU,以补充Vera Rubin节点[1]。它支撑实验室自主推进的研发项目,承担加速面向科学的智能体AI的角色。在构建规模更大的系统之前,它还将充当验证新技术的平台。第三台"Vision"同样预计于2027年投入运行,将作为面向材料科学、核科学、能源建模、生物医学研究和AI等广泛基础科学开放的计算资源使用[1]。慧与自身也表明,由其负责构建Mission与Vision两台系统[2]。
较x86最高快7倍,Vera CPU的实力
推动此次采用的,是实验室在实际科学计算中测得的Vera CPU性能。在LANL的验证中,在面向科学研究的AI框架"URSA"的工作负载上,Vera CPU发挥出了现役机型Crossroads所用x86架构CPU的7倍性能[1]。
在使用开源蒙特卡洛法热传输仿真工具"Branson"的初期测试中,Vera也比Crossroads的x86架构CPU高出3倍以上[1]。支撑这些结果的,是英伟达自主研发的"Olympus"核心、低功耗的"LPDDR5"内存,以及在芯片内部高速互连的fabric等设计上的巧思。
英伟达表示,单颗Vera CPU相较单路x86架构CPU拥有3倍以上的性能,每核心内存容量达4倍以上,每节点内存则达6倍[1]。除了CPU单体的运算能力外,它也是一种适合在承载大量数据的同时推进处理的科学计算配置。这些系统通过"协同设计"打造,由硬件设计者、系统软件开发者、各领域科学家、计算机科学家和应用数学家共同打磨设计,其特点在于不仅以抽象的基准测试为出发点,而是从实际研究工作负载出发进行优化[1]。
自主推进科学的"智能体AI"与URSA
这三台超级计算机所着眼的,是利用智能体AI自主推进科学研究本身。研究人员将能够把提出假设、选择所用工具、执行仿真、分析所得结果并重新规划下一步这一连串流程交给AI智能体[1]。
处于其核心的,是LANL以开放方式推进开发的"URSA(Universal Research and Scientific Agent)"。这是一个模块化、在吸纳反馈的同时运行的AI框架,可支撑从假设构思到实验计划、仿真执行以及结果分析的全过程,目前已在现有机型"Venado"上运行,今后还计划在Mission和Vision上运行[1]。
此次的举措并非突然开始。LANL与英伟达在CPU领域从"Grace"到"Vera"已持续合作十余年,针对实验室的仿真需求深度磨合设计[1]。三台新系统处在2024年部署的HPE Cray EX机型"Venado",即搭载英伟达"GH200 Grace Hopper Superchip"与"Grace CPU Superchip"的系统的延长线上[1]。
总结
英伟达的独立CPU"Vera"入选洛斯阿拉莫斯国家实验室的新超级计算机"Mission""Vision""Veritas"。它们与慧与联合构建,预计于2027年投入运行。实测显示其相较x86架构CPU最高快7倍,被定位为支撑自主推进科学研究的智能体AI与大规模仿真的基础。凭借GPU不断提升存在感的英伟达,如今在CPU领域也将版图拓展到了科学计算这一重要现场。
来源:https://blogs.nvidia.com/blog/nvidia-vera-cpu-los-alamos-national-laboratory/
