即便堆叠再快的 GPU,AI 集群的实际性能往往也达不到预期,瓶颈多半不在算力本身,而在于连接它们的网络。美国 Cornelis 于 9 月 14 日发布的 Active Compute Fabric,试图让原本只负责搬运数据的网络具备运算能力,从根本上压缩 GPU 的等待时间。同时公司还公布了 2.05 亿美元(约 318 亿日元)融资,以及与 Qualcomm Technologies 的合作。

一半的 GPU 时间都在等待

Cornelis 关注的核心是加速器利用率。随着模型和集群规模扩大,节点之间的通信与同步所占用的时间,已经超过了运算本身。内存与存储近年来都朝着感知工作负载的方向演进,唯独网络仍停留在把数据从一端搬到另一端的角色。

公司依据公开行业数据做了测算。在一套 10 万颗 GPU 的系统中,约有一半的 GPU 运行时间消耗在等待数据上,折算成金额约为每年 16.8 亿美元(约 2,600 亿日元),电力则相当于 500 吉瓦时,接近 4.8 万户美国家庭的年用电量。测算前提为每 GPU 小时 4 美元(约 620 日元)、年运行 8,400 小时、非生产时间约 50%。

※1 美元 = 155 日元换算

从搬运数据,到在网络中计算

Active Compute Fabric 希望在网络侧消化这部分空转时间,核心有三点:不丢包的无损传输、在网络内部完成的加速卸载,以及可编程运算能力。由于数据在传输途中即可被处理,原本需要占用 GPU 的集合通信操作,可以转移到网络中执行。

可编程这一点被公司反复强调。AI 算法与软件的迭代周期很短,若把功能固化进硬件,几年之后网络本身反而会成为拖累。保留后续加载新功能的空间,才能让客户已经购置的加速器用得更久。

整套架构建立在行业标准之上。机柜内部的纵向扩展采用 UALink 与 ESUN,机柜之间的横向扩展遵循 Ultra Ethernet 规范,不把客户绑定在特定厂商的加速器上。首席执行官 Lisa Spelman 表示,客户需要的是机柜级的完整方案,同时不被单一厂商或架构锁定。

Qualcomm 为何同台亮相

此次发布中出现了 Qualcomm Technologies 的身影。该公司数据中心业务 EVP 兼总经理 Tony Pialis 指出,随着 AI 系统持续扩大,在机柜内高效搬运数据的重要性已不亚于算力本身。利用率偏低会直接反映在推理的成本结构上,把运算、内存与网络分开考虑的思路已经难以为继。两位高管在 AI Infra Summit 的主题演讲中一同登台。

网络不再是事后附加项,而是设计的起点,这一判断与同场其他厂商的论述相互呼应。随着行业转向机柜级架构,能为客户保留多少选择空间,正成为差异化的关键。

融资将投向下一代产品

2.05 亿美元融资将用于进军纵向扩展领域,并推动下一代产品上市。参与投资的 IAG Capital Partners 合伙人 Joel Whitley 认为,面向 AI 的开放标准网络到 2030 年将形成超过 550 亿美元(约 8.5 万亿日元)的市场规模,并表示整体 AI 投入中有多少能转化为实际回报,取决于网络。

产品方面,400Gb/s 的 CN5000 已经出货。SuperNIC 在 PCIe Gen5 x16 上提供 1 至 2 个 400Gb/s 端口,交换机可汇聚 48 个 400Gb/s 端口、全双工 38.4Tb/s,机框式产品则达到 576 端口、230.4Tb/s。800Gb/s 世代的 CN6000 正在向客户送样,规模供货预计在 2026 年第四季度。CN6000 是支持 Omni-Path、RoCEv2 与 Ultra Ethernet 的 800G SuperNIC,通过 PCIe 6.0 接入。

Cornelis 源自 Intel 高性能互连业务的分拆,延续了 Omni-Path 的技术脉络。软件方面提供基于 libfabric 的开源 OPX,使用 MPI、OpenSHMEM 与 RCCL 编写的应用无需改动代码即可运行。在 Lenovo 基于 ThinkSystem SC750 V4 与 Intel Xeon 6 的验证中,节点间实测带宽为 378 至 391Gb/s,平均 385Gb/s,延迟约 1.1 微秒。

总结

Active Compute Fabric 把网络从单纯的布线重新定位为算力体系的一部分。如果 10 万 GPU 规模下每年约 2,600 亿日元被等待时间吞掉的测算成立,那么削减等待时间的投资回报,会高于单纯堆叠带宽。CN5000 已出货、CN6000 将在 2026 年末规模供货,加上建立在 UALink 与 Ultra Ethernet 等标准之上,它能否在英伟达主导的 AI 网络市场中成为现实可行的选项,值得观察。