就算堆上再快的 GPU,AI 叢集的實際表現往往還是達不到規格書上的數字,瓶頸多半不在運算本身,而在串起它們的網路。美國 Cornelis 於 9 月 14 日公開的 Active Compute Fabric,試圖讓原本只負責搬運資料的網路具備運算能力,直接縮短 GPU 的等待時間。同時公司也公布了 2.05 億美元(約 318 億日圓)募資,以及與 Qualcomm Technologies 的合作。
一半的 GPU 時間都花在等待
Cornelis 看重的是加速器使用率。隨著模型與叢集規模擴大,節點之間的通訊與同步所佔的時間,已經超過運算本身。記憶體與儲存近年都朝著理解工作負載的方向演進,只有網路仍停留在把資料從一端搬到另一端的角色。
該公司依據公開的產業資料進行了試算。在一套 10 萬顆 GPU 的系統中,約有一半的 GPU 運轉時間耗在等待資料上,換算成金額約為每年 16.8 億美元(約 2,600 億日圓),電力則相當於 500 吉瓦時,接近 4.8 萬戶美國家庭的年用電量。試算前提為每 GPU 小時 4 美元(約 620 日圓)、年運轉 8,400 小時、非生產時間約 50%。
※1 美元 = 155 日圓換算
從搬運資料,到在網路裡計算
Active Compute Fabric 希望在網路端吸收這段空轉時間,支柱有三項:不丟封包的無損傳輸、在網路內部完成的加速卸載,以及可程式化的運算能力。由於資料在傳輸途中就能被處理,原本必須佔用 GPU 的集合通訊作業,可以改由網路承擔。
可程式化這一點是該公司強調的重點。AI 演算法與軟體的更新週期很短,若把功能固化在硬體裡,幾年後網路本身反而會拖累整體。保留日後追加功能的空間,客戶已經購入的加速器才能用得更久。
整套架構建立在產業標準之上。機櫃內部的垂直擴展採用 UALink 與 ESUN,機櫃之間的水平擴展則依循 Ultra Ethernet 規範,不把客戶綁死在特定廠商的加速器上。執行長 Lisa Spelman 表示,客戶要的是機櫃等級的完整方案,同時不被單一廠商或架構鎖住。
Qualcomm 為何一同登場
這次發表中出現了 Qualcomm Technologies。該公司資料中心事業 EVP 兼總經理 Tony Pialis 指出,隨著 AI 系統持續放大,在機櫃內有效率地搬運資料,重要性已不亞於運算本身。使用率偏低會直接反映在推論的成本結構上,把運算、記憶體與網路分開處理的思維已經行不通。兩位高層在 AI Infra Summit 的主題演講中同台。
網路不再是事後補上的環節,而是設計的起點,這樣的看法與同一場活動中其他廠商的說法互相呼應。隨著產業轉向機櫃等級架構,能替客戶保留多少選擇空間,正逐漸成為差異化的重點。
募得資金投入下一代產品
2.05 億美元的資金將用於進軍垂直擴展領域,並推動下一代產品上市。參與投資的 IAG Capital Partners 合夥人 Joel Whitley 認為,面向 AI 的開放標準網路到 2030 年將形成超過 550 億美元(約 8.5 兆日圓)的市場,並表示整體 AI 建設投入中有多少能轉化為實際回報,取決於網路。
產品方面,400Gb/s 的 CN5000 已經出貨。SuperNIC 在 PCIe Gen5 x16 上提供 1 至 2 個 400Gb/s 連接埠,交換器可匯聚 48 個 400Gb/s 連接埠、全雙工 38.4Tb/s,機箱式產品則達到 576 埠、230.4Tb/s。800Gb/s 世代的 CN6000 正在向客戶送樣,規模供貨預計落在 2026 年第四季。CN6000 是支援 Omni-Path、RoCEv2 與 Ultra Ethernet 的 800G SuperNIC,透過 PCIe 6.0 連接。
Cornelis 源自 Intel 高效能互連事業的分拆,延續了 Omni-Path 的技術脈絡。軟體方面提供以 libfabric 為基礎的開源 OPX,使用 MPI、OpenSHMEM 與 RCCL 撰寫的應用程式不需修改程式碼即可執行。在 Lenovo 以 ThinkSystem SC750 V4 搭配 Intel Xeon 6 的驗證中,節點之間的實測頻寬為 378 至 391Gb/s,平均 385Gb/s,延遲約 1.1 微秒。
總結
Active Compute Fabric 把網路從單純的線路,重新定位為運算體系的一部分。若 10 萬 GPU 規模下每年約 2,600 億日圓被等待時間吃掉的試算成立,削減等待時間的投資效益,會高於單純加大頻寬。CN5000 已出貨、CN6000 將於 2026 年底規模供貨,加上建立在 UALink 與 Ultra Ethernet 等標準之上,它能否在 NVIDIA 主導的 AI 網路市場中成為務實的選項,值得後續觀察。
