資料中心業者 Equinix 發表了針對企業的分散式 AI 推論方案 Equinix Inference Exchange。這套方案把 NVIDIA 經過驗證的架構與 Together AI 的推論平台,疊在該公司橫跨全球 77 個都會區的自有資料中心之上,預計於 2027 年第一季開始提供。
爭論焦點已從訓練轉向「推論要在哪裡跑」
關於生成式 AI 的討論容易集中在模型效能,但真正影響企業落地的是部署位置,也就是訓練完成的模型究竟在哪裡執行。回應速度、每個 token 的成本、資料會不會流出境外,基本上都由推論執行的地點決定。
Equinix 這次端出的思路,是用互連基礎設施而非單一雲端來處理部署問題。該公司在全球 77 個都會區營運超過 280 座資料中心,接入 230 個雲端 onramp,串連超過 10,500 家企業。前十大 AI 模型供應商中有 8 家、前十大 AI 雲端業者中有 9 家部署在其設施上,這種不偏向特定廠商的中立位置一直是它的賣點。
發表地點在美國加州紅木城,場合是該公司首度舉辦的客戶與夥伴活動 Equinix Horizon。
電力、GPU 與模型平台切成三層
Inference Exchange 好懂的地方,在於把職責乾淨地切成三層。
Equinix 負責底層,提供電力、進階冷卻設備與維運支援服務。這些透過該公司的互連服務 Equinix Fabric,連到工作負載所需的雲端、網路與 AI 業者。
在這之上,NVIDIA 提供經過驗證的組態範本 Enterprise Reference Architectures,以及針對 AI 工廠最佳化的基礎設施,目標是把吞吐量拉到最高、把每個 token 的成本壓到最低,省去企業從零設計組態的工夫。
最上層的模型平台,由這次新加入的夥伴 Together AI 承接。其平台支援超過 200 個開源模型,同時備有靠共用提升效率的多租戶組態,以及供需要專屬資源的工作負載使用的單租戶組態。
Together AI 共同創辦人兼執行長 Vipul Ved Prakash 表示,企業不該被迫在模型效能與維運彈性之間二選一。NVIDIA 負責全球 AI 雲端基礎設施生態系的副總裁 Raj Mirpuri 則說,這樣的組合能讓企業把智慧放在離資料、應用與客戶更近的位置。
設想中的 3 種用法
Equinix 列出 3 種用途。
第一是都會邊緣推論,在靠近使用者與資料的地方跑推論,把延遲壓下來。第二是轉向開源模型,替那些為了控管成本或避免廠商鎖定而離開封閉模型的企業,準備一個可用於正式環境的落腳處。第三是主權 AI,讓身處高度監管產業或特定地區的企業,能在符合資料存放地與資料主權要求的位置執行工作負載。
這 3 種用法都是繞著「能放在哪裡」而不是「跑得多快」來整理,正好對上企業把 AI 從實驗推進到正式營運後遇到的難處。The Futurum Group 負責 AI 平台的 Nick Patience 也指出,隨著工作負載分散在不同業者與資料來源之間,效能、成本與治理已成為經營層級的課題。
連線這一側由 Fabric One 承擔
同一場活動上,Equinix 也發表了把連線本身自動化的代管服務 Equinix Fabric One。使用者只要指定想連線的對象與需求,服務就會判斷並自動開通所需連線,其中包含路由、加密、備援與容錯移轉。指定方式除了入口網站與 API,也支援自動化工作流程、來自代理程式的請求,以及自然語言提示。
底層採用的是 AWS 與 Google Cloud 共同制定的開源連線規範 OpenAPI 3.0 Interconnect。目標是讓應用程式與 AI 代理程式不必經過人工,就能以程式方式探索、要求並開通連線,明顯是為正在轉向代理型架構的企業所設計。
Fabric One 將於 2026 年下半年開始 Beta 測試,先在北美市場於 2027 年內正式提供。加上 Inference Exchange 的 2027 年第一季,這兩塊要湊齊都得等到明年。
總結
Equinix Inference Exchange 把 AI 推論重新看成「要在哪個都會區的哪座設施執行」,而不是「要在哪朵雲上執行」。Equinix 出電力與連線,NVIDIA 出組態範本,Together AI 出開源模型的執行平台,企業自行組裝的負擔因此減輕。提供時間從 2027 年第一季開始,搭配負責連線自動化的 Fabric One,實際成色恐怕要到明年才看得清楚。
