NVIDIA 宣布,將把讓 GPU 直接讀寫儲存的 cuFile API,以及其下層的儲存軟體堆疊一併開源[1]。這項發表配合 8 月 4 日至 6 日在美國加州聖塔克拉拉舉行的 Future of Memory and Storage(FMS)大會,同時公開的還有集結 40 多家儲存廠商的 Storage-Next 計畫[1][2]。
儲存正在變成資料通道本身
過去儲存被視為被動存放資料的場所。但如今 AI 代理消耗的資料量極為龐大,GPU 本身也能直接發出儲存請求,因而產生數以千計的並行操作[1]。
儲存系統必須一邊回應這些請求,一邊持續進行加密、壓縮、驗證與重建。NVIDIA 指出,這些資料服務正逐漸成為瓶頸。該公司技術部落格所引用的基準測試顯示,屬於 NVIDIA Vera BlueField-4 STX 一部分的 Vera CPU,在兩階段的壓縮與加密流程中,吞吐量最高可達 x86 處理器的 3.21 倍[1]。
資料該放在記憶體還是放在硬碟,這個取捨在 40 年前首次被提出時,衡量單位是分鐘。而在今日的 GPU 搭配 AI 儲存方案之下,同樣的取捨以微秒為單位進行[1]。前提改變了,設計自然也得跟著調整。
cuFile 公開,Google、Intel 與 Meta 共同維護
cuFile 是 NVIDIA GPUDirect Storage 的開源組成元件,讓 GPU 而不只是 CPU 能直接讀寫儲存。它運用數十萬條 GPU 執行緒與高頻寬記憶體等方式,達成微秒等級的資料存取[1]。
承載這些 API 的新網站列出 Google、Intel、NVIDIA 與 Meta 為首批維護者[1]。這樣的安排顯示,目標是讓整套堆疊能在多種軟硬體平台上最佳化使用,而非綁定於單一廠商的晶片。
NVIDIA 同時強調安全面的效益。快速且安全的資料與儲存存取,是預防型與偵測型資安措施的基礎。開放 cuFile 有助於讓安全脈絡、資料與儲存以 AI 驅動防禦所需的速度被取用,並支援新成立的 Open Secure AI Alliance 等倡議[1]。
40 多家廠商參與的 Storage-Next 與 SCADA 架構
Storage-Next 集結儲存廠商、控制器供應商、熱設計與散熱及調度業者,以及標準組織,共同就 GPU 主導的儲存應如何運作取得共識,並把成果轉化為可互通的開放產業標準[1]。
參與者超過 40 家領先的儲存與快閃記憶體廠商,包括 DDN、KIOXIA 與 Micron[1]。支撐這套架構的技術是 SCADA(scaled, accelerated data access),讓高度並行的 GPU 只把應用所需的資料,從儲存直接拉進自身的高速記憶體。DDN 正將 SCADA 整合進其軟體定義的 AI 原生資料智慧平台 Infinia[1]。
DDN 技術長 Sven Oehme 表示,AI 的成敗不在於組織擁有多少基礎設施,而在於使用得多有效率,並將這次合作定位為在 GPU 與資料之間建立更直接、更有效率的連結[1]。
以職責切分兼顧速度與安全
讓應用直接與磁碟溝通確實快,但處理不當就可能覆寫其他行程的記憶體。那不是功能,而是資安漏洞[1]。
SCADA 以將工作一分為二的方式迴避這個問題。應用中需要原始速度的使用者端部分,維持在可信任運算基礎之外。另一個具備特權的元件,則在初始設定階段於使用者應用與獲准存取的儲存之間建立受保護的存取路徑,並遵循 Linux 標準的資安執行協定[1]。
Storage-Next 與 SCADA 的基礎是 NVIDIA Vera BlueField-4 STX,這是一套機櫃等級的模組化平台,由 NVIDIA Vera Rubin 平台、Vera BlueField-4 儲存處理器與 Spectrum-X 乙太網路組合而成。統一的 NVIDIA DOCA 安全堆疊,讓企業能在 AI 資料路徑上持續套用政策。建構於 STX 之上的 NVIDIA CMX Context Memory Storage,則為長脈絡、多輪次的代理式 AI 推論提供 AI 原生的脈絡層[1]。
總結
NVIDIA 在 FMS 大會上開源了 cuFile API 與其下層的儲存軟體堆疊,並由 Google、Intel 與 Meta 擔任首批維護者。同時公布的還有 40 多家廠商參與的 Storage-Next 計畫,以及只把必要資料直接拉進 GPU 記憶體的 SCADA。這提醒業界,通常聚焦於運算效能的 AI 基礎設施討論,也需要從供給資料的那一側重新檢視。
