AI 推論評測公司 Artificial Analysis 公布了用於衡量代理 AI 執行效能的業界首個基準測試「AgentPerf」首輪結果。NVIDIA 的 Blackwell 世代系統「GB300 NVL72」位居首位,結果顯示其每兆瓦電力可運行的 AI 代理數量,最高可達該公司前一代系統的 20 倍[1]。此基準測試的特點在於,它以貼近真實作業的方式,衡量與聊天式 AI 性質不同的代理特有負載。
代理 AI 不是「短跑」,而是「接力」
NVIDIA 表示,代理 AI 的負載與傳統的對話式 AI 有著本質上的差異。一次聊天回應較接近「短跑」,也就是透過一次大型語言模型(LLM)呼叫回傳一個答案。相較之下,代理的行為更像「接力」:它會把一個目標拆解成眾多步驟,並持續運行直到任務完成[1]。
如此一來,數十到數百次 LLM 呼叫被串接起來,每一次都會把不斷膨脹的脈絡(context)傳遞給下一次。在每個交接環節,還會插入程式碼編譯與執行、資料庫檢索、網頁瀏覽等工具呼叫。NVIDIA 指出,這種負載並非單純以加法增長,而是以乘法的方式膨脹[1]。
問題在於,現有的許多 AI 推論基準測試只衡量一次 LLM 呼叫。它們的設計用於衡量對單一請求的回應速度或並行請求數量,因此無法掌握呼叫串接、工具等待與脈絡膨脹所帶來的代理特有負載[1]。
「AgentPerf」重現真實的程式開發作業
AgentPerf 是以真實程式開發代理的作業軌跡為基礎建構而成。代理接收任務、讀取檔案、撰寫並修改程式碼、執行指令,並根據結果反覆迭代——這一整套流程取材自橫跨 12 種以上程式語言的真實公開程式碼儲存庫並加以重現[1]。
評測會衡量系統在滿足既定回應性與輸出速度門檻的同時,能夠同時支撐多少個代理任務。作為基準的輸出 token 速度為每秒 20 至 300 個 token,首個 token 回傳所需的時間(TTFT)設定在 3 至 10 秒之間[2]。工具呼叫本身並不實際執行,而是以具代表性的 CPU 處理時間進行模擬,因此結果只反映運算平台之間的效能差異[1]。
首輪測試使用了大規模 MoE(混合專家)型模型「DeepSeek V4 Pro」,它被定位為支撐當今高效能代理的前沿模型代表[1]。在 Artificial Analysis 的智慧指數中,該模型得分為 52,在開放權重的推理模型中排名第二[2]。
GB300 NVL72 每兆瓦運行 20 倍的代理
在此次首輪測試中取得最高效能的,正是 NVIDIA 的 GB300 NVL72。與前一代系統「HGX H200」相比,它每兆瓦電力可運行的代理數量最高可達 20 倍[1]。根據 Artificial Analysis 的統計,它每兆瓦能夠同時處理約 6.1 萬個代理,這一水準相當於 H200 的 20 倍[2]。
NVIDIA 解釋,這項差距源自將硬體與軟體一體化設計的「協同設計(codesign)」。GB300 NVL72 將 72 顆 GPU 連接成一個機架規模的系統,從而有效分散 DeepSeek V4 Pro 這類大規模 MoE 模型的執行。此外,CUDA 核心將通訊與運算重疊處理,推論軟體「TensorRT LLM」將輸入處理與輸出生成分離,使並行運行的代理數量增加時仍能維持效率[1]。
在實際服務中的採用也在推進
已有多家推論服務商在 Blackwell 上使用 DeepSeek V4 Pro 提供面向代理的處理,包括 Baseten、DeepInfra 與 Together AI[1]。
舉例來說,Together AI 在 Blackwell 上為 AI 程式開發平台「Cursor」運行即時推論。在開發者持續工作的同時,代理會在背景完成除錯、功能生成與重構。DeepInfra 則完全以 Blackwell 營運面向汽車經銷商的 AI 人力平台「Pam.ai」,由代理負責預約保養、電話接聽與外撥銷售等工作[1]。
NVIDIA 表示,其下一代架構「Vera Rubin」已進入全面量產,將投入下一代處理能力以滿足不斷成長的代理 AI 需求[1]。
總結
AgentPerf 是首個以貼近真實程式開發作業的方式,衡量串接呼叫、工具等待等代理特有負載的基準測試。在其首輪結果中,NVIDIA 的 GB300 NVL72 憑藉每兆瓦 20 倍的代理處理能力奪冠,顯示 Blackwell 世代在作為代理 AI 執行平台方面具有優勢。隨著比較對象的增加,它有望成為大規模運行 AI 代理時的固定指標。
來源:https://blogs.nvidia.com/blog/nvidia-blackwell-agentperf-artificial-analysis/
