AI 推理评测公司 Artificial Analysis 公布了用于衡量智能体 AI 执行性能的业界首个基准测试"AgentPerf"的首轮结果。NVIDIA 的 Blackwell 世代系统"GB300 NVL72"位居首位,结果显示其每兆瓦电力可运行的 AI 智能体数量,最高可达该公司上一代系统的 20 倍[1]。该基准测试的特点在于,它以贴近真实作业的方式,衡量与聊天式 AI 性质不同的智能体特有负载。
智能体 AI 不是"短跑",而是"接力"
NVIDIA 表示,智能体 AI 的负载与传统的对话式 AI 存在本质区别。一次聊天应答更接近"短跑",即通过一次大语言模型(LLM)调用返回一个答案。相比之下,智能体的行为更像"接力":它会把一个目标拆解为众多步骤,并持续运行直到任务完成[1]。
由此,数十到数百次 LLM 调用被串联起来,每一次都会把不断膨胀的上下文传递给下一次。在每个交接环节,还会插入代码编译与执行、数据库检索、网页浏览等工具调用。NVIDIA 指出,这种负载并非简单地以加法增长,而是以乘法的方式膨胀[1]。
问题在于,现有的许多 AI 推理基准测试只衡量一次 LLM 调用。它们的设计用于衡量对单一请求的响应速度或并发请求数量,因此无法捕捉调用串联、工具等待和上下文膨胀所带来的智能体特有负载[1]。
"AgentPerf"还原真实的编程作业
AgentPerf 基于真实编程智能体的作业轨迹构建。智能体接收任务、读取文件、编写并修改代码、执行命令,并根据结果反复迭代——这一整套流程取材自横跨 12 种以上编程语言的真实公开代码库并加以还原[1]。
评测会衡量系统在满足既定响应性与输出速度阈值的同时,能够同时支撑多少个智能体任务。作为基准的输出 token 速度为每秒 20 至 300 个 token,首个 token 返回所需的时间(TTFT)设定在 3 至 10 秒之间[2]。工具调用本身并不实际执行,而是以具有代表性的 CPU 处理时间进行模拟,因此结果只反映计算平台之间的性能差异[1]。
首轮测试使用了大规模 MoE(混合专家)型模型"DeepSeek V4 Pro",它被定位为支撑当今高性能智能体的前沿模型的代表[1]。在 Artificial Analysis 的智能指数中,该模型得分为 52,在开源权重的推理模型中排名第二[2]。
GB300 NVL72 每兆瓦运行 20 倍的智能体
在此次首轮测试中取得最高性能的,正是 NVIDIA 的 GB300 NVL72。与上一代系统"HGX H200"相比,它每兆瓦电力可运行的智能体数量最高可达 20 倍[1]。根据 Artificial Analysis 的统计,它每兆瓦能够同时处理约 6.1 万个智能体,这一水平相当于 H200 的 20 倍[2]。
NVIDIA 解释称,这一差距源于将硬件与软件一体化设计的"协同设计(codesign)"。GB300 NVL72 将 72 块 GPU 连接成一个机架规模的系统,从而高效分散 DeepSeek V4 Pro 这类大规模 MoE 模型的执行。此外,CUDA 内核将通信与计算重叠处理,推理软件"TensorRT LLM"将输入处理与输出生成分离,从而在并发运行的智能体数量增加时仍能保持效率[1]。
在实际服务中的采用也在推进
已有多家推理服务商在 Blackwell 上使用 DeepSeek V4 Pro 提供面向智能体的处理,包括 Baseten、DeepInfra 和 Together AI[1]。
举例来说,Together AI 在 Blackwell 上为 AI 编程平台"Cursor"运行实时推理。在开发者继续工作的同时,智能体会在后台完成故障排查、功能生成和重构。DeepInfra 则完全基于 Blackwell 运营面向汽车经销商的 AI 人力平台"Pam.ai",由智能体负责预约保养、电话应答和外呼销售等工作[1]。
NVIDIA 表示,其下一代架构"Vera Rubin"已进入全面量产,将投入下一代处理能力以满足不断增长的智能体 AI 需求[1]。
总结
AgentPerf 是首个以贴近真实编程作业的方式衡量串联调用、工具等待等智能体特有负载的基准测试。在其首轮结果中,NVIDIA 的 GB300 NVL72 凭借每兆瓦 20 倍的智能体处理能力夺冠,表明 Blackwell 世代在作为智能体 AI 执行平台方面具有优势。随着比较对象的增多,它有望成为大规模运行 AI 智能体时的固定指标。
来源:https://blogs.nvidia.com/blog/nvidia-blackwell-agentperf-artificial-analysis/
