随着AI从试点走向生产级的"AI工厂",衡量性能的标尺正从芯片的峰值规格转向"每个token的成本"。英伟达表示,借助与自家GPU、CPU和网络协同设计的全栈推理软件,仅用一个月就在Blackwell平台上把DeepSeek V4模型的token成本最高降低到原来的五分之一[1]。为什么决定推理经济性的不只是硬件,还有软件,本文梳理要点。
每个token的成本成为新指标
过去的指标以单颗芯片的峰值性能为中心。英伟达指出,在生产环境中,真正重要的是系统能在每一美元、每一瓦特以及所需的延迟范围内,交付多少有用的token[1]。
这一转变的背后是智能体AI的兴起。传统的网页、搜索和SaaS负载是可预测的:一次请求可能加载页面,或对数据库进行读写,遵循相似的软件路径,通过增加同类服务器即可扩展。而智能体AI不同,它会推理、规划、调用工具、启动专门的子智能体,并在多轮工作流中管理庞大的上下文[1]。
由此,单次请求会变成一个分布式计算问题,可能横跨数百个子智能体、数千项任务和多个大语言模型,运行在GPU、CPU、DPU和存储之上。英伟达认为,决定这种复杂性是沦为浪费的算力、还是转化为更低的token成本,关键在于软件[1]。
提升性能的三个层次
英伟达的推理软件被描述为连接三个层次,从而把单点优化转化为系统级性能[1]。
第一层是生产运营,负责协调分布式服务、编排、自动扩缩容和内存管理,让推理运行在合适的算力与存储之上。第二层是应用加速,通过计算与通信重叠、内核融合等运行时优化高性能地运行模型,同时为开发者保留调优和定制的空间。第三层是基础设施访问,让开发者无需逐一处理每个设备的指令集和数据传输协议,就能调用GPU、网络、内存和系统能力[1]。
当这些层次作为一个系统协同工作时,单点优化便会叠加放大。英伟达表示,分离式服务、通过NVLink实现的大规模专家并行、NVFP4精度以及多token预测,各自单独都有效果,组合起来则可将吞吐量提升最高20倍[1]。正是这种软件的层层叠加,支撑了在Blackwell上一个月内把DeepSeek V4的token成本最高降至五分之一的成果[1]。
采用者与开源飞轮
实际部署已经在推进。Baseten使用开源的NVIDIA TensorRT-LLM库,在Blackwell上为推理、编码和长上下文负载提供DeepSeek V4 Pro,并叠加自有的运行时优化,使每秒token数最高提升50%。Cognition借助推理框架NVIDIA Dynamo管理推理GPU,获得了扩展强化学习负载的路径。Deep Infra在Blackwell上从首日起就高性能地提供前沿开源模型,Together AI则用TensorRT-LLM帮助Cursor把模型优化快速推进到生产环境,支撑其实时编码体验[1]。
这一基础因开源生态而被进一步放大。如今广泛使用的众多AI框架和推理项目都建立在NVIDIA CUDA之上,因此新的研究与优化能在英伟达GPU上从首日起以领先性能运行[1]。PyTorch就是典型代表:它于2016年以原生CUDA支持问世,与英伟达的架构同步演进,让开发者得以使用Tensor Core、Transformer Engine和NVFP4等技术[1]。
这种效果也体现在具体数字上。英伟达介绍,投机解码技术DFlash在现有硬件上将吞吐量提升最高15倍,FastVideo可在不到五秒内生成1080p视频。当新的开源模型DeepSeek V4发布时,推理框架vLLM和SGLang从首日起就备好了面向Blackwell的部署方案,约一个月内Blackwell上的性能提升最高5倍,token成本降至此前的约五分之一[1]。开发者越是打磨CUDA原生的推理路径,这些改进就越会通过生产部署回馈整个生态。英伟达把这一循环称为"开源飞轮"[1]。
需要说明的是,文中引用的倍数和成本降幅均由英伟达自行公布。读者在判断实际效果时,应结合第三方验证,以及不同模型和负载条件带来的差异来看待。
总结
英伟达认为,推理的竞争力已从芯片的原始性能,转向由软件带来的每个token成本。连接三个层次的全栈设计,加上以CUDA为核心的开源生态,支撑了它在Blackwell上一个月内把DeepSeek V4成本最高降至五分之一的说法。除了硬件的代际更替,持续的软件改进如今正成为推理经济性的关键。
出典:https://blogs.nvidia.com/blog/inference-software-lowest-token-cost/
