英伟达宣布进一步深化与亚马逊云科技(Amazon Web Services,AWS)的合作,强化了在生产环境中大规模运行 AI 的基础设施[1]。此次合作围绕三大支柱展开:推出搭载 GPU 的新实例 Amazon EC2 G7、将向量检索的 GPU 加速设为默认方式,以及面向训练的性能认证,目的是让企业更容易把 AI 从概念验证阶段推进到实际生产运营[1][2]。
全新 GPU 实例 Amazon EC2 G7
此次发布的核心,是搭载英伟达 RTX PRO 4500 Blackwell Server Edition GPU 的新实例 Amazon EC2 G7[1][2]。AWS 成为首家支持这款服务器级 Blackwell GPU 的主流云服务商[2]。该实例已于 2026 年 6 月 18 日开始提供,初期覆盖美国东部(俄亥俄)和美国西部(俄勒冈)两个区域[2]。
在性能方面,官方表示与上一代 G6 相比,G7 的 AI 推理性能最高提升 4.6 倍,图形处理性能最高提升 2.1 倍[1][2]。单个实例最多可搭载 8 块 GPU,GPU 显存合计达 256GB,网络支持 EFA(Elastic Fabric Adapter),带宽最高 700Gbps,本地存储为最高 7.6TB 的 NVMe SSD[1]。用户可在 1 块、2 块、4 块、8 块 GPU 的配置中选择,此外不经虚拟化、直接使用物理服务器的裸金属配置也将很快推出,让团队可以按需调整规模而无需过度配置[1]。处理器采用英特尔的 Xeon 6[2]。
适用场景也十分广泛。除 AI 推理外,同一种实例还能承担高分辨率视频与图像处理、CAD(计算机辅助设计)、虚拟桌面、游戏以及空间计算等以图形为主的工作[1]。在数据分析方面,通过在 Amazon EMR 上为 Apache Spark 使用 NVIDIA cuDF 库,可以把 GPU 加速引入分析流水线[1]。G7 可通过 AWS 的各类机器学习镜像和容器,以及 Amazon EMR、EKS、ECS 等使用,并将很快支持 Amazon SageMaker AI[1]。
把向量检索的 GPU 加速设为默认
第二大支柱是搜索平台 Amazon OpenSearch 的革新。在下一代 OpenSearch Serverless 中,由英伟达开源库 cuVS 驱动的 GPU 向量索引,将成为所有向量集合的默认处理方式[1][3]。向量检索是把文本、图像等内容转换为数值序列(向量),再按语义找出最接近内容的机制,如今已被广泛用作生成式 AI 的基础。
这一变化对检索增强生成(RAG,通过参考外部数据来提升回答准确度的方法)、语义检索、推荐系统以及自主运行的智能体 AI 等用途意义尤为重大[1]。据英伟达介绍,与仅用 CPU 构建索引相比,向量索引构建速度最高可达 10 倍,成本可降至四分之一,10 亿级规模的向量数据库也能在 1 小时内建成[1][3]。关键在于,过去往往被视为专门优化项目的 GPU 向量检索,如今变成了人人可用的 AWS 标准能力[1]。
训练性能获得「认可」:GB300 取得 Exemplar Cloud 认证
第三大支柱是面向训练负载的认证。AWS 在使用英伟达顶级系统 GB300 的训练中,取得了英伟达的 Exemplar Cloud 认证[1]。这意味着 AWS 的环境达到了英伟达依据其参考架构(作为性能标尺的参照配置)所设定的严格性能标准[1]。
英伟达将这一认证视为双方紧密协同工程的成果[1]。通过 Exemplar Clouds 计划,开发者和 AI 负责人能够更容易地判断用于大规模训练的云基础设施是否能够持续输出高性能,从而改善总拥有成本(TCO),并更高效地从规划走向生产[1]。
总结
英伟达与 AWS 此次发布,通过新款 GPU 实例 EC2 G7、借助 cuVS 把向量检索 GPU 加速标准化,以及 GB300 上的 Exemplar Cloud 认证这三点,一次性提升了 AI 基础设施的各个层面。其共同目标是在不增加运维负担的前提下,提供可在生产规模上发挥性能的基础设施,让企业更容易从试用 AI 走向真正使用 AI。随着生成式 AI 从试点走向日常业务,云一侧能在多大程度上降低落地门槛备受关注。不过,所展示的数据均基于英伟达与 AWS 自身的测量,实际效果仍取决于在各自具体负载中的验证。
来源: https://blogs.nvidia.com/blog/nvidia-aws-ai-production-scale/
