英伟达(NVIDIA)于 6 月 4 日发布了面向长时间运行的 AI 智能体(自主逐步完成任务的 AI)的新开放模型“Nemotron 3 Ultra”[1][2]。它采用总参数 5500 亿、实际激活仅 550 亿的架构,NVIDIA 称其兼顾了强大的推理能力与处理速度[2]。同一天,该模型也在 Ollama 的云端上线,只需一条命令即可试用[1][3]。
“Nemotron 3 Ultra”是什么
Nemotron 3 Ultra 是一款总参数 5500 亿、激活参数 550 亿的混合专家(MoE,每次输入只使用一部分专门参数的设计)模型[2]。它是公开了权重、训练配方和许可的开放模型,开发者可以对其进行微调以适配自己的用途[2]。
NVIDIA 借这款模型瞄准的,是在众多步骤之间长时间运行的“智能体”的指挥中枢角色[2]。与只回答单个问题的聊天机器人不同,智能体会制定计划、调用工具、把工作交给其他智能体、接收结果,然后再次推理,如此往复多次[2]。这个过程中往来的令牌(AI 处理文本的最小单位)会迅速增加,容易推高成本并加大偏离目标的风险[2]。NVIDIA 设想将负责复杂判断的高性能模型与处理大量执行的轻量模型组合使用,并说明 Nemotron 3 Ultra 负责其中的“困难判断”[2]。
为提升效率而做的设计
Nemotron 3 Ultra 融入了多项旨在兼顾性能与效率的设计[2]。它采用混合架构,将高效处理长上下文的“Mamba”层与能够准确回忆所需信息的“Transformer”层结合在一起,从而在长时间任务中也能保持上下文[2]。同时,它支持使用 NVIDIA 自有的 4 位浮点格式“NVFP4”进行量化(让模型变轻的压缩手段),该公司称由此可在多种 GPU 上运行[2]。
在性能方面,NVIDIA 表示其吞吐量(单位时间的处理量)达到同类其他开放模型的 5 倍[2]。该公司还称,在衡量编程能力的“SWE-bench”和“Terminal-bench 2.0”测试中,模型用更少的令牌完成任务,将智能体任务的成本最多降低 30%[2]。在处理长上下文的能力上,NVIDIA 称其在百万令牌规模的评测“Ruler”中取得了 95% 的精度[2]。不过需要留意的是,这些都是 NVIDIA 自行公布的测量值,并非第三方验证。
在 Ollama 云端即可立即试用
伴随发布,Nemotron 3 Ultra 可通过 Ollama 的云端使用[1]。在安装 Ollama 之后,运行以下命令即可立即开始对话[1]。
ollama run nemotron-3-ultra:cloud
它也可以嵌入编程辅助工具中使用。例如要在 Claude Code 中运行,可按如下方式启动[1]。
ollama launch claude --model nemotron-3-ultra:cloud
除此之外,它还支持与 Codex App、OpenClaw、Hermes Agent、OpenCode 等工具的集成[1]。同时也提供了通过 API、Python 和 JavaScript 的调用方式[3]。据 Ollama 的模型页面介绍,云端版本支持工具调用和思考过程的显示,可处理的上下文长度标注为 25.6 万令牌[3]。与 NVIDIA 给出的百万令牌评测数值相比,目前 Ollama 云端提供的上下文上限是较为保守的设置[2][3]。
总结
Nemotron 3 Ultra 是 NVIDIA 面向长时间运行智能体指挥中枢的开放模型,其混合专家架构与 NVFP4 量化被称可兼顾性能与效率[2]。它还支持 Ollama 云端,只需一条命令就能从本地试用,这一点颇具吸引力[1][3]。性能数值目前以厂商公布为准,但公开发布的大模型选择不断增多,其意义不可小觑。
