NVIDIA 宣布,其开源大语言模型「Nemotron 3 Ultra」在广受欢迎的智能体开发平台 LangChain 的测试中,取得了开源模型中的最高精度[1]。LangChain 将自家的智能体运行环境「Deep Agents」针对 Nemotron 3 Ultra 进行调优后,该模型在完成与主流闭源模型相当的任务的同时,单次推理成本仅为后者的十分之一。本文将梳理这一结果的具体内容,以及 NVIDIA 借此提出的「开放式 AI 技术栈」这一理念。

不重新训练模型,只优化「使用方式」

此次成果耐人寻味之处在于,Nemotron 3 Ultra 本身并未被改动。LangChain 没有重新训练模型,而是调整了环绕模型运行的环境,即所谓的「harness(运行框架,为模型提供支撑的底层机制)」。具体而言,团队重新审视了系统提示词、工具说明文本,以及处理步骤之间的中间件[1]。

LangChain 团队首先在公开的 Deep Agents 基准上运行 Nemotron 3 Ultra,再顺着执行记录找出模型在何处失分。随后,他们没有重新训练模型,而是通过调整运行框架来提升精度。联合创始人兼首席执行官 Harrison Chase 表示,打造更好智能体的捷径是持续改进模型周围的系统,并指出当团队能够将记忆、工具使用、评估与模型行为一并调优时,效果会不断累积[1]。

调优后的配置已通过 LangChain 公开,正在将 Deep Agents 与 Nemotron 3 Ultra 结合使用的开发者可以立即上手。不过,这些数据由 NVIDIA 与 LangChain 公布,实际使用体验会因任务与条件而异,因此宜结合第三方验证来看待。

Nemotron 3 Ultra 是一款怎样的模型

Nemotron 3 Ultra 是一款总参数量达 5,500 亿的大型模型,但它采用「Mixture-of-Experts(MoE,混合专家,即按需选用多个专家模型的方式)」架构,单次处理实际启用的参数仅为 550 亿[2]。这让庞大的模型也能压低算力开销,其设计定位是充当长时间持续运行的智能体的指挥中枢。

其内部还有多项巧思。模型将擅长高效处理长上下文的「Mamba」层,与能够精确取回具体信息的传统 Transformer 层结合,构成混合架构;此外还采用名为「NVFP4」的精度格式,使一款模型可以运行在 Hopper、Blackwell、Ampere 等不同世代的 NVIDIA GPU 上[2]。据 NVIDIA 称,其处理速度最高可达同类其他开源模型的 5 倍。

开放的姿态同样明确。Nemotron 3 Ultra 连同权重(参数)、训练数据乃至训练配方(recipe)一并开放,采用 Linux 基金会制定的宽松许可证「OpenMDW-1.1」发布。用户可通过 Hugging Face、OpenRouter 以及 build.nvidia.com 获取并试用,既能在自有基础设施上运行,也能在云端运行[2]。

高举「可被拥有的 AI」旗号的开放式技术栈

NVIDIA 此次强调的并非单个模型,而是把安全运行智能体所需的一整套组件一并开放的理念。其核心是一份开放的参考蓝图「NVIDIA NemoClaw for LangChain Deep Agents」[1]。它将针对 Nemotron 3 Ultra 调优的 LangChain Deep Agents,与用于安全执行智能体动作的运行环境「NVIDIA OpenShell」结合在一起。

NVIDIA 解释称,通过备齐开源模型、开源运行框架,以及开放且安全的执行环境,企业便能够自行拥有整套机制、按业务需要加以改造,并在任何地方运行。当智能体不再只是回答问题,而是在企业核心系统内部真正动手操作时,这种「可被拥有」的价值将进一步凸显[1]。

医疗领域的 Abridge、通信软件厂商 Amdocs、内容管理企业 Box 等已开始将专用智能体嵌入自家平台。全球咨询巨头 EY 也正借助 NemoClaw 蓝图扩展其 NVIDIA 相关的落地支持。LangChain 的智能体开发平台月下载量超过 2 亿次,为其底层针对 Nemotron 3 Ultra 优化的意义不容小觑[1]。

总结

此次围绕 Nemotron 3 Ultra 的话题,可视为一个案例,说明性能与成本不仅取决于模型本身的「聪明程度」,也取决于运行模型的底层机制设计。开源模型搭配开源技术栈,在逼近主流闭源模型的同时压低成本——这一主张在日常业务中究竟能被复现到何种程度,仍有待观察。接下来,开发者与企业如何驾驭这套开放机制,将成为关注焦点。

出典:https://blogs.nvidia.com/blog/nemotron-langchain-agents-open-stack/

出典:https://developer.nvidia.com/blog/nvidia-nemotron-3-ultra-powers-faster-more-efficient-reasoning-for-long-running-agents/