英伟达在其 Nemotron 3 开源模型家族中新增了 Nemotron 3.5 Lightning[1]。这是一款 300 亿参数的混合专家(MoE)模型,专门用于在常驻运行的智能体内部高速处理大量细碎任务。与之同时发布的还有 NeMo Switchyard,一个把工作流中每一步都路由到最合适模型的开源路由库。

常驻智能体依靠的是一组模型

这次发布的前提是:现代智能体不是靠单一模型运行,而是由多个模型组成的集合[1]。Nemotron 3 Ultra 或 GPT-5.6 这类推理能力强的模型负责规划和编排整个流程,而代码审查、工具调用、安全告警监控、账单问题应答等具体任务则交给更小、更快的模型完成。

Nemotron 3.5 Lightning 正处在这条分工线的「小而快」一侧。它是继 Nemotron 3 Nano 之后推出的型号,官方称其在长时间运行的智能体负载中是同级别效率最高的模型[1]。

输出速度最高 4 倍,任务完成时间缩短 30%

英伟达给出的数据是:与同级别其他模型相比,输出速度最高提升 4 倍,智能体任务完成时间缩短 30%[1][2]。对于需要长期在线运行的智能体来说,单次调用的延迟会直接反映到运营成本和使用体验上,因此在这一点上下功夫是合理的。

该模型的开发得到了 Nemotron Coalition 成员的贡献,他们提供了评测方法、推理软件和数据集[1]。由于权重开放,用户可以借助 NVIDIA NeMo,用自有的领域数据、工具和业务流程进行后训练,从而提升特定任务的准确率。

面向不同行业的定制已经在进行中[1]。安全领域有 CrowdStrike,法律服务领域是 Harvey 与 Trajectory 合作,代码审查方面则是 CodeRabbit 与 Baseten 合作。此外,Lila Sciences 正在提升物理与生命科学领域智能体任务的推理能力,Fastino Labs 在软件开发、金融和医疗健康负载上取得了领先的准确率。

从桌面 RTX PC 一直用到数据中心

硬件覆盖面广也是这款模型的卖点。它可以在 NVIDIA RTX PC、DGX Spark、DGX Station 和 Jetson 等本地环境运行,也能扩展到边缘 AI 设备、RTX PRO 工作站、数据中心和云环境[1]。能在本地运行,也就意味着数据不必外流。

在本地部署方面,英伟达与 vLLM、Ollama、llama.cpp 和 LM Studio 展开协作,同时提供 NVFP4 与 GGUF 两种格式[2]。Unsloth 在首日即提供支持,通过 Unsloth Studio 提供经过优化和量化的模型。支持的硬件还包括 OEM 的 GB10 系统和 GB300 桌边机型,搭载 Blackwell 的整机可从 Acer、ASUS、Dell Technologies、Exxact、GIGABYTE、HP、Lenovo、MSI 和 Supermicro 获得。

训练透明度方面也有说明。英伟达在每次 Nemotron 发布时都会在授权允许的范围内公开训练数据与方法,这次还一并发布了用于代码智能体后训练的强化学习数据集 Nemotron-RL-Agentic-Terminal-Pivot[1]。这既便于追溯和审计,也可用于训练其他模型。

NeMo Switchyard 自动决定「该调用哪个模型」

NeMo Switchyard 是面向 AI 智能体的开源模型路由库[1]。有的模型擅长编程,有的擅长推理,有的适合轻量任务,还有的针对本地运行做了优化。如果始终只用一个默认模型,要么多花钱,要么损失质量;而手工搭建路由逻辑,本身又会变成拖慢部署进度的集成工作。

Switchyard 把这一判断自动化到工作流的每一步。开发者可以按照质量、延迟、成本等优先级调整或替换路由算法,并且无需改写现有应用即可接入[1]。英伟达的内部基准测试显示,Switchyard 在保持前沿级准确率的同时,把任务完成成本降到了仅使用 Opus 4.8 时的约三分之一[1]。

合作伙伴给出的数据相当具体[1]。Boomi 评估了 5 项路由能力,实现了 100% 的领域路由准确率,把 59% 的流量导向速度快 5 倍的微调模型,并将后段对话的延迟降低 21%。LangChain 在 145 个多轮 Deep Agents 任务中,仅把 7% 的调用发往前沿模型,成本下降 74%,准确率仅损失 6%。Ramp 在 Ramp SWE-Bench 上达到了与前沿模型相当的表现,同时成本降低 58%、运行时间缩短 33%。

此外,Cognition 把分级路由器集成进 Devin Desktop,在 FrontierCode Main 上把平均成本降低了 28%。Classmethod 在内部运行 opencode 与 Fireworks 负载,初步测试显示成本下降 27%。Cadence 借助 ChipStack AI Super Agent 在形式验证场景中把效率提升了 9.9%。Kong 已在自家 AI Gateway 中原生提供该路由能力,LiteLLM 正将其作为代理层插件加入,Nous Research 已集成到 Hermes 中,Siemens 则在 Fuse EDA AI 智能体中进行基准测试。

获取渠道

Nemotron 3.5 Lightning 已在 Hugging Face、ModelScope、OpenRouter 上线,并作为 NVIDIA NIM 微服务在 build.nvidia.com 提供,同时也可通过英伟达云合作伙伴以及各类后训练与推理平台使用[1]。NeMo Switchyard 已在 GitHub 开放,接入合作伙伴平台的工作也将在近期完成。

总结

Nemotron 3.5 Lightning 并不是冲着智能榜单第一名去的,它要解决的是智能体运行过程中反复出现的数百次细碎调用如何又快又便宜地完成。把 4 倍的输出速度与 NeMo Switchyard 的自动路由结合起来,目前把所有请求都发给前沿模型的团队有望大幅压低成本。既然权重开放、桌面 RTX PC 也能跑,能否用自有数据完成后训练,很可能就是能不能落地的分水岭。

来源[1] https://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/

来源[2] https://blogs.nvidia.com/blog/local-ai-open-source-models-agents-nemotron/