NVIDIA 在旗下 Nemotron 3 開源模型家族中新增了 Nemotron 3.5 Lightning[1]。這是一款 300 億參數的混合專家(MoE)模型,專門用來在長時間駐留運作的代理程式(agent)內部,高速處理大量瑣碎的工作。同時發表的還有 NeMo Switchyard,這是一套把工作流程中的每一個步驟導向最合適模型的開源路由函式庫。
長期駐留的代理程式靠的是一組模型
這次發表的前提是:現代的代理程式並非依靠單一模型運作,而是由多個模型組成的集合[1]。像 Nemotron 3 Ultra 或 GPT-5.6 這類推理能力強的模型負責規劃與調度整個流程,而程式碼審查、工具呼叫、資安警示監控、帳務問題回覆等個別工作,則交由更小、更快的模型處理。
Nemotron 3.5 Lightning 站在這條分工線的「小而快」這一側。它承接 Nemotron 3 Nano 之後推出,官方表示在長時間執行的代理程式負載中,它是同級距效率最高的模型[1]。
輸出速度最高 4 倍,任務完成時間縮短 30%
NVIDIA 提出的數字是:與同級距的其他模型相比,輸出速度最高提升 4 倍,代理程式的任務完成時間縮短 30%[1][2]。對於需要長時間持續運作的代理程式來說,單次呼叫的延遲會直接反映在營運成本與使用感受上,因此在這一點上下功夫相當合理。
這款模型的開發獲得 Nemotron Coalition 成員的貢獻,他們提供了評測方法、推論軟體與資料集[1]。由於權重公開,使用者可以透過 NVIDIA NeMo,以自有的領域資料、工具與作業流程進行後訓練,藉此提升特定任務的準確度。
各產業的客製化也已經展開[1]。資安領域有 CrowdStrike,法律服務領域是 Harvey 與 Trajectory 合作,程式碼審查方面則是 CodeRabbit 與 Baseten 合作。此外,Lila Sciences 正在提升物理與生命科學領域代理任務的推理能力,Fastino Labs 則在軟體開發、金融與醫療照護的工作負載上取得領先的準確度。
從桌上型 RTX 電腦一路用到資料中心
硬體涵蓋範圍廣也是這款模型的賣點。它可以在 NVIDIA RTX 電腦、DGX Spark、DGX Station 與 Jetson 等本機環境執行,也能延伸到邊緣 AI 裝置、RTX PRO 工作站、資料中心與雲端環境[1]。能在本機執行,也代表資料不必往外送。
在本機部署方面,NVIDIA 與 vLLM、Ollama、llama.cpp 及 LM Studio 合作,同時提供 NVFP4 與 GGUF 兩種格式[2]。Unsloth 也在首日提供支援,透過 Unsloth Studio 提供最佳化並量化過的模型。支援的硬體還包含 OEM 的 GB10 系統與 GB300 桌邊機種,搭載 Blackwell 的整機可由 Acer、ASUS、Dell Technologies、Exxact、GIGABYTE、HP、Lenovo、MSI 與 Supermicro 取得。
訓練透明度方面同樣有著墨。NVIDIA 在每次 Nemotron 發表時,都會在授權允許的範圍內公開訓練資料與方法,這次也一併釋出用於程式碼代理後訓練的強化學習資料集 Nemotron-RL-Agentic-Terminal-Pivot[1]。這既方便追溯與稽核,也可用來訓練其他模型。
NeMo Switchyard 自動決定「該呼叫哪個模型」
NeMo Switchyard 是一套面向 AI 代理程式的開源模型路由函式庫[1]。有的模型擅長寫程式,有的擅長推理,有的適合輕量工作,也有的針對本機執行做了最佳化。若始終只用同一個預設模型,不是多花錢就是犧牲品質;但若手動搭建路由邏輯,本身又會變成拖慢導入速度的整合工作。
Switchyard 把這個判斷自動化到工作流程的每一個步驟。開發者可依照品質、延遲與成本等優先順序調整或替換路由演算法,而且不必改寫既有應用程式就能導入[1]。NVIDIA 的內部基準測試顯示,Switchyard 在維持前沿等級準確度的同時,把任務完成成本壓到僅使用 Opus 4.8 時的約三分之一[1]。
合作夥伴提出的數字相當具體[1]。Boomi 評估了 5 項路由能力,達成 100% 的領域路由準確率,把 59% 的流量導向速度快 5 倍的微調模型,並將後段對話的延遲降低 21%。LangChain 在 145 項多輪 Deep Agents 任務中,只把 7% 的呼叫送往前沿模型,成本因此下降 74%,準確度僅損失 6%。Ramp 在 Ramp SWE-Bench 上達到與前沿模型相當的表現,同時成本降低 58%、執行時間縮短 33%。
除此之外,Cognition 把分階段路由器整合進 Devin Desktop,在 FrontierCode Main 上把平均成本降低 28%。Classmethod 在內部執行 opencode 與 Fireworks 的工作負載,初步測試顯示成本下降 27%。Cadence 則藉由 ChipStack AI Super Agent 在形式驗證情境中把效率提升 9.9%。Kong 已在自家 AI Gateway 原生提供這項路由能力,LiteLLM 正將其加入為代理層外掛,Nous Research 已整合到 Hermes,Siemens 則在 Fuse EDA AI 代理程式中進行基準測試。
取得方式
Nemotron 3.5 Lightning 已在 Hugging Face、ModelScope、OpenRouter 上架,並以 NVIDIA NIM 微服務的形式在 build.nvidia.com 提供,也可透過 NVIDIA 雲端合作夥伴以及各類後訓練與推論平台使用[1]。NeMo Switchyard 已在 GitHub 公開,導入合作夥伴平台的工作預計近期完成。
總結
Nemotron 3.5 Lightning 並不是為了衝上智慧排行榜第一名而生,它要處理的是代理程式運作過程中反覆出現的數百次瑣碎呼叫,如何做到又快又便宜。把 4 倍的輸出速度與 NeMo Switchyard 的自動路由結合起來,目前把所有請求都丟給前沿模型的團隊,將有機會大幅壓低成本。既然權重公開、桌上型 RTX 電腦也跑得動,能不能用自有資料完成後訓練,很可能就是導入與否的分水嶺。
來源[1] https://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/
來源[2] https://blogs.nvidia.com/blog/local-ai-open-source-models-agents-nemotron/
