NVIDIA 於 6 月 4 日發布了專為長時間運行的 AI 代理(自主逐步完成任務的 AI)打造的新開放模型「Nemotron 3 Ultra」[1][2]。它採用總參數 5,500 億、實際啟用僅 550 億的架構,NVIDIA 表示其兼顧了強大的推理能力與處理速度[2]。同一天,該模型也在 Ollama 的雲端上線,只需一行指令即可試用[1][3]。

「Nemotron 3 Ultra」是什麼

Nemotron 3 Ultra 是一款總參數 5,500 億、啟用參數 550 億的混合專家(MoE,每次輸入只使用一部分專用參數的設計)模型[2]。它是公開了權重、訓練配方與授權的開放模型,開發者可以對其進行微調,以符合自己的用途[2]。

NVIDIA 透過這款模型瞄準的,是在眾多步驟之間長時間運行的「代理」的指揮中樞角色[2]。與只回答單一問題的聊天機器人不同,代理會制定計畫、呼叫工具、把工作交付給其他代理、接收結果,然後再次推理,如此反覆多次[2]。這個過程中往來的 token(AI 處理文字的最小單位)會迅速增加,容易推高成本並加大偏離目標的風險[2]。NVIDIA 構想將負責複雜判斷的高效能模型與處理大量執行的輕量模型搭配使用,並說明 Nemotron 3 Ultra 負責其中的「困難判斷」[2]。

為提升效率而做的設計

Nemotron 3 Ultra 納入了多項旨在兼顧效能與效率的設計[2]。它採用混合架構,將高效處理長上下文的「Mamba」層,與能夠精準回想所需資訊的「Transformer」層結合在一起,因此在長時間任務中也能維持上下文[2]。同時,它支援使用 NVIDIA 自有的 4 位元浮點格式「NVFP4」進行量化(讓模型變輕的壓縮手法),該公司表示由此可在多種 GPU 上執行[2]。

在效能方面,NVIDIA 表示其吞吐量(單位時間的處理量)達到同級其他開放模型的 5 倍[2]。該公司還表示,在衡量程式設計能力的「SWE-bench」與「Terminal-bench 2.0」測試中,模型以更少的 token 完成任務,將代理任務的成本最多降低 30%[2]。在處理長上下文的能力上,NVIDIA 表示其在百萬 token 規模的評測「Ruler」中取得 95% 的準確度[2]。不過需要留意的是,這些都是 NVIDIA 自行公布的測量值,並非第三方驗證。

在 Ollama 雲端即可立即試用

伴隨發布,Nemotron 3 Ultra 可透過 Ollama 的雲端使用[1]。在安裝 Ollama 之後,執行以下指令即可立即開始對話[1]。

ollama run nemotron-3-ultra:cloud

它也可以嵌入程式設計輔助工具中使用。例如要在 Claude Code 中執行,可依照以下方式啟動[1]。

ollama launch claude --model nemotron-3-ultra:cloud

除此之外,它也支援與 Codex App、OpenClaw、Hermes Agent、OpenCode 等工具的整合[1]。同時也提供透過 API、Python 與 JavaScript 的呼叫方式[3]。根據 Ollama 的模型頁面說明,雲端版本支援工具呼叫與思考過程的顯示,可處理的上下文長度標示為 25.6 萬 token[3]。與 NVIDIA 提出的百萬 token 評測數值相比,目前 Ollama 雲端提供的上下文上限是較為保守的設定[2][3]。

總結

Nemotron 3 Ultra 是 NVIDIA 面向長時間運行代理指揮中樞的開放模型,其混合專家架構與 NVFP4 量化被稱可兼顧效能與效率[2]。它還支援 Ollama 雲端,只需一行指令就能從本地試用,這一點相當吸引人[1][3]。效能數值目前以廠商公布為準,但公開發布的大型模型選擇持續增加,其意義不容小覷。

來源:https://ollama.com/blog/nemotron-3-ultra

來源:https://developer.nvidia.com/blog/nvidia-nemotron-3-ultra-powers-faster-more-efficient-reasoning-for-long-running-agents/

來源:https://ollama.com/library/nemotron-3-ultra