NVIDIAは6月4日、長時間動き続けるAIエージェント(自律的に手順を進めるAI)向けの新しいオープンモデル「Nemotron 3 Ultra」を公開しました[1][2]。総パラメータ5,500億のうち実際に動くのは550億という構成で、高い推論力と処理速度を両立させたとしています[2]。同じ日にOllamaのクラウドにも対応し、コマンド1つで試せるようになりました[1][3]。

「Nemotron 3 Ultra」とは

Nemotron 3 Ultraは、総パラメータ5,500億・アクティブパラメータ550億の混合エキスパート(MoE、入力ごとに一部の専門家パラメータだけを使う仕組み)モデルです[2]。重みや学習レシピ、ライセンスを公開したオープンモデルで、追加学習(ファインチューニング)して自分の用途に合わせられます[2]。

NVIDIAがこのモデルで狙うのは、複数の手順をまたいで長く動く「エージェント」の司令塔役です[2]。単発の質問に答えるチャットボットと違い、エージェントは計画を立て、ツールを呼び出し、別のエージェントに作業を振り、結果を受け取ってまた考える、という往復を何度も繰り返します[2]。その過程でやり取りされるトークン(AIが処理する文章の最小単位)は急速に増え、コストの増大や目的のずれにつながりやすくなります[2]。NVIDIAは、込み入った判断を担う高性能モデルと、大量の実行をさばく軽量モデルを組み合わせる構成を想定しており、Nemotron 3 Ultraは前者の「難しい判断」を受け持つと説明しています[2]。

効率を高めるための設計

Nemotron 3 Ultraには、性能と効率の両立を狙ったいくつかの工夫が盛り込まれています[2]。長い文脈を効率よく扱う「Mamba」層と、必要な情報を正確に思い出す「Transformer」層を組み合わせたハイブリッド構成を採用し、長時間の作業でも文脈を保てるようにしています[2]。あわせて、NVIDIA独自の4ビット浮動小数点形式「NVFP4」による量子化(モデルを軽くする圧縮手法)に対応し、さまざまなGPUで動かせるとしています[2]。

性能面では、NVIDIAは同クラスのほかのオープンモデルと比べてスループット(単位時間あたりの処理量)が5倍に達するとしています[2]。さらに、コーディング能力を測る「SWE-bench」や「Terminal-bench 2.0」での検証では、より少ないトークン数で作業を終えられ、エージェントの処理コストを最大30%下げられたと説明しています[2]。長い文脈を扱う能力についても、同社は100万トークン規模の評価「Ruler」で95%の精度を示したとしています[2]。ただしこれらはいずれもNVIDIAが公表した自社の測定値であり、第三者による検証ではない点には留意が必要です。

Ollamaのクラウドですぐ試せる

公開と同時に、Nemotron 3 UltraはOllamaのクラウド経由で利用できるようになりました[1]。Ollamaをインストールしたうえで、次のコマンドを実行するとそのまま対話を始められます[1]。

ollama run nemotron-3-ultra:cloud

コーディング支援ツールなどに組み込んで使うこともできます。たとえばClaude Codeで動かす場合は、次のように起動します[1]。

ollama launch claude --model nemotron-3-ultra:cloud

このほか、Codex App、OpenClaw、Hermes Agent、OpenCodeといったツールへの組み込みにも対応します[1]。APIやPython、JavaScriptからの呼び出しも用意されています[3]。Ollamaのモデルページによると、クラウド版はツール呼び出しや思考プロセスの表示に対応し、扱える文脈の長さは25万6,000トークンとされています[3]。NVIDIAが示す100万トークンの評価値と比べると、Ollamaのクラウドで現在提供されている文脈の上限は控えめな設定です[2][3]。

まとめ

Nemotron 3 Ultraは、長時間動くエージェントの司令塔を狙ったNVIDIAのオープンモデルで、混合エキスパート構成とNVFP4量子化により性能と効率の両立をうたいます[2]。Ollamaのクラウドにも対応し、コマンド1つで手元から試せるのが大きな魅力です[1][3]。性能値は現時点で同社の公表ベースですが、オープンに公開された大規模モデルの選択肢が増えた意味は小さくありません。

出典:https://ollama.com/blog/nemotron-3-ultra

出典:https://developer.nvidia.com/blog/nvidia-nemotron-3-ultra-powers-faster-more-efficient-reasoning-for-long-running-agents/

出典:https://ollama.com/library/nemotron-3-ultra