NVIDIAは、オープンな大規模言語モデル「Nemotron 3 Ultra」が、エージェント開発基盤で知られるLangChainの検証において、公開モデルの中で最も高い精度を記録したと発表しました[1]。LangChainが自社のエージェント実行環境「Deep Agents」をNemotron 3 Ultra向けに調整したところ、主要なクローズドモデルと同等の処理をこなしつつ、1回あたりの推論コストは10分の1に抑えられたとしています。本記事では、この結果の中身と、NVIDIAが掲げる「開放的なAIスタック」という考え方を整理します。
モデルを再学習せず「使い方」だけを最適化
今回の成果で興味深いのは、Nemotron 3 Ultra自体には手を加えていない点です。LangChainは、モデルの中身を再学習する代わりに、モデルを取り囲む環境、いわゆる「ハーネス(harness、モデルを動かすための足回り)」を調整しました。具体的には、システムプロンプトやツールの説明文、処理の間に挟むミドルウェアを見直したと説明しています[1]。
LangChainのチームはまず、公開されているDeep AgentsのベンチマークでNemotron 3 Ultraを走らせ、実行の記録をたどってどこで得点を落としているかを分析しました。そのうえで、モデルの再学習ではなく足回りの調整で精度を引き上げたといいます。共同創業者兼CEOのHarrison Chase氏は「より良いエージェントを作る近道は、モデルの周りにあるシステムを改善し続けることだ」と述べ、記憶やツールの使い方、評価とモデルの挙動をまとめて調整できるときに効果が積み上がると説明しています[1]。
調整済みの設定はLangChainを通じて公開されており、Deep AgentsとNemotron 3 Ultraを組み合わせている開発者はすぐに利用できるとしています。ただし、これらの数値はNVIDIAとLangChainが公表したものであり、実際の使い勝手は扱うタスクや条件によって変わるため、第三者の検証も踏まえて受け止めるのがよさそうです。
Nemotron 3 Ultra とはどんなモデルか
Nemotron 3 Ultraは、総パラメータ数5,500億の大規模モデルですが、1回の処理で実際に動くのは550億にとどまる「Mixture-of-Experts(MoE、複数の専門家モデルを使い分ける方式)」を採用しています[2]。巨大なモデルでありながら計算量を抑えられるのが特徴で、長時間にわたって動き続けるエージェントの司令塔役を想定した設計です。
内部の工夫も複数あります。長い文脈を効率よく扱う「Mamba」層と、必要な情報を正確に取り出す従来型のTransformer層を組み合わせたハイブリッド構成を採り、加えて「NVFP4」と呼ばれる精度形式によって、Hopper・Blackwell・Ampereといった世代の異なるNVIDIA製GPUを1つのモデルで動かせるようにしています[2]。NVIDIAによれば、同クラスの他のオープンモデルと比べて処理速度は最大5倍に達するとのことです。
公開の姿勢も明確です。Nemotron 3 Ultraは重み(パラメータ)や学習データ、学習手順(レシピ)まで含めて開放されており、Linux Foundationが整備した寛容なライセンス「OpenMDW-1.1」で提供されます。Hugging FaceやOpenRouter、build.nvidia.comなどを通じて入手・試用でき、自前のインフラでもクラウドでも動かせる構成です[2]。
「所有できるAI」を掲げる開放的なスタック
NVIDIAが今回強調しているのは、モデル単体ではなく、エージェントを安全に動かすための一式をまとめて開放するという考え方です。その中核になるのが、オープンな設計図「NVIDIA NemoClaw for LangChain Deep Agents」です[1]。これは、Nemotron 3 Ultra向けに調整したLangChainのDeep Agentsと、エージェントの動作を安全に実行するための環境「NVIDIA OpenShell」を組み合わせたものです。
オープンなモデル、オープンなハーネス、そしてオープンで安全な実行環境をそろえることで、企業はAIの仕組み全体を自分たちで所有し、業務に合わせて手を加え、どこでも動かせるようになるとNVIDIAは説明しています。エージェントが単に質問に答えるだけでなく、社内の基幹システムの中で実際に手を動かすようになると、こうした「所有できること」の価値は一段と高まるという見立てです[1]。
すでに医療分野のAbridge、通信ソフトのAmdocs、コンテンツ管理のBoxといった企業が、専用エージェントを自社のプラットフォームに組み込み始めています。世界的なコンサルティング大手のEYも、NemoClawの設計図を活用してNVIDIA関連の導入支援を広げているとのことです。LangChainのエージェント開発基盤は月間2億回を超えるダウンロードがあり、その足回りをNemotron 3 Ultra向けに最適化した意味は小さくありません[1]。
まとめ
Nemotron 3 Ultraを巡る今回の話題は、「モデルそのものの賢さ」だけでなく、「モデルをどう動かすか」という足回りの設計が性能とコストを大きく左右することを示した事例と言えます。オープンなモデルとオープンなスタックの組み合わせで、主要なクローズドモデルに迫りながらコストを抑えられるという主張が、実際の業務でどこまで再現されるのか。開発者や企業がこの開放的な仕組みをどう使いこなしていくかに注目が集まりそうです。
出典:https://blogs.nvidia.com/blog/nemotron-langchain-agents-open-stack/
