NVIDIAが、オープンモデル群Nemotron 3ファミリーに「Nemotron 3.5 Lightning」を追加しました[1]。300億パラメーターのMoE(混合エキスパート)構成で、常時稼働するエージェントの中で細かい仕事を高速にさばくことに狙いを絞ったモデルです。同時に、処理ごとに最適なモデルへ振り分けるオープンソースのルーティング基盤「NeMo Switchyard」も公開されました。

常時稼働エージェントは「モデルの束」で動く

今回の発表で前提として置かれているのは、エージェントが単体のモデルではなく複数モデルの組み合わせで動くという考え方です[1]。Nemotron 3 UltraやGPT-5.6のような推論の強いモデルが全体の段取りを組み、実際のコードレビュー、ツール呼び出し、セキュリティ警告の監視、請求に関する問い合わせ対応といった個別の作業は、小さく速いモデルが引き受けるという役割分担です。

Nemotron 3.5 Lightningはその「小さく速い側」に置かれるモデルです。Nemotron 3 Nanoに続く位置づけで、長時間動き続けるエージェント用途では同クラス最高の効率をうたっています[1]。

出力速度は最大4倍、タスク完了は30パーセント短縮

性能面でNVIDIAが示しているのは、同クラスの他モデルと比べて出力速度が最大4倍、エージェントとしてのタスク完了時間が30パーセント短いという数字です[1][2]。常時動かす前提のエージェントでは、1回あたりの応答速度がそのまま運用コストと体感に跳ね返るため、ここを詰めてきたのは理にかなっています。

開発にはNemotron Coalitionの参加各社が関わっており、評価手法、推論ソフトウェア、データセットの提供を受けたとされています[1]。重みが公開されているため、NVIDIA NeMoを使って自社のドメインデータやツール、業務フローで追加学習し、特定タスクの精度を上げる使い方が想定されています。

すでに業種ごとのカスタマイズ事例も挙がっています[1]。セキュリティ分野ではCrowdStrike、法務分野ではHarveyがTrajectoryと組み、コードレビューではCodeRabbitがBasetenと組んで調整を進めています。ほかにLila Sciencesが物理・生命科学領域の推論能力向上に、Fastino Labsがソフトウェア開発・金融・ヘルスケア向けの精度改善に取り組んでいるとのことです。

手元のRTX PCからデータセンターまで同じモデルで

動作環境の幅広さもこのモデルの売りです。NVIDIA RTX搭載PC、DGX Spark、DGX Station、Jetsonといったローカル環境で動かせるほか、エッジ機器、RTX PROワークステーション、データセンター、クラウドへそのままスケールさせられるとしています[1]。手元の機材で動かせることは、そのままデータを外に出さずに済むという意味でもあります。

ローカル実行の環境整備では、vLLM、Ollama、llama.cpp、LM Studioと協業し、NVFP4とGGUFの両形式を用意しました[2]。Unslothも初日から対応し、Unsloth Studio経由で量子化済みモデルを提供しています。対応ハードウェアはOEMのGB10システムやGB300のデスクサイド機まで含み、Blackwell搭載機はAcer、ASUS、Dell Technologies、Exxact、GIGABYTE、HP、Lenovo、MSI、Supermicroから供給されます。

学習の透明性についても言及があります。Nemotronは毎回、ライセンスが許す範囲で学習データと手法を公開する方針を取っており、今回はコーディングエージェント向けの後学習に使った強化学習用データセット「Nemotron-RL-Agentic-Terminal-Pivot」も併せて公開されました[1]。追跡と監査ができるほか、他のモデルの学習にも使えます。

「どのモデルに投げるか」を自動化するNeMo Switchyard

もう一方の発表であるNeMo Switchyardは、エージェント向けのオープンソースなモデルルーティング用ライブラリです[1]。コーディングが得意なモデル、推論が得意なモデル、軽い処理向けのモデル、ローカル実行に最適化されたモデルと、性格の違うモデルが並ぶ中で、常に同じ1つを使えばコストか品質のどちらかを損ないます。かといって手作業で振り分けを組めば、それ自体が導入を遅らせる作業になります。

Switchyardはこの振り分けを、ワークフローの各ステップごとに自動で行います。品質、遅延、コストのどれを優先するかに応じてルーティングのアルゴリズムを調整でき、アプリケーション側を書き換えずに導入できる点が強調されています[1]。NVIDIAの社内ベンチマークでは、フロンティア級の精度を保ったまま、タスク完了コストをOpus 4.8単体の場合のおよそ3分の1まで下げられたとしています[1]。

導入を進めているパートナーの数字も具体的です[1]。Boomiは5つのルーティング能力を評価し、ドメイン振り分けの正確性100パーセント、全体の59パーセントを5倍高速なファインチューニング済みモデルへ送り、後半ターンの遅延を21パーセント削減しました。LangChainは145件のマルチターンのDeep Agentsタスクで、フロンティアモデルへの呼び出しを7パーセントに絞ることでコストを74パーセント削減し、精度の低下は6パーセントに留めています。RampはRamp SWE-Benchでフロンティアモデル並みの性能を維持しつつ、コストを58パーセント、実行時間を33パーセント削減しました。

このほか、CognitionはDevin Desktopに段階型ルーターを組み込み、FrontierCode Mainで平均コストを28パーセント下げています。ClassmethodはopencodeとFireworksのワークロードを社内で回して27パーセントのコスト削減を確認、Cadenceは形式検証用途のChipStack AI Super Agentで9.9パーセントの効率改善を得ています。Kongは自社のAI Gatewayに標準搭載し、LiteLLMはプロキシ層のプラグインとして追加中、Nous ResearchはHermesへ統合済み、SiemensはFuse EDA AIエージェントで評価を進めています。

入手先

Nemotron 3.5 LightningはHugging Face、ModelScope、OpenRouter、そしてbuild.nvidia.comでNVIDIA NIMマイクロサービスとして提供され、NVIDIAクラウドパートナー各社や後学習・推論プラットフォーム経由でも利用できます[1]。NeMo SwitchyardはGitHubで公開済みで、パートナー各社のプラットフォームへの搭載も近く予定されています。

まとめ

Nemotron 3.5 Lightningは、賢さの上限を競うモデルではなく、エージェントの中で何百回も呼ばれる細かい処理を安く速くこなすためのモデルです。出力4倍速という数字と、NeMo Switchyardによる自動振り分けを組み合わせると、フロンティアモデルへ全部投げていた運用からコストを大きく落とせる可能性があります。重みが公開されていて手元のRTX PCでも動く以上、まずは自社データで追加学習して試せるかどうかが、導入の分かれ目になりそうです。

出典[1] https://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/

出典[2] https://blogs.nvidia.com/blog/local-ai-open-source-models-agents-nemotron/