NVIDIA は 2026 年 4 月 28 日、視覚・音声・言語を 1 つに束ねたオープンマルチモーダル モデル「Nemotron 3 Nano Omni」を公開しました。
総パラメーター 30B のうちトークンあたり 3B のみを活性化させる hybrid MoE 構成を採り、同等の応答性のまま他のオープン omni モデル比で最大 9 倍のスループットを謳います。重みもデータセットも訓練手法もすべて公開されており、エージェント開発で「目と耳」を担う土台として配布された格好です。
一括統合のねらいと数字で見る性能
これまでのエージェント システムは、画像認識・音声認識・言語理解で別々のモデルを呼び出す構成が一般的で、モダリティをまたぐたびに推論が積み重なって遅延とコストが増え、コンテキストも分断されがちでした。
NVIDIA は今回、認識系のサブエージェント役を 1 つの開放モデルでまとめ、Nemotron 3 Super や Ultra といった上位モデルと連携させる前提で Nano Omni を出してきています。
出典: NVIDIA「NVIDIA Launches Nemotron 3 Nano Omni Model, Unifying Vision, Audio and Language for up to 9x More Efficient AI Agents」(https://blogs.nvidia.com/blog/nemotron-3-nano-omni-multimodal-ai-agents/)
同社は「同じ応答性のまま、他のオープン omni モデル比でスループット 9 倍」を強調しており、文書理解、動画理解、音声理解のリーダーボード 6 種で首位を獲得したと公表しています。
NVIDIA の技術ブログでは、入力 8K / 出力 16K の設定で H200 1 枚あたりの推論スループットが Qwen3-30B-A3B 比で 3.3 倍、GPT-OSS-20B 比で 2.2 倍、MediaPerf の動画タギングでは Qwen3-VL の 3.8 h/h に対して 9.91 h/h と具体値が示されています。
出典: NVIDIA Developer「NVIDIA Nemotron 3 Nano Omni Powers Multimodal Agent Reasoning in a Single Efficient Open Model」(https://developer.nvidia.com/blog/nvidia-nemotron-3-nano-omni-powers-multimodal-agent-reasoning-in-a-single-efficient-open-model/)
推論面でも数字は出ており、AIME 2025 ではツールなしで 89.1 パーセントの正答率を達成し、同サイズ帯の Qwen3-30B-A3B(85.0 パーセント)を上回ったと報告されています。
マルチモーダル前提のモデルでも、純粋な数学・推論ベンチで取りこぼしを避けてきた印象です。
出典: NVIDIA Developer「NVIDIA Nemotron 3 Nano Omni Powers Multimodal Agent Reasoning in a Single Efficient Open Model」(https://developer.nvidia.com/blog/nvidia-nemotron-3-nano-omni-powers-multimodal-agent-reasoning-in-a-single-efficient-open-model/)
アーキテクチャ—30B-A3B + Conv3D + EVS、コンテキストは 256K
Nemotron 3 Nano Omni のアーキテクチャは、30B-A3B 構成の hybrid Mixture-of-Experts に Conv3D と EVS(Efficient Video Sampling)を組み合わせた設計です。
コンテキスト長は 256K トークンに対応し、長尺動画、長文ドキュメント、複数ファイルが混在するエージェント入力をひとつの推論ストリームで扱える前提になっています。入力モダリティはテキスト、画像、音声、動画、文書、チャート、グラフィカル インタフェースまで広く、出力はテキストです。
特筆すべきは、モデル単体で「画像と音声のエンコーダ」を統合している点です。これまで認識用に別建てしていたモデルを 1 本にまとめ、視覚と音声のコンテキストを途切れさせずに言語処理へつなぐ作りで、推論パスの繰り返しを抑える狙いがうかがえます。
実際の用途として NVIDIA が挙げているのはコンピューター操作エージェント、文書インテリジェンス、音声・動画理解の 3 領域です。
たとえば顧客サポートでは画面録画を見ながら通話音声を分析し、ログまで突き合わせる使い方が想定されています。金融アナリストのエージェントなら PDF・表計算・チャート・ボイスメモを横断して読み解く形です。
出典: NVIDIA「NVIDIA Launches Nemotron 3 Nano Omni Model, Unifying Vision, Audio and Language for up to 9x More Efficient AI Agents」(https://blogs.nvidia.com/blog/nemotron-3-nano-omni-multimodal-ai-agents/)
配布チャネルと採用企業—50 件以上の早期パートナーが並ぶ
入手チャネルは広めに開かれています。Hugging Face、OpenRouter、build.nvidia.com から入手でき、build.nvidia.com 上では NVIDIA NIM マイクロサービスとして提供されます。
さらに NVIDIA Cloud Partners や推論プラットフォーム、クラウド事業者を含む 25 を超えるパートナー プラットフォームでも同時提供が始まりました。デプロイ先も柔軟で、ローカルの NVIDIA Jetson、NVIDIA DGX Spark、DGX Station から、データセンター、クラウドまで一貫して同じモデルを動かせる設計です。
すでに本番採用しているのは Aible、Applied Scientific Intelligence(ASI)、Eka Care、Foxconn、H Company、Palantir、Pyler などの企業が挙がっています。
Nemotron 3 ファミリー全体では Nano、Super、Ultra を合わせて過去 1 年で 5,000 万ダウンロードを超えており、今回の Omni はそのファミリーをマルチモーダル領域へ広げる位置付けです。
出典: NVIDIA「NVIDIA Launches Nemotron 3 Nano Omni Model, Unifying Vision, Audio and Language for up to 9x More Efficient AI Agents」(https://blogs.nvidia.com/blog/nemotron-3-nano-omni-multimodal-ai-agents/)
H Company の CEO である Gautier Cloix 氏は「有用なエージェントを作るうえで、モデルが画面を解釈するのに数秒も待ってはいられません。Nemotron 3 Nano Omni を土台にしたことで、当社のエージェントは Full HD のスクリーン録画を高速に解釈できるようになりました。
これは単なる速度向上ではなく、エージェントがデジタル環境をリアルタイムで知覚し相互作用する仕方を根本から変える出来事です」とコメントしています。同社のコンピューター操作エージェントは 1920×1080 のネイティブ入力解像度で動作し、OSWorld ベンチマークの予備評価でも有意な向上を示したとされます。
出典: NVIDIA「NVIDIA Launches Nemotron 3 Nano Omni Model, Unifying Vision, Audio and Language for up to 9x More Efficient AI Agents」(https://blogs.nvidia.com/blog/nemotron-3-nano-omni-multimodal-ai-agents/)
開放と最適化—NVFP4 / NeMo / オンプレ展開
Nemotron 3 Nano Omni は重み、データセット、訓練手法を含めて公開されており、NVIDIA NeMo を使ったカスタマイズ、評価、最適化が可能です。データ主権や規制要件に縛られる組織でも、自前環境にデプロイしてドメイン特化のチューニングを行える前提が整っています。
ハードウェア最適化の面では、Blackwell 世代の NVFP4(4 ビット浮動小数点)推論で「Day 0」サポートが告知されており、Eigen AI などのパートナーが公開当日から NVFP4 推論を提供する形でローンチに合わせています。
BridgeBench の計測値ではフリー枠での実測スループットが 376.2 トークン/秒、最初のトークンまでの時間(TTFT)が 670 ミリ秒という具体値も出ています。
出典: Eigen AI「Eigen AI Delivers NVFP4 Inference on Blackwell for NVIDIA Nemotron 3 Nano Omni at Launch」(https://www.eigenai.com/blog/2026-04-28-eigenai-day-0-nvfp4-inference-nvidia-nemotron-nano-omni) / Bridgebench「Nemotron 3 Nano Omni 30B-A3B Reasoning (Free) Speed Benchmark」(https://www.bridgebench.ai/speedbench/nemotron-3-nano-omni-30b-a3b-reasoning-free)
まとめ
Nemotron 3 Nano Omni は、認識系サブエージェントの「単一モデル化」をオープン重みで一気に進めた発表でした。30B-A3B の MoE で活性パラメーターを 3B に抑え、コンテキストは 256K、ベンチでは AIME 2025 で 89.1 パーセント、リーダーボード 6 種で首位という尖り方をしています。
NIM、Hugging Face、OpenRouter、25 を超えるパートナー、さらに Jetson から DGX、データセンターまで動く配布設計と相まって、開発者が「視覚と音声のサブエージェント」を標準パーツとして組み込める下地が整った印象です。
実運用では H200 1 枚あたりの実スループットや NVFP4 化後のレイテンシ、対象ドメインでの精度を自前ワークロードで測ったうえで、Nemotron 3 Super や Ultra との連携設計に踏み込むのが妥当な動きになりそうです。