NVIDIAが、7月23日までロサンゼルスで開かれているSIGGRAPHに合わせて、クリエイティブ制作とフィジカルAIに関する発表をまとめて公開しました[1]。主要な制作ソフトがModel Context Protocol(MCP)に対応してAIエージェントから操作できるようになるほか、合成動画を検出するマイクロサービス、エッジ向けの世界モデル「Cosmos 3 Edge」などが並びます。基調講演は7月20日の午後3時45分(太平洋時間)に行われ、Neil Ashton氏、Edward Liu氏、Ming-Yu Liu氏がニューラルレンダリングや世界モデルについて話す予定です。

制作ソフトが次々とMCPに対応

今回の発表で大きく分量を割かれているのが、制作ツール側のMCP対応です。MCPはAIエージェントが外部のアプリやデータに接続するための共通仕様で、これに対応したソフトでは、エージェントにシーンの点検や書き出しの準備といった作業を任せられるようになります。テクスチャの欠落を探す、カラーマネジメントの不整合を洗い出す、書き出し用のバリエーションを用意する、社内のパイプライン規約に照らしてショットを検証する、といった用途が想定されています。創作上の判断は人が握ったまま、周辺の手作業だけを渡せる点が肝になります[1]。

対応を表明した顔ぶれは幅広く、AdobeはFirefly、Express、Creative Cloudにまたがるクリエイティブエージェントを拡張し、開発者向けにはAdobe Express Developer MCP Serverを提供します。Canva傘下のAffinityはClaude向けのAIコネクターを用意し、レイヤーやアートボードの一括リネーム、複数チャンネル向けのリサイズ、ベクターパスの最適化といった反復作業を自然言語で指示できるようにしました。BlenderはBlender Lab経由の軽量なMCPサーバーを、Boris FX SilhouetteはFXスクリプティングAPIをMCPツールとして公開するサーバーを備えます。このほかFoundryのGriptape、SideFXのHoudini 22、Unreal Editorも接続に対応します。

合成動画を見分けるNIMマイクロサービス

報道現場向けには、AI生成された動画かどうかを判定するSynthetic Video Detector NIMマイクロサービスが発表されました。動画を1フレームずつ解析し、合成コンテンツが含まれる度合いをスコアとして返す仕組みです。編集チームはそのスコアを手がかりに、確認を優先すべき素材を選んだり、疑わしい映像を隔離したりできます。既存の裏取り作業を置き換えるものではなく、判断材料を1つ増やす位置づけです。

NVIDIAの検証では、精度は無圧縮の動画で最大92パーセント、15パーセント圧縮で87パーセント、50パーセント圧縮でも82パーセントとされています。圧縮やリサイズ、切り抜き、再エンコードといった実際のワークフローを通ったあとでも機能する点が強調されています。処理速度は1080p動画でRTX搭載環境なら22ミリ秒、L40 GPUでも30ミリ秒程度です。すでにWowzaが自社のVideo Intelligence Frameworkに組み込み、170カ国以上、3万5000件を超える導入環境にライブ配信向けの検出機能を届ける計画を示しています[1]。

Cosmos 3 Edgeがエッジ機器に世界モデルを持ち込む

フィジカルAI向けには、40億パラメーターの世界モデルCosmos 3 Edgeが公開されました。テキスト、画像、動画、環境音、行動を扱えるオムニモデルで、mixture-of-transformersと呼ぶ構成により、Jetson、RTX PRO、DGX、さらにGeForce RTX GPUといった手元の機材で動かせるように最適化されています。同社は、同じパラメーター帯において映像解析のベンチマークVANTAGE-Benchで首位に立ったとしています。

用途はロボット制御、自動運転車の走行シーン理解、交通監視や産業検査といった映像解析まで及びます。ロボティクス分野ではAgile Robots、Doosan Robotics、Siemens、Skild AIが評価を進めており、映像解析側ではCentific、Vaidio、YUANの名前が挙がっています。Cosmos 3はEdge(40億)、Nano(160億)、Super(640億)の3段構成で、いずれもHugging Faceで公開され、推論と追加学習のフレームワークやレシピはGitHubに置かれています。

机の上で動くスーパーエージェント

デスクサイド機のDGX Stationについては、NVIDIA Agent Toolkitと組み合わせてローカルで自律エージェントを動かす構成が示されました。エージェントの雛形となるNemoClaw、5500億パラメーターのオープンモデルNemotron 3 Ultra、物理シミュレーションと3Dアセット処理を担うOmniverseライブラリ、エージェントを隔離して動かす実行環境OpenShellが1台にまとまり、インターネット接続なしで動きます。土台となるGB300 Grace Blackwell Ultra Desktop SuperchipはFP4で最大20ペタフロップス、コヒーレントメモリーは748GBという規模です。ConnectX-8 SuperNICを介して2台までなら連結もできます。

外部の動きも出ています。LangChainは自社のDeep Agents向けにNemotron 3 Ultraを調整し、Nous ResearchはHermes Agent向けに微調整したうえで本番運用に採用しました。ハードウェアを買ったあとはトークン単価が発生しない手元実行という点が、エージェントを大量に走らせる用途では効いてくるという主張です。DGX StationはASUS、Dell Technologies、Exxact、GIGABYTE、HP、MSI、Supermicroから注文できます。

21本の論文はリアルタイム性に軸足

研究発表では21本の技術論文が採択されました。見た目の写実性そのものより、物理的に正しく振る舞い、リアルタイムで応答する世界をどう作るかへ重心が移っています。代表格のMotionBricksは35万本を超えるモーションクリップで学習したリアルタイムのモーションモデルで、画面上のキャラクターを動かすのと同じモデルが実機のUnitree G1ヒューマノイドも動かします。

このほか、大規模なモーションデータから汎用的な運動スキルを獲得させるGPC、雑然とした実世界の3Dスキャンを整った仮想シーンに変換するArtiFixer、雪や砂、弾性体といった扱いの難しい素材をNewton物理エンジン上で再現する新しいソルバーなどが並びます。論文はいずれも公開されており、コードとモデルも無償で入手できます。

まとめ

今回のSIGGRAPHでNVIDIAが打ち出したのは、制作ソフトをAIエージェントから操作できるようにするMCP対応の広がり、合成動画の検出、エッジで動く世界モデル、手元で完結するエージェント基盤という4つの柱です。いずれも派手な生成デモではなく、既存の制作パイプラインやロボットの現場に組み込むための部品として提示されている点が共通しています。21本の論文とコードが公開されていることも含め、実装に落とすための材料が揃った発表と言えます。

出典: https://blogs.nvidia.com/blog/siggraph-news-2026/