配合7月23日之前在洛杉磯舉行的SIGGRAPH,NVIDIA一口氣公布了圍繞內容創作與實體AI的多項發表[1]。主流創作軟體開始支援Model Context Protocol(MCP),讓AI代理能夠直接在其中操作;此外還有用於偵測合成影片的微服務,以及針對邊緣裝置的世界模型Cosmos 3 Edge。主題演講於7月20日太平洋時間下午3點45分登場,由Neil Ashton、Edward Liu與Ming-Yu Liu說明神經渲染與世界模型。

創作軟體陸續支援MCP

本次發表中篇幅最多的部分,是創作工具端的MCP支援。MCP是讓AI代理連接外部應用程式與資料的共通規範,在支援的軟體中,使用者可以把場景檢查、輸出前置作業等工作交給代理處理。常見用途包括尋找缺漏的貼圖、找出色彩管理上的不一致、準備輸出用的多種版本,以及依照製作流程規範驗證鏡頭。重點在於創作層面的判斷仍由人掌握,交出去的只有周邊的手動作業[1]。

參與陣容相當廣泛。Adobe將旗下創意代理擴展到Firefly、Express與Creative Cloud,並為開發者提供Adobe Express Developer MCP Server。Canva旗下的Affinity推出面向Claude的AI連接器,可用自然語言指示批次重新命名圖層與工作區、為多個通路調整尺寸、最佳化向量路徑等重複性工作。Blender透過Blender Lab提供輕量級MCP伺服器,Boris FX Silhouette則將FX指令碼API作為MCP工具對外開放。此外,Foundry的Griptape、SideFX的Houdini 22以及Unreal Editor也支援連接。

辨識合成影片的NIM微服務

針對新聞編輯現場,NVIDIA發表了Synthetic Video Detector NIM微服務,用來判斷影片是否含有AI生成內容。它會逐格分析影片並回傳分類分數,編輯團隊可依此決定優先查核哪些素材,或是隔離可疑畫面。其定位並非取代既有的查證流程,而是多增加一項判斷依據。

在NVIDIA的測試中,未壓縮影片的準確率最高為92%,15%壓縮下為87%,50%壓縮下仍有82%。官方強調,即使經過實際流程中常見的壓縮、縮放、裁切與重新編碼,模型依然有效。處理速度方面,1080p影片在RTX環境下為22毫秒,在L40 GPU上約為30毫秒。Wowza已將其整合進自家的Video Intelligence Framework,計畫把直播場景的偵測能力送到170多個國家、超過3.5萬個部署環境[1]。

Cosmos 3 Edge將世界模型帶進邊緣裝置

在實體AI方面,NVIDIA公開了40億參數的世界模型Cosmos 3 Edge。這是可處理文字、影像、影片、環境音與動作的全模態模型,採用mixture-of-transformers架構,針對Jetson、RTX PRO、DGX以及GeForce RTX GPU等手邊裝置進行最佳化。官方表示,在相同參數量級中,它於視覺分析基準VANTAGE-Bench上排名第一。

應用範圍涵蓋機器人控制、自駕車的道路場景理解,以及交通監控、工業檢測等影像分析。機器人領域有Agile Robots、Doosan Robotics、Siemens與Skild AI正在評估,影像分析一側則提到Centific、Vaidio與YUAN。Cosmos 3分為Edge(40億)、Nano(160億)、Super(640億)三種規模,皆已在Hugging Face公開,推論與後訓練的框架與範例則放在GitHub上。

放在桌上運作的超級代理

至於桌邊等級的DGX Station,NVIDIA提出了搭配NVIDIA Agent Toolkit、在本機執行自主代理的組態。作為代理範本的NemoClaw、5500億參數的開放模型Nemotron 3 Ultra、負責物理模擬與3D資產處理的Omniverse函式庫,以及讓代理在沙箱中執行的OpenShell執行環境,全部集中在一台機器上,不需連上網路也能運作。作為基礎的GB300 Grace Blackwell Ultra Desktop Superchip在FP4下可提供最高20 PFLOPS運算效能,一致性記憶體為748GB。透過ConnectX-8 SuperNIC最多可串接兩台。

外部生態也有動靜。LangChain針對自家的Deep Agents調校了Nemotron 3 Ultra,Nous Research則為Hermes Agent進行微調並導入正式營運。其論點是:購入硬體之後,本機執行不再產生依token計價的成本,在需要大量執行代理的用途上格外有利。DGX Station可向ASUS、Dell Technologies、Exxact、GIGABYTE、HP、MSI與Supermicro訂購。

21篇論文聚焦即時性

研究方面共有21篇技術論文獲得接受。重心已從單純追求畫面逼真,轉向如何打造符合物理規律並能即時回應的世界。代表性成果MotionBricks是以超過35萬段動作片段訓練的即時動作模型,驅動畫面中角色的同一個模型,也能驅動實體的Unitree G1人形機器人。

此外還有從大規模動作資料中習得通用運動技能的GPC、把雜亂的真實世界3D掃描轉換為完整虛擬場景的ArtiFixer,以及在Newton物理引擎中重現雪、沙與彈性體等難以模擬材質的新求解器。這些論文皆已公開,程式碼與模型也可免費下載。

總結

NVIDIA在本屆SIGGRAPH端出的內容可歸納為四條主線:讓AI代理操作創作軟體的MCP支援擴大、合成影片偵測、可在邊緣運作的世界模型,以及完全在本機完成的代理平台。它們的共通點在於都不是炫技式的生成展示,而是被定位成能嵌入既有製作流程與機器人現場的元件。加上21篇論文與程式碼全數公開,這是一場為落地實作備妥材料的發表。

來源:https://blogs.nvidia.com/blog/siggraph-news-2026/