配合7月23日之前在洛杉矶举行的SIGGRAPH,英伟达一次性公布了围绕内容创作与物理AI的多项发布[1]。主流创作软件开始支持Model Context Protocol(MCP),使AI智能体可以直接在其中操作;同时还有用于检测合成视频的微服务,以及面向边缘设备的世界模型Cosmos 3 Edge。主题演讲于7月20日太平洋时间下午3点45分举行,由Neil Ashton、Edward Liu和Ming-Yu Liu讲解神经渲染与世界模型。

创作软件相继接入MCP

本次发布中篇幅最大的部分,是创作工具一侧的MCP支持。MCP是让AI智能体连接外部应用与数据的通用规范,在支持该协议的软件中,用户可以把场景检查、导出准备等工作交给智能体处理。常见用途包括查找缺失的贴图、找出色彩管理上的不一致、准备导出用的多个版本,以及按照制作流程规范校验镜头。关键在于创作层面的判断仍由人掌握,交出去的只是周边的手工作业[1]。

参与阵容相当广泛。Adobe将其创意智能体扩展到Firefly、Express和Creative Cloud,并面向开发者提供Adobe Express Developer MCP Server。Canva旗下的Affinity推出了面向Claude的AI连接器,可以用自然语言指挥批量重命名图层与画板、为多个渠道调整尺寸、优化矢量路径等重复性工作。Blender通过Blender Lab提供轻量级MCP服务器,Boris FX Silhouette则把FX脚本API作为MCP工具对外开放。此外,Foundry的Griptape、SideFX的Houdini 22以及Unreal Editor也支持接入。

识别合成视频的NIM微服务

面向新闻编辑场景,英伟达发布了Synthetic Video Detector NIM微服务,用于判断视频是否包含AI生成内容。它逐帧分析视频并给出分类分数,编辑团队可以据此决定优先核查哪些素材,或者隔离可疑画面。该服务的定位不是取代既有的核实流程,而是多提供一项判断依据。

在英伟达的测试中,未压缩视频的准确率最高为92%,15%压缩下为87%,50%压缩下仍有82%。官方强调,在经过实际流程中常见的压缩、缩放、裁剪和重新编码之后,该模型依然有效。处理速度方面,1080p视频在RTX环境下为22毫秒,在L40 GPU上约为30毫秒。Wowza已将其集成到自家的Video Intelligence Framework中,计划把直播场景的检测能力覆盖到170多个国家、超过3.5万个部署环境[1]。

Cosmos 3 Edge把世界模型带到边缘设备

在物理AI方面,英伟达公开了40亿参数的世界模型Cosmos 3 Edge。这是一个可处理文本、图像、视频、环境声音与动作的全模态模型,采用mixture-of-transformers架构,针对Jetson、RTX PRO、DGX以及GeForce RTX GPU等本地设备做了优化。官方称,在同一参数量级中,它在视觉分析基准VANTAGE-Bench上排名第一。

应用范围涵盖机器人控制、自动驾驶车辆的道路场景理解,以及交通监控、工业质检等视频分析。机器人领域有Agile Robots、Doosan Robotics、Siemens和Skild AI在进行评估,视频分析一侧则提到了Centific、Vaidio和YUAN。Cosmos 3分为Edge(40亿)、Nano(160亿)、Super(640亿)三档,均已在Hugging Face公开,推理与后训练的框架和配方放在GitHub上。

放在桌面上运行的超级智能体

对于桌边级设备DGX Station,英伟达展示了与NVIDIA Agent Toolkit结合、在本地运行自主智能体的方案。作为智能体蓝图的NemoClaw、5500亿参数的开放模型Nemotron 3 Ultra、负责物理仿真与3D资产处理的Omniverse库,以及让智能体在沙箱中运行的OpenShell运行时,全部集中在一台机器上,无需联网即可工作。作为底座的GB300 Grace Blackwell Ultra Desktop Superchip在FP4下可提供最高20 PFLOPS算力,一致性内存为748GB。通过ConnectX-8 SuperNIC最多可以连接两台。

外部生态也有动作。LangChain针对自家的Deep Agents调优了Nemotron 3 Ultra,Nous Research则为Hermes Agent做了微调并投入生产使用。其逻辑是:购置硬件之后本地运行不再产生按token计费的成本,在需要大量运行智能体的场景中优势明显。DGX Station可从ASUS、Dell Technologies、Exxact、GIGABYTE、HP、MSI和Supermicro订购。

21篇论文聚焦实时性

研究方面共有21篇技术论文被接收。重心已经从单纯追求画面逼真,转向如何构建符合物理规律并能实时响应的世界。代表性成果MotionBricks是一个基于超过35万段动作片段训练的实时动作模型,驱动屏幕中角色的同一个模型,也能驱动实体的Unitree G1人形机器人。

此外还包括从大规模动作数据中习得通用运动技能的GPC、把杂乱的现实3D扫描转换为完整虚拟场景的ArtiFixer,以及在Newton物理引擎中再现雪、沙和弹性体等难以模拟材质的新求解器。这些论文均已公开,代码与模型也可免费下载。

总结

英伟达在本届SIGGRAPH端出的内容可以归纳为四条主线:让AI智能体操作创作软件的MCP支持扩大、合成视频检测、可在边缘运行的世界模型,以及完全在本地完成的智能体平台。它们的共同点是都不是炫技式的生成演示,而是作为可以嵌入既有制作流程与机器人现场的组件被提出。加上21篇论文与代码全部公开,这是一场为落地实现准备好材料的发布。

来源:https://blogs.nvidia.com/blog/siggraph-news-2026/