英伟达发布了开发框架 NVIDIA XR AI,用于在 AR 眼镜和 XR(涵盖 VR、AR、MR 的统称)设备上运行 AI 智能体(能自主判断情况并协助工作的 AI)[1]。它会采集视频、音频、深度等现实世界的信息,将其与企业内部数据和各类工具相连,在现场协助佩戴者完成工作。目前在制造、科研、医疗、设计等领域已经开始落地[1]。

NVIDIA XR AI 是什么

AI 正在超越聊天机器人和副驾驶(辅助工作的 AI)阶段,朝着在物理空间中与人协同工作的方向迈进。在工厂、实验室和医院里,能够理解周围环境、获取知识并即时行动的 AI 智能体正逐渐出现[1]。

不过,要把这类智能体打造成在现场真正有用的形态并不容易。它们不仅要生成回应,还要从视频、音频和传感器数据中感知周围环境,读取瞬息万变的状况和空间语境,从企业系统中检索所需信息,思考下一步该采取的行动,并使用软件工具完成任务。而且这一切都必须在低延迟下完成,同时不能干扰佩戴者[1]。

NVIDIA XR AI 正是承担这一难题的开发者库。它将来自 AR 眼镜和 XR 设备的输入与 AI 模型、企业数据、工具以及高速计算平台连接起来,为能够在真实工作流程中感知、推理和行动的智能体提供基础[1]。英伟达还面向开发者提供了教程和示例等资料[2]。

把现场信息接入 AI 的四大支柱

NVIDIA XR AI 大体上把四项功能整合在一起[1]。第一项是输入部分,负责采集来自 AR 眼镜和 XR 设备的视频、音频、深度、姿态(pose)、传感器等现实世界信号。

第二项是把智能体连接到专业工具和服务的部分。在视频理解方面,可使用 NVIDIA Metropolis 以及负责视频检索与摘要的 NVIDIA Metropolis for VSS;在企业知识检索方面,可使用面向 RAG(检索增强生成,先取出相关信息再用于回答)的 NVIDIA NeMo Retriever[1]。

第三项是对广泛 AI 模型的支持。除了面向推理的 NVIDIA Nemotron 和用于解读空间与状况的 NVIDIA Cosmos Reason,还可组合各种兼容的基础模型[1]。第四项则是统筹多个智能体协作的编排,以及高速驱动它的运行平台。有了这些,就更容易构建理解空间的多模态(统一处理多种类型输入的方式)AI 智能体[1]。

支撑开发的底层

在搭建智能体时,可使用 NVIDIA NeMo Agent Toolkit,它能处理工具调用、推理流程以及多个智能体之间的协作[1]。在硬件方面,提供了 NVIDIA DGX Spark、NVIDIA DGX Station 以及搭载 NVIDIA RTX PRO 的系统,可根据配置在云端、数据中心乃至贴近现场的边缘运行推理[1]。由此便能实现一种智能体:它理解周围环境、参考企业内部知识、一边思考复杂任务,一边实时给出贴合现场的协助[1]。

从工厂到手术室,再到泰坦尼克号

NVIDIA XR AI 已经开始在各种现场接受检验[1]。

在制造领域,西门子作为一项研究性尝试,正利用 NVIDIA XR AI 和 DGX Spark,探索如何帮助工厂工程师查找维护信息、排查故障、确认作业。佩戴轻便眼镜的工程师向 AI 智能体询问 PLC(可编程逻辑控制器,控制工业设备的装置)的故障,便能当场获得操作步骤的指引[1]。

在科研领域,从事 AI 系统研发的 Rana 推出了运行于 NVIDIA XR AI 之上的 LabOS,试图把理解空间的智能直接带入实验流程。LabOS 首先被用于斯坦福大学医学院的 Cong Lab 和普林斯顿大学的 Wang Lab,服务于干细胞治疗与基因编辑研究。它帮助研究人员辨别正确的样本和 CRISPR(基因编辑手法)编辑工具,指引每一个步骤,并留下可复现的记录,扮演类似「副驾驶」的角色[1]。LabOS 支持 Meta、Rokid、VITURE 的智能眼镜。VITURE 已将 NVIDIA XR AI 嵌入一种可穿戴界面,能在工作现场迅速调出所需语境并引导下一步动作[1]。

在医疗领域,匹兹堡大学医学中心(UPMC)的 Surreality Lab 展示了一套在 NVIDIA XR AI 和 DGX Station 之上、按情况支援手术团队的系统。它被设计为理解外科医生视野中「不可遮挡的部分」,在保持对患者和术式专注的同时,递出有用的信息[1]。

此外,从事汽车设计的 Innoactive 借助 DGX Spark,努力把设计评审、产品展厅以及数字孪生(在虚拟空间中复现现实设备)中的语境完整衔接、不致遗漏。从事影像制作的 Atlantic Studios 则把泰坦尼克号如今沉睡之姿的精密扫描,做成可通过语音指令寻找看点、边走边看的体验,把复杂的水下模型变成了可交互的故事[1]。

总结

NVIDIA XR AI 是一个开发框架,它把来自 AR 眼镜和 XR 设备的信息与 AI 模型、企业数据和高速计算平台相连,用于构建能在真实工作中感知、推理和行动的智能体。它把视频理解、企业检索、推理模型和编排一并备齐,并展示了工厂、实验室、手术室和沉浸式展示等现场的实例。可以说,这是英伟达迈向「超越聊天、在物理空间中工作的 AI」的一处新落脚点。

来源:https://blogs.nvidia.com/blog/nvidia-xr-ai/

来源:https://developer.nvidia.com/xr/xr-ai