Skild AI 公开了旗舰机器人基础模型 S1 的成果。只要给它看一段拍下来的示范视频,它无需重新训练就能执行该项作业。据称即便是训练数据中完全没有出现过的、长达 10 分钟的复杂流程也能应对,这直接动摇了工业机器人长期以来的前提:每换一项任务,就要重新采集数据并重新训练[1][2]。

只看一段视频,权重完全不动

工厂和仓库的现场很少一成不变,产品会换、布局会改、新工序不断出现。而多数工业机器人是围绕固定工作打造的,因此每增加一道工序,就要重新采集数据、重新训练并重新验证[1]。

S1 走的是另一条路。操作人员录下想要完成的作业视频,直接作为提示交给模型。S1 从画面中读取意图、对象和步骤顺序,再映射成眼前这台机器人的动作。关键在于,模型权重完全不做更新。这正是把大语言模型中的上下文学习(in-context learning)搬到了机器人操作上[1][2]。

此前的机器人学习以语言指令为主流,也就是常说的 VLA 方式。像「把马克杯递给我」这类简单动作用语言描述就够了,但叠床单、打发蛋白、打绳结这些活儿,人与人之间也是靠示范而不是靠说明来教的。S1 把这一点写进了自己的设计思路[2]。

未学过的作业,成功率高出 7 倍以上

Skild AI 展示了 4 项不在预训练范围内的作业:给植物换盆、煎薄饼、手冲咖啡、零件套件组装。每一项最长 10 分钟,涉及数十个操作步骤[1][2]。

数据差距很明显。在未学过的作业上,S1 的分步累计成功率为 66%,而用相同数据训练的语言提示型方式只有 9%,相差 7 倍以上。并且随着预训练数据规模扩大,两者的差距还在拉开,Skild AI 认为这说明该路线具备良好的扩展规律[2]。

即便只看预训练中出现过的作业,S1 的成功率也达到约 96%。有意思的是,在 1,000 小时这种较小数据规模下,结果是反过来的:语言提示型为 53%,S1 为 43%。数据少的时候,压缩成语言的指令更占优势;规模上来之后,视频所携带的信息量才开始发挥作用[2]。

即使在执行过程中把物体挪走、换成别的东西或改变照明,S1 依然完成了作业。还有一个例子是,示范中用喷壶浇水,但现场只有杯子,S1 就改用杯子。它把示范当作要达成的目标,而不是要照搬的轨迹[2]。

一段视频,抵得上约 380 次遥操作

从落地成本来看,最值得关注的是这组对比。用传统方式达到同等水平,估计需要约 380 次遥操作示范。而对于时长 4 到 10 分钟的作业,采集这 380 次需要 50 到 100 小时的实际操作时间,如今全部由一段视频取代[1][2]。

在换盆测试中,Skild AI 记录到从示范录制完成到机器人开始自主执行只用了 11 分钟。即便从泥土和花盆送到办公室算起,大部分时间也花在搬家具、布置现场上[1][2]。

不过传统方式并非永远追不上。把示范累积到 2,000 次,成功率可达 86%,反超 S1 的 66%[2]。一段视频换来 66% 这个数字究竟够不够,取决于现场能接受多高的失败率,以及采集示范的成本有多大。

训练依托 NVIDIA,落地牵手 Foxconn

S1 的训练与验证在 NVIDIA 的 AI 基础设施上完成。开放世界基础模型 NVIDIA Cosmos 用于丰富训练数据、把视频转换成结构化描述,Cosmos Curator 则负责大规模数据的标注、筛选与整理。上机之前的验证使用 NVIDIA Omniverse 库与 Isaac Sim 框架,在符合物理规律的虚拟环境中生成数据、测试边缘情况[1]。

强化学习放在由 Newton 物理引擎驱动的 Isaac Lab 中进行,使 Skild AI 能够准确建模受力、接触、碰撞与压力等物理参数,缩小仿真与现实之间的差距。两家公司还在联合开发面向 GPU 的仿真求解器,用于快速准确地计算机器人触碰、抓取和操作固体物体的过程,未来将作为 Newton 的一部分向开发者开放[1]。

现场层面同样具体。Skild AI、NVIDIA 与 Foxconn 已将 Skild Brain 部署在双臂机械手上,用于 NVIDIA Blackwell 系统的高精度组装。在公开的一段工作流程中,机器人安装汇流排与限位块,拧紧 16 颗螺丝,并在现场情况偏离预案时做出调整[1]。

业务方面,Skild AI 表示首次商用部署 10 个月后年化营收已达 1 亿美元(约 153 亿日元),并在制造、物流、检测、安防、餐饮加工等领域建立了超过 60 项部署合作[1]。

※1 美元 = 153 日元(截至 2026 年 9 月 12 日)

总结

S1 是一款把示范视频放进上下文、就能执行未经训练的 10 分钟级作业的机器人基础模型。在未学过的作业上,它的成功率为 66%,而语言指令型仅为 9%,差距超过 7 倍。「一段视频约等于 380 次遥操作」这一估算,足以改写机器人落地的成本结构。目前 S1 的权重和 API 尚未面向公众开放,商用合作伙伴的现场应用走在前面,但教机器人干活的方式正在从「写程序」转向「做给它看」,这一点已经清晰可见。

来源:https://blogs.nvidia.com/blog/skild-ai-s1-physical-ai/

来源:https://skild.ai/blogs/s1