Skild AI 公開了旗艦機器人基礎模型 S1 的成果。只要給它看一段拍好的示範影片,它不必重新訓練就能執行該項作業。據稱即使是訓練資料中完全沒出現過、長達 10 分鐘的複雜流程也能應付,這直接動搖了工業機器人長久以來的前提:每換一項任務,就得重新蒐集資料並重新訓練[1][2]。
只看一段影片,權重完全不動
工廠與倉儲現場很少一成不變,產品會換、配置會改、新製程不斷出現。而多數工業機器人是針對固定工作打造的,因此每多一道工序,就得重新蒐集資料、重新訓練並重新驗證[1]。
S1 走的是另一條路。操作人員錄下想完成的作業影片,直接當成提示交給模型。S1 從畫面中讀出意圖、物件與步驟順序,再對應到眼前這台機器人的動作。關鍵在於,模型權重完全不更新。這正是把大型語言模型的脈絡內學習(in-context learning)搬到機器人操作上的做法[1][2]。
過去的機器人學習以語言指令為主流,也就是常說的 VLA 方式。像「把馬克杯遞給我」這種簡單動作,用語言描述就夠了,但摺床單、打發蛋白、打繩結這類工作,人與人之間也是靠示範而非靠說明來教。S1 把這一點寫進了自己的設計思路[2]。
沒學過的作業,成功率高出 7 倍以上
Skild AI 展示了 4 項不在預訓練範圍內的作業:植物換盆、煎鬆餅、手沖咖啡、零件套件組裝。每一項最長 10 分鐘,涵蓋數十個操作步驟[1][2]。
數字差距相當明顯。在沒學過的作業上,S1 的分步累計成功率為 66%,而以相同資料訓練的語言提示型方式只有 9%,相差 7 倍以上。而且隨著預訓練資料規模擴大,兩者差距還持續拉開,Skild AI 認為這代表這條路線具備良好的擴展規律[2]。
即使只看預訓練中出現過的作業,S1 的成功率也達到約 96%。有趣的是,在 1,000 小時這種較小的資料規模下,結果是反過來的:語言提示型為 53%,S1 為 43%。資料少的時候,壓縮成語言的指令比較占優勢;規模上來之後,影片所帶的資訊量才開始發揮作用[2]。
即便在執行途中把物件挪開、換成別的東西或改變照明,S1 依然完成了作業。另有一個例子是,示範中用澆花器澆水,但現場只有杯子,S1 就改用杯子。它把示範當成要達成的目標,而不是要照抄的軌跡[2]。
一段影片,抵得上約 380 次遠端操作
從導入成本來看,最值得注意的是這組對比。用傳統方式達到同等水準,估計需要約 380 次遠端操作示範。而時長 4 到 10 分鐘的作業,蒐集這 380 次得花上 50 到 100 小時的實際操作時間,如今全部由一段影片取代[1][2]。
在換盆測試中,Skild AI 記錄到從示範錄製完成到機器人開始自主執行只花了 11 分鐘。就算從泥土與花盆送到辦公室算起,大部分時間也用在搬家具、布置現場上[1][2]。
不過傳統方式並非永遠追不上。把示範累積到 2,000 次,成功率可達 86%,反超 S1 的 66%[2]。一段影片換來 66% 這個數字究竟夠不夠,取決於現場能容忍多高的失敗率,以及蒐集示範的成本有多高。
訓練靠 NVIDIA,落地攜手 Foxconn
S1 的訓練與驗證在 NVIDIA 的 AI 基礎設施上完成。開放世界基礎模型 NVIDIA Cosmos 用來豐富訓練資料、把影片轉換成結構化描述,Cosmos Curator 則負責大規模資料的標註、篩選與整理。上機之前的驗證使用 NVIDIA Omniverse 函式庫與 Isaac Sim 框架,在符合物理法則的虛擬環境中產生資料、測試邊界情況[1]。
強化學習則放在由 Newton 物理引擎驅動的 Isaac Lab 中進行,讓 Skild AI 能準確建模受力、接觸、碰撞與壓力等物理參數,縮小模擬與現實之間的落差。兩家公司還在共同開發面向 GPU 的模擬求解器,用於快速且準確地計算機器人觸碰、抓取與操作固體物件的過程,未來將作為 Newton 的一部分開放給開發者[1]。
現場面同樣具體。Skild AI、NVIDIA 與 Foxconn 已將 Skild Brain 部署在雙臂機械手上,用於 NVIDIA Blackwell 系統的高精度組裝。在公開的一段工作流程中,機器人安裝匯流排與限位塊,鎖緊 16 顆螺絲,並在現場狀況偏離預定計畫時做出調整[1]。
業務方面,Skild AI 表示首次商用部署 10 個月後,年化營收已達 1 億美元(約 153 億日圓),並在製造、物流、檢測、保全、餐飲調理等領域建立了超過 60 項部署合作[1]。
※1 美元 = 153 日圓(截至 2026 年 9 月 12 日)
總結
S1 是一款把示範影片放進脈絡、就能執行未經訓練的 10 分鐘級作業的機器人基礎模型。在沒學過的作業上,它的成功率為 66%,而語言指令型只有 9%,差距超過 7 倍。「一段影片約等於 380 次遠端操作」這項估算,足以改寫機器人導入的成本結構。目前 S1 的權重與 API 尚未對外開放,商用夥伴的現場應用走在前面,但教機器人做事的方式正從「寫程式」轉向「做給它看」,這一點已經清楚浮現。
