NVIDIA 在電腦視覺國際會議「CVPR 2026」上,公開了三篇關於物理AI(用於在現實世界中運作的機器的AI)的研究論文[1]。核心成果包括:讓機器人即使用從未握過的工具也能抓起物體的「抓取」基礎模型、在車載硬體上也能迅速判斷的自動駕駛模型,以及用超過 1,000 款遊戲訓練出來的智慧體AI[1]。三者都貫穿著同一個想法——只要大規模地訓練,系統就能類推到從未見過的情況[1]。

共通點在於「藉由大規模訓練實現泛用化」

CVPR(Computer Vision and Pattern Recognition)是電腦視覺領域規模最大的國際會議之一,今年於 6 月 3 日至 7 日在美國丹佛舉辦[1]。NVIDIA 研究團隊發表的這三篇論文,分別針對機器人抓取、自動駕駛、虛擬智慧體訓練等不同課題,卻共享同一種思路:藉由盡可能大規模地學習多樣的情況,打造出能夠應對從未遇過的場景的系統[1]。

適用於任意夾爪的首個「抓取」基礎模型「GraspGen-X」

機器人抓取AI大多是「專用品」[1]。為兩指夾爪(相當於機器人之手的抓取機構)訓練的AI只能用那兩根手指抓取,每當出現新的手部形態,就必須重新進行資料蒐集、微調與驗證[1]。因此,許多機器人企業一般會鎖定一種確定的手部形態來持續開發[1]。

GraspGen-X 是旨在消除這項限制的首個「抓取」基礎模型(可應用於各種用途的大規模模型)[1]。正如大型語言模型無需追加訓練就能把對語言的理解套用到新任務上,GraspGen-X 也能把對幾何形狀與接觸的理解,套用到從未遇過的夾爪上[1]。給定新夾爪的形狀和一個從未見過的物體,它就能生成可靠地抓起該物體的抓握姿態候選[1]。

它的訓練需要在現實中無法大規模蒐集的資料[1]。研究團隊生成了橫跨數千種物體形狀與合成夾爪組態的 20 億次抓取模擬,涵蓋了實機可能遇到的多樣形態[1]。對開發者而言,這省去了針對每種手部形態重新訓練的工夫,對幾款常用夾爪可以直接使用[1]。GraspGen-X 與新公開的、支援 CUDA 加速的動作規劃函式庫「curoboV2」結合,即使在未知環境中也能實現目標抓握姿態[1]。此外,作為相關論文,在 ICRA 2026 上發表的「Grasp-MPC」,把從抓握姿態生成推進到實際持續抓取的閉迴路控制這個下一階段[1]。

在車載硬體上快速思考的自動駕駛模型「LCDrive」

近年的研究發現,讓AI在給出答案之前先走一遍思考過程的「推理(已訓練的AI得出答案的處理過程)」,能夠確實提升判斷品質[1]。但就自動駕駛車而言,要在車內的硬體上實際運行這種思考是個難題[1]。在以文字組織思考的方式中,每一個詞都會成為一個 token(AI處理文本的最小單位),生成需要時間[1]。在車內的處理器上,這個 token 數量會成為左右回應速度的現實制約[1]。

LCDrive 透過把這些詞替換為壓縮後的潛在表示(內部壓縮的表示)來因應這個問題[1]。它不再寫出人類可讀的思考步驟,而是在捕捉了空間資訊的壓縮空間中進行思考[1]。其機制是:提出行動候選,再預測採取該行動後世界會如何變化,交替進行這兩種思考,並依據預測出的狀態來打磨下一步[1]。這是把同樣的推理迴圈,以比自然語言計算效率更高的形式運轉起來的思路[1]。結果,它以大約一半的 token 數量,實現了與文字思考方式相當的行駛軌跡品質[1]。該模型以 NVIDIA Alpamayo 為基礎,並以從既有車輛資料中取得的監督資訊進行訓練[1]。

用超過 1,000 款遊戲鍛鍊的具身AI智慧體「NitroGen」

NVIDIA 面向人形機器人的開放基礎模型「Isaac GR00T」,建立在一個簡單的原則之上:只要讓模型接觸足夠多樣的情況,它就能類推到從未見過的情況[1]。NitroGen 把這項原則擴展到虛擬環境,借助 GR00T 的架構,訓練出一個能在廣泛虛擬世界中運作的具身AI智慧體(學習在現實世界中行動的AI)的基礎模型[1]。

電子遊戲能夠大規模地提供結構化且多樣的世界,並具備明確的目標與達成條件[1]。NitroGen 把遊戲當作「訓練場」,用來培養那些日後將應對現實或其他模擬環境中新情況的智慧體[1]。這個思路指向的,例如是為依據「把這些東西收進儲藏室」這類籠統指令來幫忙做家事的機器人打下基礎[1]。把以 GR00T 為基礎的模型在超過 1,000 款遊戲與 4 萬小時的操作中訓練後,所產生的智慧體能夠跨環境地通用行動[1]。它在動作角色扮演遊戲、平台跳躍、Roguelike、開放世界等廣泛的遊戲中接受評測,展現出戰鬥、移動、探索等行為[1]。

同樣的方法還有望用於實現遊戲內更具適應性的NPC(非玩家角色)、AI夥伴與玩法系統,乃至對複雜遊戲環境進行更廣泛的測試[1]。在僅見過新環境少量範例的「少資料」條件下,從 NitroGen 起步會讓智慧體佔據很大優勢,相比過往的最先進方法,效能最高提升了 52%[1]。該模型為開源,已在 GitHub 與 Hugging Face 上公開[1]。

加速研究的物理AI新技能

在 CVPR 上,除了這三篇論文,NVIDIA 還公開了能加速自動駕駛車、機器人與視覺AI系統開發的全新物理AI智慧體技能[1]。其目的,是讓研究者與開發者更容易把模型的能力,串接成可在現實世界中部署的一整套工作流程[1]。

總結

這三篇論文的特點,在於把抓取、自動駕駛、虛擬智慧體這些不同的課題,以「藉由大規模學習獲得通用性」這個共同思路綁在了一起。適用於任意夾爪的 GraspGen-X、在車載硬體上快速判斷的 LCDrive,以及用超過 1,000 款遊戲鍛鍊的 NitroGen,都看重不被特定用途束縛的應用能力。其中尤其是 NitroGen 已以開源形式在 GitHub 等平台公開,機器人與遊戲AI的開發者可以在自己的環境裡試用,這一點也有望拓寬這項研究的觸及範圍[1]。

資料來源:https://blogs.nvidia.com/blog/cvpr-research-grasping-driving-agent-training/