NVIDIAの研究部門が、ロボット工学の国際会議ICRA(International Conference on Robotics and Automation)で採択された論文の成果を公開しました[1]。採択された28本のうち8本が、仮想空間で学習した成果を現実のロボットへ移す「シミュレーション・トゥ・リアル(sim-to-real、仮想から現実への転移)」を扱っています[1]。研究室の決められた動作の枠を超えて、予測しにくい現実の環境でも安定して動くロボットを目指す内容で、その共通の土台になりつつあるのがこの転移技術だと説明されています[1]。

「台本どおりの自動化」からの脱却

ロボットの世界は、決められた手順をなぞるだけの自動化から、状況に合わせて自分で判断し動く段階へ移りつつあります[1]。今回紹介された論文群は、複数のアームを同時に動かす制御から、形の異なる機体への対応、雑然とした場所での物のつかみ取り、精密な組み立て、そして「動く前に考える」視覚・言語・行動モデルまで、ロボット開発が直面する課題の全域に及びます[1]。

複数アームの連携、機体をまたぐ移動、物のつかみ取り

最初のテーマは、複数のロボットアームを効率よく動かす制御です。従来のスケジューリングは1本ずつ順番に処理していましたが、計算をGPU上で走らせる「ScheduleStream」は複数のアームが同時に動作計画を立てられるようにしました[1]。エッジ向けAIプラットフォーム「NVIDIA Jetson」などのハードウェア上で、複数アームの計画が3倍速くなったとしています[1]。

移動の制御では、ある機体で学んだ歩き方やルート探索が、形の違う機体ではうまく働かないという課題があります[1]。「COMPASS」は、まず模倣学習で基本動作を作り、シミュレーション環境「NVIDIA Isaac Lab」での強化学習によって多様な機体向けに調整します[1]。学習はすべて仮想空間で行い、実機のデータは一切使いません[1]。模倣学習だけの場合と比べて成功率は4.5倍に向上し、実機での移動でも20回の試行のうちおよそ8割で成功したとしています[1]。

物をつかむ動作では、最後の数センチでわずかな誤差が結果を左右します[1]。「Grasp-MPC」は固定した計画をそのまま実行するのではなく、対象に近づきながら動きを継続的に修正します[1]。8,000種類の物体について200万件の模擬軌道を生成して学習させた結果、雑然と物が並ぶ棚や机でも未知の物体をつかめるようになり、実機での成功率はおよそ75パーセント(比較対象は41パーセント)に達しました[1]。さらに「Deformable Cluster Manipulation」は、送電線に絡んだ木の枝のように決まった形のない束を、グリッパーだけでなくアーム全体を使って払いのける手法を示しました[1]。

精密な組み立てに挑む

ボルトにナットを通す、穴にピンを差し込むといった精密な組み立ては、シミュレーションだけで再現するのが難しい作業です[1]。「SPARR」は、Isaac Labで一般的な手順を学んだうえで、実機側ではカメラを使って仮想と現実のずれを補正する2段構えを採りました[1]。これにより、ゼロから現実に移す手法と比べて成功率が38パーセント向上し、作業時間も約30パーセント短縮されています[1]。学習に使っていない米国立標準技術研究所(NIST)の組み立て課題では、成功率がおよそ75パーセント改善したとしています[1]。

複数の手順が連なる組み立てを扱うのが「Refinery」です[1]。家具の組み立てで一つ前の工程の仕上がりが次の工程の可否を左右するように、各工程を次につながる状態で終えることを学習します[1]。シミュレーションでの成功率は91パーセントで、現実でも同等の結果が得られ、長い手順を連結して扱えるとしています[1]。

「言ったとおりに動く」行動モデル

カメラが捉えた情報の多くは、作業に関係のないノイズです[1]。「PEEK」は、視覚・言語・行動モデル(VLA、画像と言葉から行動を導くAI)に指示文を読ませ、注目すべき対象だけを強調して残りをぼかすことで、ロボットが見るべき場所に視線を集中させます[1]。シミュレーションだけで学習した方策に組み合わせると、現実での精度が41倍に向上し、大規模なVLAや小型の方策でも2倍から3.5倍の改善が見られました[1]。

もう一つの「SEAL」は、AIが正しく筋道を立てて考えたのに、実際には別の動作をしてしまうという失敗に対処します[1]。複数の行動候補を生成し、それぞれがどこに行き着くかを想定したうえで、宣言どおりの結果になる候補を選びます[1]。再学習なしに実行時へ組み込め、従来手法より最大15パーセントの精度向上が得られたとしています[1]。

大学やデータセットへの広がり

NVIDIAは論文に加えて、ロボット研究向けの大規模な公開データセットも拡充しています[1]。「NVIDIA Physical AI Dataset」はダウンロード数が1,500万件を超え、「NVIDIA Isaac GR00T X Embodiment Sim」も多くダウンロードされているとしています[1]。さらに、カーネギーメロン大学(CMU)、チューリッヒ工科大学(ETH Zurich)、マサチューセッツ工科大学(MIT)、テキサス大学オースティン校などの研究チームが、NVIDIAの技術を活用した論文をおよそ50本発表したと紹介されています[1]。

現実の環境は、表面の凹凸やセンサーの誤差など、シミュレーションが無視しがちな要素であふれています[1]。今回の研究はその差を埋める手段を具体的に示しており、ロボットが研究室の外でも実用的に働くための一歩といえそうです。

まとめ

NVIDIA Researchは、ICRAで採択された論文を通じて、仮想空間での学習を現実のロボットへ移す技術の進展を示しました。複数アームの連携を3倍速くする「ScheduleStream」、機体をまたいで使える「COMPASS」、未知の物体をつかむ「Grasp-MPC」、精密組み立ての「SPARR」「Refinery」、視線や行動を整える「PEEK」「SEAL」など、研究室の枠を超えて動くロボットを支える具体的な成果が並びます。大学との連携や公開データセットの広がりも含め、シミュレーションから現実への橋渡しがロボット開発の共通基盤になりつつあることがうかがえます。

出典:https://blogs.nvidia.com/blog/icra-research-robotics-simulation-to-real-world/