スタンフォード大学のFei-Fei Li氏らが立ち上げたWorld Labsが、次世代の世界モデル「Atlas」を9月1日に発表しました。文字、画像、動画、3Dという異なる種類のデータを1つのモデルで直接扱う「オムニモデル」で、写真1枚から指定したカメラ位置の映像を作り出したり、数枚の写真から現実の空間を3Dとして再現したりできます。生成できる動画は最長1分、解像度は1440pです。現時点では一部のパートナー向けの早期アクセス段階で、価格やモデル規模は公表されていません。

「世界モデル」とは何か

Atlasを理解するには、まず「世界モデル」という言葉を押さえておく必要があります。文章を予測する大規模言語モデル(LLM)に対して、世界モデルは空間そのものを対象にします。目の前の景色がどう見えるか、時間とともにどう変わるか、視点を動かしたら何が見えるはずかを学習し、想像上の世界を描き出したり、現実の場所を忠実に再現したり、ロボットの行動計画に使ったりするための基盤です。

World Labsはこの分野を「空間知能(Spatial Intelligence)」と呼び、汎用的な世界モデルの構築を目指してきました。同社は昨年10月に、直前のフレームから次のフレームを直接生成する「RTFM」を公開していますが、あちらは明示的な3Dの形状情報を持たない設計でした。Atlasはその点を大きく変え、2Dの画像フレームと3Dの深度マップの両方を生まれつき扱えるようにしています。

1つのモデルで4種類の仕事をこなす

Atlasの特徴は、用途ごとに別のモデルを用意するのではなく、1つのモデルで幅広い作業を担う点です。同社が挙げている主な機能は次の4つです。

カメラ制御つきの生成では、1枚以上の参考画像から、指定したカメラ位置と角度の画像や動画を作ります。カメラの動きを文章で伝えるのではなく、カメラの幾何情報そのものを入力として受け取るため、構図と動きを1コマずつ細かく決められます。入力画像に写っていない部分、たとえばロボットの背面やプールの脇の芝生といった要素は、モデルが持つ世界の知識から補って描き出します。

空間再構成では、1枚から数十枚の写真をもとに現実の空間を組み立てます。同社によれば、2〜3枚の写真があれば忠実な再現ができ、3D再構成に特化した既存の最先端モデルを上回る結果を出しているとのことです。写真が少ないときは想像で隙間を埋め、写真が増えるほど想像の割合が減って正確さが増す、という挙動になります。スタンフォード大学のメインクアッドを2〜25枚の地上写真から再現し、上空から見下ろすカメラ経路の映像まで生成した例が示されています。

時空間シミュレーションは、動画から空間と時間の両方を扱う機能です。3〜5台の一般的なスマートフォンを三脚に固定して撮った映像から、時間を止めて視点を回り込ませる「バレットタイム」風の映像を作り直せます。ロボット向けには、現実空間を3Dに起こしたうえで、その中を動く仮想ロボットのカメラが見るはずのRGB画像と深度データまで生成する「Real-to-Sim」の使い方が想定されています。

画像生成は補助的な位置づけですが、複雑な指示への追従、文字の描画、幅広い画風に対応し、文章や画像から360度パノラマも作れます。

出力は点群と3Dガウシアンスプラット

ゲームやVFX、ロボット開発の現場では、画像や動画だけでなく明示的な3Dデータが必要になります。Atlasは新しい視点の画像を生成しながら同時に奥行きを推定するため、1枚の写真から3Dの世界を丸ごと出力できます。実際の空間を撮った動画からは、各フレームの深度を予測してつなぎ合わせ、3D再構成を行います。

出力形式は点群と3Dガウシアンスプラットの2種類です。点群は形状の見積もりにとどまりますが、ガウシアンスプラットに変換すれば、端末上で高解像度かつ高フレームレートに描画できる完成したシーンになります。これは同社の既存製品「Marble」が使っている表現と同じで、Atlasは今後のMarbleをはじめとする同社製品の基盤になる予定です。

LLMと動画モデルの「いいとこ取り」をした設計

技術面でAtlasは「マルチモーダル自己回帰拡散トランスフォーマー」と説明されています。少し長い名前ですが、分解すると設計思想が見えてきます。

まずマルチモーダルの部分は、文字、画像、カメラ姿勢、3D深度マップを直接処理できることを指します。動画は画像の連なりとして扱い、画像と深度マップにはそれぞれ明示的なカメラ姿勢が紐づきます。LLMがトークン列を文脈として持つのと同じように、Atlasは各画像を3D空間上の位置に固定した「空間コンテキスト」を持ち、そこから次の要素を生成していきます。無関係な2枚の画像を3D空間に置くと、その間をつなぐ通路や部屋をモデルが想像して補完する、という使い方はこの仕組みならではです。

自己回帰は、入力に続けて出力を1要素ずつ順に生成する方式で、作業の種類が違ってもすべて「入力のあとに出力が続く系列」として統一的に扱えます。拡散はノイズを段階的に取り除いて出力を作る方式(Atlasは整流フローモデル)で、画像や動画のような高次元の連続データに向き、推論時のステップ数で速度と品質を調整できます。トランスフォーマーは現代のハードウェアと相性のよい行列演算中心の骨格です。

この構成の利点は、LLM側の高速化技術(KVキャッシュ、キャッシュを意識したルーティング、分離型サービングなど)と、画像・動画モデル側の技術(拡散の蒸留、分類器不要ガイダンス、ノイズスケジュールの調整、VAEの改良など)の両方をそのまま取り込める点にあります。

評価と規模拡大の見通し

同社は、カメラ制御つき生成と3D再構成の2つの作業について比較結果を示しています。カメラ制御では、1枚の画像とパン、トラック、クレーンなどのカメラ動作の組み合わせを各モデルに与え、第三者の評価者がどちらが指示どおりに動いたかを判定しました。Atlasはカメラ情報を直接入力できるのに対し、比較対象の動画モデルには文章で動きを伝えているため条件は同一ではありませんが、カメラ経路が複雑になるほどAtlasの優位が広がったとしています。3D再構成でも、オープンソースの特化型モデルを上回ったと説明されています。

なお、これらの数値はすべてWorld Labs自身による測定で、論文やモデルカード、コードは今回公開されていません。同社は、訓練に使う計算量を増やすたびに新しい能力が現れたとして、今後もスケールに伴って性能が伸びるという見通しを示しています。

まとめ

World Labsが発表したAtlasは、文字・画像・動画・3Dを1つのモデルで扱い、カメラ位置を指定した最長1分・1440pの動画生成、数枚の写真からの3D再構成、動画の視点変更、ロボット向けシミュレーションまでを担う世界モデルです。3Dガウシアンスプラットとして出力できるため、既存製品Marbleとも直結します。現時点では選ばれたパートナーへの早期アクセスのみで、一般提供の時期や料金、モデルの規模は明らかにされていません。空間を「理解して生成する」AIがどこまで実用に近づくのか、今後の展開が注目されます。