米国カリフォルニア州のAIスタートアップVisko(Visko Platform Inc.)は9月1日(現地時間)、動画生成の基盤モデル「Orbis」の一般公開を開始しました。従来の動画生成AIのように数秒〜数十秒のクリップを作って終わるのではなく、4K・毎秒24フレームの映像をリアルタイムに生成し続け、途中で指示を変えると映像を止めずに内容が切り替わるのが特徴です。あわせて、Llama Venturesが主導するプレシード投資ラウンドで1,000万ドル(約16億円)を調達したことも明らかにしています。
※1ドル159円換算(2026年9月2日時点)
「レンダリングする」のではなく「走らせる」モデル
これまでの動画生成AIの多くは、プロンプトを入力して待ち、出来上がった1本のクリップを受け取るという使い方でした。出来上がった映像はそこで確定し、続きを足したり途中から変えたりはできません。
Viskoはこれに対して、自社のモデルを「Live Model(ライブモデル)」という新しい分類で呼んでいます。同社の言い方を借りれば、映像を「レンダリング(描画)する」のではなく「走らせる」モデルです。Orbisは最初のフレームを生成したらすぐに配信し、次のフレームは直前までの内容を踏まえて生成する、という処理を延々と繰り返します。創業者でCEOのQing(Will)Yin氏はこの仕組みを、大規模言語モデルが次の単語を1つずつ予測していく処理に近いと説明しています。
この設計のおかげで、生成中にプロンプトを差し替えると、映像が止まったり最初からやり直しになったりせず、その場で世界の中身が変わっていきます。対応する用途はテキストからの動画生成、画像からの動画生成、既存動画の続きの生成の3つで、多言語のプロンプトにも対応します。
1時間規模でも崩れない、というのが売り
リアルタイム生成系のモデルが抱えてきた最大の課題は、長く動かすほど映像が破綻していくことでした。Yin氏も「長く走らせるほど世界が崩れていく壁に、これまでのリアルタイム系はすべてぶつかってきた」と述べており、Orbisはこの壁を越えるために作られたとしています。
同社の技術報告書によると、Orbisは4K・24fpsのリアルタイム生成を維持しながら、1時間規模の生成でも目立った画質低下や色ずれが起きないとされています。鍵になっているのは、被写体・シーン・画風を区切りをまたいで保持する多段階のメモリと、推論中に複数の「次の展開」候補を採点して物理的にもっともらしい動きへ導く潜在世界モデルの2つです。物体の動きや運動をこの世界モデルで裏付けることで、ただ見た目が続くだけでなく、動きとしても自然な映像を目指しています。
評価面では、映像の美的品質と技術品質を測るDOVER、映像と動きの品質を測るVideoAlignの両方で、比較対象となったリアルタイム系・長尺系のシステムを上回ったとしています。8つのシステムを比べた長尺動画の人手評価でも、総合的な好みと時間的な安定性の2項目でOrbisが最高評価だったそうです。一方で、他のシステムに劣る項目があることも報告書で開示しており、評価方法と結果はすべて公開されています。この技術報告書は7月29日にarXivにも投稿されています。
元Apple研究者が率いる16人のチーム
Viskoは2025年設立で、本社はカリフォルニア州サニーベールにあります。創業者のYin氏はスタンフォード大学で計算数学・力学の博士号を取得し、Appleで3年間研究者を務めた人物です。チームは16人で、Apple、Google DeepMind、Meta、Amazon、Teslaの出身者が集まっています。
顧問陣も目を引きます。アドバイザリーボードの議長はカリフォルニア大学バークレー校のMichael I. Jordan氏で、機械学習分野の第一人者として知られる研究者です。ほかにコロンビア大学のSteve WaiChing Sun氏、ニューヨーク大学のMengye Ren氏が名を連ねています。Jordan氏はOrbisについて、短いクリップを作る従来型の動画生成に対して技術的に意味のあるリードがあり、ロボティクスや物理シミュレーションからゲーム、ライブコマース、教育、リアルタイムの創作メディアまで幅広い商用機会につながり得るとコメントしています。配信はパートナー企業のReactorが担当します。
狙いはロボットの学習用データ
Viskoが最初の用途として強く意識しているのは、エンタメよりもロボティクスです。Yin氏は、危険だったりコストがかかったりして実際に撮影しにくい状況の映像を、シミュレーションや学習用データとして生成できる点を挙げています。自動運転車や人型ロボットの安全性を検証するための、めったに起きない状況(コーナーケース)の環境づくりにも使えるとしています。
同時に、まだ足りない部分もはっきり語られています。研究面ではメモリ構造の設計をさらに改良して生成全体の一貫性を高めること、学習データに「アームを45度上げる」といった細かい動作の記述を加えていくことが課題です。エンジニアリング面ではモデルとデータの規模拡大が控えており、現在は音声と映像のデータが中心ですが、触覚などのセンサーデータを取り込む可能性も探っているそうです。Yin氏は、汎用ロボットが家庭に入るまでには自動運転と同じように時間がかかるとみており、その道中で商用化の機会を見つけていくと述べています。
まとめ
Viskoの「Orbis」は、4K・24fpsの映像をリアルタイムに生成し続け、途中でプロンプトを変えても止まらない「Live Model」として一般公開されました。1時間規模でも画質や色が崩れにくいという点が最大の売りで、人手評価では8システム中で総合評価と時間的安定性のトップを主張しています。元Apple研究者が率いる16人のチームが1,000万ドルを調達して挑むのは、動画コンテンツの生成というより、ロボットや自動運転の学習に使える「走り続ける世界」の実現です。
