xAIが動画生成モデル「Imagine Video 1.5」を更新し、参照画像と参照音声、そして文章だけで動画を作る機能を追加しました。出力解像度もネイティブ1080pに引き上げられています。狙いは、同じ人物や同じ商品を別のカットでも崩さずに出し続けることです。1枚の静止画を動かすツールから、映像の設計図を渡して撮り分けるツールへと役割が変わりつつあります。
文章だけで1本作れるようになった
これまでのImagine Videoは、起点となる画像を用意してそこから動かす使い方が中心でした。今回の更新では、プロンプトを書くだけで動画が出てくる経路が加わっています。内部的には画像生成と画像から動画への変換をつなげた構成で、利用者から見れば「元絵を用意する工程が消えた」ということになります。
あわせて出力がネイティブ1080pに対応しました。文章からの生成と画像からの生成の両方が対象で、こちらはグローバルに提供済みです。アップスケールではなく生成段階で1080pを扱うため、細部の描写がにじみにくくなる方向の変更と考えてよさそうです。
参照画像は「1枚につき1要素」を固定する
今回の目玉と言えるのがMulti-Referenceです。参照として渡した画像が、それぞれ別の要素を押さえる役割を持ちます。ある1枚は顔、別の1枚は商品、さらに別の1枚は場所、という具合に分担させる設計です。
この分け方があると、変えたい部分だけを差し替える操作が成立します。人物はそのままで背景を入れ替える、背景を保ったまま登場人物を交代させる、両方を固定して動作だけを変える、といった指定ができます。参照は1回の生成につき最大7点まで受け付けます。
生成AIの動画で扱いにくかったのは、この「変えない部分」の指定でした。プロンプトの言葉づかいを工夫して同じ人物を呼び出す運用が続いていたところに、画像そのものを錨として渡せるようになった格好です。
顔と声をそろえる音声参照
もう1つ加わったのが音声の参照です。人物の画像と声のサンプルを一緒に渡すと、シーンをまたいでも同じ顔と同じ声が保たれるとされています。
短編やCMのように、同じ登場人物で複数カットを撮る用途では、カットごとに人物像を組み直す手間が最大の負担でした。顔と声をセットで固定できるなら、カット単位の生成を並べても人物が別人に見えてしまう事故は減ります。動画生成の評価軸が、1カットの美しさから作品全体のつながりへ移っていることがうかがえる変更です。
提供範囲は段階的、APIは先行して開放
配信の状況は機能ごとに異なります。
| 機能 | 提供状況 |
|---|---|
| 画像参照・音声参照 | 米国のSuperGrok HeavyとSuperGrok Plus向けにWeb版とiOS版で開始、数日かけて全ティアへ拡大 |
| 文章からの動画生成 | Web版・iOS版・Android版で一般提供 |
| ネイティブ1080p | Web版・iOS版・Android版で一般提供 |
開発者向けには、モデル名grok-imagine-video-1.5としてAPIから利用できます。画像参照、文章からの生成、ネイティブ1080pはAPIでも利用可能で、音声参照だけは個別の申請が必要という扱いです。アプリ側の段階的な配信に対して、APIは主要機能をまとめて開けている点が対照的です。
Imagine Video 1.5そのものは前月に公開されたばかりで、そのときは動きと物理表現、音声の質が訴求点でした。今回はその上に制御の手段を重ねた更新であり、モデルを作り替えるのではなく、使い手が指定できる範囲を広げる方向に寄せています。
まとめ
xAIはImagine Video 1.5に、最大7点までの参照画像、音声参照、文章だけからの生成、ネイティブ1080p出力を追加しました。参照画像は顔や商品、場所といった要素を個別に固定する使い方を想定しており、音声参照と組み合わせれば複数カットで同じ人物を保てます。参照系の機能は米国の上位プランから順次拡大中で、文章からの生成と1080pはすでに一般提供されています。APIでも同じモデル名で扱えます。
