Googleは、あらゆる入力から動画を生成できる新しいAIモデル「Gemini Omni」を発表しました[1]。画像・音声・動画・テキストを組み合わせて入力すると、Geminiが持つ実世界の知識に基づいた高品質な動画を作り出し、さらに会話を通じて編集まで行えるのが特徴です[1]。第1弾となる「Gemini Omni Flash」は、GeminiアプリやGoogle Flow、YouTube ショートへの提供が始まっています[1]。
「あらゆる入力から創造する」Omniファミリー
Gemini Omniは、Geminiの「推論する力」と「創造する力」を組み合わせたモデルだとGoogleは位置づけています[1]。昨年公開された画像生成・編集の「Nano Banana」に続く動きで、まずは動画を起点に、画像・音声・動画・テキストといった複数の入力を1つの動画にまとめ上げます[1]。
今回提供が始まったのは、Omniファミリーの第1弾にあたる軽量・高速路線の「Gemini Omni Flash」です[1]。Googleは今後、画像や音声といった出力にも対応を広げていく予定だとしています[1]。
会話を重ねて動画を編集できる
Gemini Omniの大きな特徴は、自然言語による動画編集です[1]。指示は一つ前の操作を踏まえて積み重なり、登場人物の見た目は一貫して保たれ、物理的な挙動も破綻せず、シーンはそれまでの流れを記憶し続けるとGoogleは説明しています[1]。
たとえば「彫刻を泡で作って」「鏡に触れたら液体のように波打たせて」といった指示で、撮影した動画の一部だけ、あるいは全体を作り変えられます[1]。カメラアングルや環境、スタイルを複数回にわたって変更しても、元のシーンの文脈を見失わないといいます[1]。
物理法則とGeminiの世界知識をふまえた表現
Gemini Omniは見た目がリアルなだけでなく、「次に何が起きるべきか」を推論する点が従来との違いだとされています[1]。重力や運動エネルギー、流体の動きといった力学への直感的な理解が向上し、より現実に近い映像を作れるとGoogleは述べています[1]。
加えて、歴史や科学、文化的な背景に関するGeminiの知識を映像表現に結びつけられるため、短いプロンプトから複雑な概念をかみ砕いて伝える解説動画なども生成できるとしています[1]。
複数入力の組み合わせと「アバター」機能
入力の自由度も高く、画像・テキスト・動画・音声といった素材を参照として、1つのまとまった動画に変換できます[1]。ただし音声入力については、当初は声(ボイス)の参照のみに対応し、ほかの種類の音声入力は順次広げていくとしています[1]。
人物に関しては、自分の声を使って動画を作れる「アバター(Avatars)」機能が用意されました[1]。自分のデジタル版を作成し、本人のように見え、本人のように話す動画を生成できる仕組みです[1]。一方で、動画内の音声や発話を後から編集して差し替えるような機能は、責任ある形で提供できるか引き続き検証している段階だとしています[1]。
SynthID透かしと提供範囲
Gemini Omniで作成した動画には、目に見えない電子透かし「SynthID」がすべて付与されます[1]。GeminiアプリやChrome上のGemini、Google検索を通じて、その動画がGemini Omniで生成されたものかどうかを確認できるとGoogleは説明しています[1]。
提供範囲については、Gemini Omni FlashがGoogle AI Plus・Pro・Ultraの各契約者に対し、GeminiアプリとGoogle Flowを通じて全世界で順次提供されます[1]。YouTube ショートおよびYouTube Create アプリでは追加費用なしで今週から使えるようになり、開発者や企業向けには今後数週間のうちにAPI経由で提供する予定だとしています[1]。
まとめ
Gemini Omniは、画像生成から動画生成へとGeminiのマルチモーダル路線を一段進めるモデルで、会話による編集や、物理・世界知識をふまえた表現を売りにしています。まずは高速版のGemini Omni Flashが各プラットフォームに展開され、SynthIDによる生成元の確認やアバターの仕組みといった安全面への配慮も併せて導入されました。出力できる種類の拡大やAPI提供など、今後の広がりにも注目したいところです。
出典:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni/
