Google 發表了能從各種輸入生成影片的全新 AI 模型「Gemini Omni」[1]。將圖像、音訊、影片與文字組合作為輸入後,它能根據 Gemini 所掌握的真實世界知識生成高品質影片,並且還能透過對話來編輯影片[1]。作為首款產品的「Gemini Omni Flash」已開始向 Gemini 應用程式、Google Flow 以及 YouTube Shorts 提供[1]。
「從任意輸入進行創作」的 Omni 系列
Google 將 Gemini Omni 定位為把 Gemini 的「推理能力」與「創作能力」結合在一起的模型[1]。這延續了去年針對圖像生成與編輯推出的「Nano Banana」,這次先從影片著手,把圖像、音訊、影片、文字等多種輸入整合成一段影片[1]。
此次開始提供的是 Omni 系列的首款產品、走輕量高速路線的「Gemini Omni Flash」[1]。Google 表示,今後還會把支援範圍擴大到圖像、音訊等輸出形式[1]。
透過多輪對話編輯影片
Gemini Omni 的一大特色是用自然語言編輯影片[1]。Google 說明,每一道指令都會在前一步的基礎上疊加,畫面中人物的外觀維持一致,物理表現也不會崩壞,場景還會記住先前的來龍去脈[1]。
舉例來說,透過「用泡泡做出雕塑」「當人觸碰鏡子時讓鏡面像液體般泛起漣漪」之類的指令,就能只改變所拍影片的一部分,或對整體進行改造[1]。即使多次變更鏡頭角度、環境或風格,模型也不會偏離最初的場景[1]。
以物理法則與 Gemini 世界知識為基礎的表現
Google 表示,Gemini Omni 不只是建構看起來逼真的畫面,還會推理「接下來應該發生什麼」,這是它與以往的不同之處[1]。它對重力、動能、流體運動等力學的直覺理解有所提升,因而能生成更貼近現實的畫面[1]。
此外,它還能把 Gemini 關於歷史、科學與文化背景的知識結合到畫面表現上,因此可以根據簡短的提示詞生成把複雜概念講解清楚的解說影片[1]。
多種輸入的組合與「虛擬替身」功能
輸入的自由度也很高,可以把圖像、文字、影片、音訊等素材作為參考,轉換成一段完整的影片[1]。不過在音訊輸入方面,初期僅支援聲音(語音)參考,其他類型的音訊輸入會陸續擴大[1]。
在人物方面,Google 準備了可以用自己的聲音製作影片的「虛擬替身(Avatars)」功能[1]。它會建立一個你的數位分身,生成看起來像你、聽起來也像你的影片[1]。同時,Google 表示,對於在影片中編輯並替換音訊或語音之類的功能,目前仍在驗證能否以負責任的方式提供[1]。
SynthID 浮水印與提供範圍
使用 Gemini Omni 製作的影片都會被加上肉眼看不見的數位浮水印「SynthID」[1]。Google 說明,可以透過 Gemini 應用程式、Chrome 中的 Gemini 以及 Google 搜尋,確認某段影片是否由 Gemini Omni 生成[1]。
在提供範圍方面,Gemini Omni Flash 會透過 Gemini 應用程式與 Google Flow,向 Google AI Plus、Pro、Ultra 各訂閱使用者在全球陸續提供[1]。在 YouTube Shorts 以及 YouTube Create 應用程式上,本週起可免費使用;針對開發者與企業,Google 計畫在未來數週內透過 API 提供[1]。
總結
Gemini Omni 把 Gemini 的多模態路線從圖像生成推進到影片生成,主打透過對話進行編輯,以及以物理與世界知識為基礎的表現。高速版的 Gemini Omni Flash 率先在上述平台推出,同時也導入了 SynthID 來源驗證、虛擬替身機制等安全方面的考量。隨著輸出類型的擴大與 API 的開放,它今後的發展值得關注。
來源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni/
