Google 的影片製作工具「Google Vids」現在可以直接使用生成式AI模型 Gemini Omni。除了依照提示詞生成影片片段,也能對手邊既有的影片以一句話下達修改指令。同時登場的還有讓自己的數位分身唸稿的個人虛擬形象功能。分階段推送自7月16日展開,8月5日起適用範圍再擴大。

Omni Flash 拉高生成片段的品質

首先改變的,是在 Vids 中所生成影片片段本身的品質。生成採用 Google 最新的 Omni Flash 模型,官方表示其在文字算繪、物理運動的表現以及整體真實感上,都優於先前的模型。

影片生成AI長期以來的弱點,正是畫面中出現的文字,以及物體掉落、碰撞時的動作表現。這兩處一旦失真,即使是短片也會讓人一眼看出是合成的。Vids 大量用於在商務簡報與內部資料中嵌入影片,因此這兩點的改善在實際使用時相當容易感受到。

只要打字就能修改影片

另一根支柱是以文字下指令的編輯方式。由於 Omni 能理解影片的內容,使用者不必逐格操作時間軸就能完成修改。

Google 舉出的例子相當具體:調整色彩分級、把整段畫面改成動畫風格、消除背景混入的紐約警笛聲,這些都能以一行文字達成。重新拍攝素材或匯出到另一套剪輯軟體的來回流程因此得以減少。

不過這項編輯功能帶有地區限制。以 Omni 編輯非AI生成的影片,在推出之初無法在歐洲經濟區(EEA)、瑞士、英國,以及美國的德州與伊利諾州使用。這些都是對生成式AI與肖像、資料處理規範較嚴格的司法管轄區,Google 因此對實拍素材的處理劃出了審慎的界線。

錄製臉部與聲音生成的個人虛擬形象

與此同時,個人虛擬形象功能也一併導入。建立流程從電腦端的 Vids 開始:選擇「Personal avatar」,用手機或平板掃描畫面上的 QR Code,再依照指示錄製本人的臉部與聲音。通過這道驗證後,系統就會生成重現本人外貌與聲音的數位主講者。之後用提示詞描述虛擬形象的動作與說話方式,需要時再附上講稿,它便會代替本人朗讀。

對於內部公告、產品說明這類只需替換內容卻得反覆重拍的影片而言,拍攝這道工序可以直接省去。另一方面,虛擬形象是與本人臉孔和聲音綁定的資產,因此誰能建立、誰可以重複使用,需要由組織方事先訂好規則。

這項功能同樣附帶條件。推出之初,個人虛擬形象僅支援英文,且僅開放給18歲以上的使用者。在歐洲經濟區、瑞士與英國並不提供。

推送時程與適用版本

功能採分階段推送。更新較快的 Rapid Release 網域自7月16日起,更新較慢的 Scheduled Release 網域自8月5日起陸續啟用,兩者都需最多15天功能才會顯現。若自己的環境尚未出現,還有等待的餘地。

適用版本包括 Business Starter、Standard 與 Plus,Enterprise Starter、Standard 與 Plus,Education Plus,以及 Enterprise Essentials 與 Enterprise Essentials Plus 和非營利組織版本。個人使用者方面,Google AI Pro 與 Ultra 的訂閱者也在涵蓋範圍內。附加元件方面則包括 Google AI Pro for Education、Teaching and Learning 與 AI Expanded Access,其中持有 AI Expanded Access 的使用者,在 Vids 中使用 Omni 的額度上限較高。

另外,Omni 的生成與編輯功能沒有提供給管理者的開關,只要滿足版本條件,推送抵達時即可使用。個人虛擬形象則不同:該功能預設為開啟,但管理者可以在管理控制台中以網域為單位停用或啟用。

總結

Gemini Omni 進入 Google Vids,對製作端與修改端都帶來了改進。Omni Flash 改善了文字表現與物理運動,而僅憑文字指令就能完成調色、動畫風格轉換乃至背景雜訊消除。個人虛擬形象提供了完全省去拍攝的選項,但實拍影片的編輯與虛擬形象都帶有地區與語言上的限制,實際可用範圍會因環境而異。推送方面,Rapid Release 網域自7月16日起、Scheduled Release 網域自8月5日起,兩者均需最多15天陸續到位。

參考連結:Google Workspace Updates:Omni in Vids / Google Workspace Updates:Personal avatars with Gemini Omni in Vids / Google 文件編輯器說明:建立、使用與管理個人虛擬形象