谷歌的视频制作工具「Google Vids」现已可以直接使用生成式AI模型 Gemini Omni。除了根据提示词生成视频片段,还能对手头已有的视频用一句话下达修改指令。同时上线的还有让自己的数字分身念稿的个人虚拟形象功能。分阶段推送自7月16日开始,8月5日起覆盖范围进一步扩大。
Omni Flash 提升生成片段的质量
首先改变的是在 Vids 中所生成视频片段本身的质量。生成环节采用谷歌最新的 Omni Flash 模型,官方称其在文字渲染、物理运动表现以及整体真实感方面均优于此前的模型。
视频生成AI长期以来的弱项,正是画面中出现的文字,以及物体掉落、碰撞时的动作表现。这两处一旦失真,即便是短片也会让人一眼看出是合成的。Vids 大量用于在商务演示和内部资料中嵌入视频,因此这两点的改善在实际使用中很容易被感知。
只要打字就能修改视频
另一根支柱是通过文字下达指令的编辑方式。由于 Omni 能够理解视频的内容,用户不必逐帧操作时间轴即可完成修改。
谷歌举出的例子相当具体:调整色彩分级、把整段画面改成动画风格、去掉背景里混入的纽约警笛声,这些都可以用一行文字实现。重新拍摄素材或导出到另一款剪辑软件的来回流程因此得以减少。
不过该编辑功能带有地区限制。用 Omni 编辑非AI生成的视频,在推出之初无法在欧洲经济区(EEA)、瑞士、英国以及美国的得克萨斯州和伊利诺伊州使用。这些都是对生成式AI与肖像、数据处理监管较严的司法辖区,谷歌因此对实拍素材的处理划出了谨慎的边界。
录制面部与声音生成的个人虚拟形象
与此同时,个人虚拟形象功能也一并引入。创建流程从电脑端的 Vids 开始:选择「Personal avatar」,用手机或平板扫描屏幕上的二维码,再按照提示录制本人的面部与声音。通过这道验证后,系统就会生成还原本人外貌与声音的数字主播。之后用提示词描述虚拟形象的动作与说话方式,需要时再附上讲稿,它便会代替本人朗读。
对于内部通知、产品讲解这类只需替换内容却要反复重拍的视频而言,拍摄环节可以直接省去。另一方面,虚拟形象是与本人面孔和声音绑定的资产,因此谁有权创建、谁可以重复使用,需要由组织方事先定好规则。
这项功能同样附带条件。推出之初,个人虚拟形象仅支持英语,且仅面向18岁以上的用户开放。在欧洲经济区、瑞士和英国不提供该功能。
推送时间表与适用版本
功能采取分阶段推送。更新较快的 Rapid Release 域自7月16日起,更新较慢的 Scheduled Release 域自8月5日起依次启用,两者都需最多15天功能才会显现。如果自己的环境尚未出现,还有等待的余地。
适用版本包括 Business Starter、Standard 和 Plus,Enterprise Starter、Standard 和 Plus,Education Plus,以及 Enterprise Essentials 与 Enterprise Essentials Plus 和面向非营利组织的版本。个人用户方面,Google AI Pro 和 Ultra 的订阅者也在覆盖范围内。附加组件方面则包括 Google AI Pro for Education、Teaching and Learning 和 AI Expanded Access,其中持有 AI Expanded Access 的用户在 Vids 中使用 Omni 的额度上限更高。
另外,Omni 的生成与编辑功能没有面向管理员的开关,只要满足版本条件,推送到达时即可使用。个人虚拟形象则不同:该功能默认开启,但管理员可以在管理控制台中按域停用或启用。
总结
Gemini Omni 进入 Google Vids,对制作端和修改端都带来了改进。Omni Flash 改善了文字表现与物理运动,而仅凭文字指令就能完成调色、动画风格转换乃至背景噪声去除。个人虚拟形象提供了完全省去拍摄的选项,但实拍视频的编辑与虚拟形象都带有地区和语言方面的限制,实际可用范围因环境而异。推送方面,Rapid Release 域自7月16日起、Scheduled Release 域自8月5日起,两者均需最多15天陆续到位。
参考链接:Google Workspace Updates:Omni in Vids / Google Workspace Updates:Personal avatars with Gemini Omni in Vids / Google 文档编辑器帮助:创建、使用与管理个人虚拟形象
