谷歌发布了能够从各种输入生成视频的全新 AI 模型「Gemini Omni」[1]。将图像、音频、视频和文本组合作为输入后,它能基于 Gemini 掌握的现实世界知识生成高质量视频,并且还能通过对话对视频进行编辑[1]。作为首款产品的「Gemini Omni Flash」已开始向 Gemini 应用、Google Flow 以及 YouTube Shorts 提供[1]。
「从任意输入进行创作」的 Omni 系列
谷歌将 Gemini Omni 定位为把 Gemini 的「推理能力」与「创作能力」结合在一起的模型[1]。这延续了去年面向图像生成与编辑推出的「Nano Banana」,此次先从视频入手,把图像、音频、视频、文本等多种输入整合成一段视频[1]。
此次开始提供的是 Omni 系列的首款产品、走轻量高速路线的「Gemini Omni Flash」[1]。谷歌表示,今后还将把支持范围扩大到图像、音频等输出形式[1]。
通过多轮对话编辑视频
Gemini Omni 的一大特点是用自然语言编辑视频[1]。谷歌说明称,每条指令都会在上一步的基础上叠加,画面中人物的外观保持一致,物理表现也不会崩坏,场景还会记住此前的来龙去脉[1]。
例如,通过「用气泡做出雕塑」「当人触碰镜子时让镜面像液体一样泛起波纹」之类的指令,就可以只改变所拍视频的一部分,或对整体进行改造[1]。即便多次更改镜头角度、环境或风格,模型也不会偏离最初的场景[1]。
基于物理规律与 Gemini 世界知识的表现
谷歌表示,Gemini Omni 不只是构建看起来逼真的画面,还会推理「接下来应该发生什么」,这是它与以往的不同之处[1]。它对重力、动能、流体运动等力学的直觉理解有所提升,从而能生成更接近现实的画面[1]。
此外,它还能把 Gemini 关于历史、科学和文化背景的知识与画面表现结合起来,因此可以根据简短的提示词生成把复杂概念讲解清楚的解说视频[1]。
多种输入的组合与「虚拟形象」功能
输入的自由度也很高,可以把图像、文本、视频、音频等素材作为参考,转化成一段完整的视频[1]。不过在音频输入方面,初期仅支持声音(语音)参考,其他类型的音频输入将陆续扩展[1]。
在人物方面,谷歌准备了可以用自己的声音制作视频的「虚拟形象(Avatars)」功能[1]。它会创建一个你的数字分身,生成看起来像你、听起来也像你的视频[1]。与此同时,谷歌表示,对于在视频中编辑并替换音频或语音之类的功能,目前仍在验证能否以负责任的方式提供[1]。
SynthID 水印与提供范围
使用 Gemini Omni 制作的视频都会被加上肉眼看不见的数字水印「SynthID」[1]。谷歌说明称,可以通过 Gemini 应用、Chrome 中的 Gemini 以及谷歌搜索来确认某段视频是否由 Gemini Omni 生成[1]。
在提供范围方面,Gemini Omni Flash 将通过 Gemini 应用与 Google Flow,面向 Google AI Plus、Pro、Ultra 各订阅用户在全球陆续提供[1]。在 YouTube Shorts 以及 YouTube Create 应用上,本周起可免费使用;面向开发者和企业,谷歌计划在未来数周内通过 API 提供[1]。
总结
Gemini Omni 把 Gemini 的多模态路线从图像生成推进到视频生成,主打通过对话进行编辑,以及基于物理与世界知识的表现。高速版的 Gemini Omni Flash 率先在上述平台铺开,同时还引入了 SynthID 来源核验、虚拟形象机制等安全方面的考量。随着输出类型的扩大和 API 的开放,它今后的发展值得关注。
来源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni/
