xAI 更新了视频生成模型 Imagine Video 1.5,新增参考图像、参考音频,以及仅凭文字提示生成视频的能力,输出分辨率也提升到原生 1080p。其目标是让同一个人物或同一件商品在不同镜头之间保持不变。这款工具正在从“让一张静态图动起来”,转向“接受拍摄指令、分镜头产出”。

只靠文字就能生成一段视频

此前的 Imagine Video 主要依赖一张起始图像,再由模型让它动起来。这次更新增加了只写提示词就能得到视频的路径。其内部是把图像生成与图像转视频串联起来,而从用户角度看,准备素材图的环节直接消失了。

与之同步的是原生 1080p 输出。文生视频和图生视频都在覆盖范围内,这部分已经全面开放。由于 1080p 是在生成阶段处理而非后期放大,细节的表现会更稳。

每张参考图只锁定一个要素

这次更新的核心是 Multi-Reference。作为参考传入的每一张图像各自负责一个不同的要素:一张固定面孔,一张保留商品,另一张定义场景地点。

正因为有这样的分工,局部替换才成立。保留人物换背景,保留背景换人物,或者两者都固定、只改变动作。单次生成最多可接受 7 张参考图。

AI 视频一直难以处理的,恰恰是“哪些部分不能变”。过去只能靠反复打磨提示词的措辞来召回同一个角色,如今可以直接用图像本身作为锚点。

音频参考让面孔与声音同步保持

第二项新增功能是音频参考。同时提供人物图像与声音样本后,xAI 表示模型可以在多个场景中保持相同的面孔与相同的声音。

对于短片或广告这类由同一角色的多个镜头构成的内容,逐个镜头重建人物形象是最耗力的环节。将面孔与声音成对固定,就能降低分别生成的镜头拼在一起时人物“变脸”的风险。这也说明视频生成的评价标准,正从单个镜头的美感转向整部作品的连贯性。

分阶段推送,API 先行开放

各项功能的开放进度并不一致。

功能 开放状况
图像参考与音频参考 先在美国面向 SuperGrok Heavy 与 SuperGrok Plus 的网页版和 iOS 版开放,随后数日内扩展至全部档位
文生视频 网页版、iOS 版、Android 版全面开放
原生 1080p 网页版、iOS 版、Android 版全面开放

面向开发者,模型以 grok-imagine-video-1.5 的名称通过 API 提供。图像参考、文生视频和原生 1080p 在 API 上均可使用,只有音频参考需要单独申请。应用端分阶段推送,API 端却一次性放开了大部分功能,形成鲜明对比。

Imagine Video 1.5 本身在上个月才发布,当时的卖点是运动表现、物理效果与音频质量。这次是在其之上叠加控制手段,并非重做模型,而是扩大了用户可以指定的范围。

总结

xAI 为 Imagine Video 1.5 增加了最多 7 张参考图像、音频参考、仅凭文字的生成方式,以及原生 1080p 输出。参考图像的设计意图是分别锁定面孔、商品、场景等要素,配合音频参考即可让同一角色在多个镜头中保持一致。参考类功能正从美国的高档位方案逐步扩大,而文生视频与 1080p 已经全面开放。同一模型也可通过 API 调用。