xAI 更新了影片生成模型 Imagine Video 1.5,新增參考影像、參考語音,以及只靠文字提示就能產生影片的能力,輸出解析度也提升到原生 1080p。目的是讓同一位人物或同一項產品在不同鏡頭之間維持不變。這項工具正從「讓一張靜態圖動起來」,轉為「接下拍攝指示、分鏡頭產出」。

只靠文字就能產出一段影片

先前的 Imagine Video 主要仰賴一張起始影像,再由模型讓它動起來。這次更新加入了只寫提示詞就能取得影片的路徑。其內部是把影像生成與影像轉影片串接起來,但從使用者的角度看,準備素材圖的步驟直接消失了。

與此同時,輸出也支援原生 1080p。文字生影片與影像生影片皆在涵蓋範圍內,這部分已全面開放。由於 1080p 是在生成階段處理,而非事後放大,細節的表現會更為紮實。

每張參考圖只鎖定一個要素

這次更新的重點是 Multi-Reference。作為參考傳入的每一張影像,各自負責一個不同的要素:一張固定臉孔,一張保留產品,另一張界定場景地點。

正因為有這樣的分工,局部替換才得以成立。保留人物換背景、保留背景換人物,或是兩者都固定、只改變動作。單次生成最多可接受 7 張參考圖。

AI 影片一直難以處理的,正是「哪些部分不能變」。過去只能靠反覆推敲提示詞的用字來喚回同一個角色,如今可以直接把影像本身當成錨點。

語音參考讓臉孔與聲音同步維持

第二項新增功能是語音參考。同時提供人物影像與聲音樣本後,xAI 表示模型可在多個場景中維持相同的臉孔與相同的聲音。

對於短片或廣告這類由同一角色多個鏡頭構成的內容,逐個鏡頭重建人物形象是最耗力的環節。把臉孔與聲音成對固定,就能降低分別生成的鏡頭拼接後人物看起來像換人的風險。這也顯示影片生成的評價標準,正從單一鏡頭的美感,轉向整部作品的連貫性。

分階段推送,API 先行開放

各項功能的開放進度並不一致。

功能 開放狀況
影像參考與語音參考 先在美國面向 SuperGrok Heavy 與 SuperGrok Plus 的網頁版與 iOS 版開放,隨後數日內擴及所有方案
文字生影片 網頁版、iOS 版、Android 版全面開放
原生 1080p 網頁版、iOS 版、Android 版全面開放

面向開發者,該模型以 grok-imagine-video-1.5 的名稱透過 API 提供。影像參考、文字生影片與原生 1080p 在 API 上皆可使用,只有語音參考需要另行申請。應用程式端採分階段推送,API 端卻一次開放了大部分功能,形成明顯對比。

Imagine Video 1.5 本身在上個月才發表,當時的訴求是動態表現、物理效果與音訊品質。這次是在其之上疊加控制手段,並非重做模型,而是擴大了使用者可以指定的範圍。

總結

xAI 為 Imagine Video 1.5 增加了最多 7 張參考影像、語音參考、僅憑文字的生成方式,以及原生 1080p 輸出。參考影像的設計意圖是分別鎖定臉孔、產品、場景等要素,搭配語音參考即可讓同一角色在多個鏡頭中保持一致。參考類功能正從美國的高階方案逐步擴大,文字生影片與 1080p 則已全面開放。同一個模型也可透過 API 呼叫。