美國加州的 AI 新創公司 Visko(Visko Platform Inc.)於當地時間 9 月 1 日,向大眾開放影片生成基礎模型「Orbis」。有別於傳統影片生成 AI 產出幾秒到數十秒的片段就結束,Orbis 能以 4K、每秒 24 格的規格即時持續生成畫面,中途更改指示時畫面不會中斷,內容會直接切換。公司同時宣布,在由 Llama Ventures 領投的種子前輪募資中取得 1,000 萬美元(約 16 億日圓)。
※1 美元 = 159 日圓(截至 2026 年 9 月 2 日)
不是「渲染」,而是「運行」的模型
到目前為止,多數影片生成 AI 的用法都是:輸入提示詞、等待,然後拿到一段完成的片段。片段一旦完成就固定下來,既不能接續,也不能中途修改。
Visko 則把自家模型歸入一個新的類別,稱為「Live Model(即時模型)」。依照公司的說法,這類模型不是「渲染」畫面,而是「運行」畫面。Orbis 生成第一格後立即串流輸出,下一格則根據先前的所有內容生成,如此無限反覆。創辦人兼執行長 Qing(Will)Yin 將這個機制比喻為大型語言模型逐一預測下一個詞的過程。
拜這種設計所賜,在生成過程中更換提示詞時,影片不會暫停或從頭重來,世界的內容會就地改變。支援的用途有三種:文字生成影片、圖片生成影片,以及既有影片的接續生成,並支援多語言提示詞。
賣點是「小時等級也不會崩壞」
即時生成類模型長期以來最大的難題,就是運行得越久,畫面越容易崩壞。Yin 也表示,先前所有即時系統都撞上同一道牆——世界運行得越久就越支離破碎,而 Orbis 正是為了跨越這道牆而打造。
根據公司的技術報告,Orbis 在維持 4K、24fps 即時生成的同時,即使進行小時等級的生成,也不會出現明顯的畫質下降或色彩偏移。關鍵在於兩個部分:一是跨段落保留主體、場景與畫風的多尺度記憶;二是在推論過程中為多個「下一步發展」候選評分、引導輸出朝物理上合理的運動前進的潛在世界模型。透過以這個世界模型為物體的動作提供依據,目標不只是畫面看起來連貫,而是動作本身也自然。
在評測方面,公司表示,在衡量畫面美學品質與技術品質的 DOVER,以及衡量畫面與動作品質的 VideoAlign 上,Orbis 都超越了參與比較的即時類與長影片類系統。在針對 8 個系統進行的長影片人工評測中,Orbis 在整體偏好與時間穩定性兩個項目獲得最高評價。另一方面,報告也揭露了 Orbis 落後於其他系統的項目,評測方法與結果全數公開。這份技術報告已於 7 月 29 日發表在 arXiv 上。
前 Apple 研究員帶領的 16 人團隊
Visko 成立於 2025 年,總部位於加州森尼韋爾。創辦人 Yin 在史丹佛大學取得計算數學與力學博士學位,曾在蘋果擔任研究員 3 年。團隊共 16 人,成員來自蘋果、Google DeepMind、Meta、Amazon 與 Tesla。
顧問陣容同樣引人注目。顧問委員會主席是加州大學柏克萊分校的 Michael I. Jordan,他是公認的機器學習領域重量級研究者。此外還有哥倫比亞大學的 Steve WaiChing Sun 與紐約大學的 Mengye Ren。Jordan 評論指出,Orbis 相較於傳統的短片段影片生成擁有實質意義的技術領先,同樣的核心能力可望帶來廣泛的商業機會,涵蓋機器人、物理模擬、遊戲、直播電商、教育以及即時創意媒體。發行則由合作夥伴 Reactor 負責。
目標是機器人的訓練資料
Visko 最重視的首個用途不是娛樂,而是機器人。Yin 指出,那些危險或成本高昂、難以實際拍攝的情境,可以生成為模擬與訓練資料。他也表示,Orbis 可用來建構極少發生的狀況(corner case)的測試環境,以驗證自駕車與人形機器人的安全性。
同時,公司也坦率說明了尚未到位的部分。研究方面,課題包括進一步改良記憶結構以提高整段生成的一致性,以及在訓練資料中加入「將手臂抬高 45 度」這類細緻的動作描述。工程方面,接下來要擴大模型與資料的規模;目前以音訊與影片資料為主,也在探索納入觸覺等感測器資料的可能性。Yin 認為,通用型機器人走進家庭和自動駕駛一樣需要時間,公司會在這段路上尋找商業化的機會。
總結
Visko 的「Orbis」以「Live Model」之姿正式向大眾開放,能即時持續生成 4K、24fps 的畫面,中途更換提示詞也不會中斷。最大的賣點是在小時等級的生成中畫質與色彩也不易崩壞,在人工評測中宣稱於 8 個系統裡整體評價與時間穩定性皆居首位。由前 Apple 研究員帶領的 16 人團隊募得 1,000 萬美元,他們挑戰的與其說是影片內容的生成,不如說是可用於機器人與自動駕駛訓練的「持續運行的世界」。
