按下按鈕之後會發生什麼事?在此之前,這個答案必須事先用程式碼寫好。Runway 在 2026 年 8 月 31 日發表的 Solaris 直接省去了這道工序,使用者每操作一次,它就逐格生成一次畫面。這是該公司稱為「介面世界模型」的新系列中的第一個模型。
不是「畫」出畫面,而是持續「生成」畫面
在現行的軟體開發流程裡,設計師做出的視覺稿要先翻譯成程式碼這個中間表示。正因為有這道翻譯工序,介面只能回應事先設想過的操作,精細的設計也會因實作上的取捨而被削減。
Solaris 沒有中間表示。點擊、拖曳以及輸入的指令會直接成為下一格畫面的條件,像生成影片那樣生成介面。Runway 舉的例子是一家虛擬服飾店:從衣架上拿起衣服,拖到自己的照片上就是試穿,也可以重新排列陳列。這不是在頁面之間跳轉,而更接近伸手觸碰眼前的環境。
該公司把 Solaris 的性質整理成 3 點:一切都以視覺資訊的形式完成,畫面底下沒有另一層實作;由於持續生成,光線與反射一直在變化,處於「活著」的狀態;以及能夠回應開發者未曾設想的操作,是一種開放式的設計。
把影片模型改造成即時引擎
技術基礎是 Runway 的影片生成模型 Gen-4.5。Solaris 延續該公司先前發表的通用世界模型 GWM-1 的路線,並將它改造成足以承受互動的速度。
改造分成 3 個階段。首先切換成自迴歸生成,每一格畫面只參考先前的內容。接著把通常要重複數十次的去雜訊流程蒸餾到只剩幾步。最後再用高速版本自身的輸出繼續訓練,讓長時間生成時畫質不會崩壞。一般認為操作回應超過 0.5 秒,人就會失去互動感,而每段片段需要數秒到數分鐘的傳統影片擴散模型無法達到這個標準。
分工方式也很有特色。決定「應該發生什麼」的是語言模型,負責「如何呈現」的是世界模型。語言模型解讀使用者的要求,判斷該就地修改場景還是切換到新場景,並產生用於算圖的提示詞。推理與算圖被拆分開來。
Runway 也把這個想法稱為「重新定義滑鼠」。由於操作的意義是以自然語言描述,因此可以隨場景改變。點擊一隻貓,牠的毛色與質感就會轉移到你接下來碰到的東西上;點擊一幅畫,就能以那種畫風開始作畫。
在 250 人的評測中勝過程式碼實作
Runway 提出了 2 項驗證。
第一項衡量翻譯造成的資訊流失。研究者讓最新的多模態語言模型僅憑一張螢幕截圖重建 30 種介面,再以 SSIM 與 DINOv3 特徵比較重建結果與原圖的一致程度,受測模型包含 Claude Fable 5。結果顯示所有模型都會流失資訊,其中自然影像的流失最為明顯,因為無法化為語言的視覺密度會被丟掉。
第二項是 Solaris 與程式碼實作的直接比較。研究者把相同的影像與相同的操作要求分別交給 Solaris 與最新的語言模型(Claude Opus 5),由 250 名參與者針對 30 種操作範例做出約 7,500 組兩兩判定。在對指令的忠實度上,Solaris 為 61%,程式碼實作為 24%,13% 判為相當。在場景中行為的自然度上,Solaris 為 71%,程式碼實作為 21%,6% 判為相當。
差距較大的是後者。程式碼雖然能重現被要求的變更,卻把它當成畫面上孤立的一次更新來處理。而已經學過物體、材質與環境行為方式的模型,可以生成與周遭邏輯相符的反應,這是 Runway 的主張。
留下的課題並不小
目前公開的弱點也相當具體。
最大的難關是文字。穩定生成可讀的文字在影片生成中原本就困難,而介面對文字的依賴程度又特別高。Runway 認為現實的折衷方案是:在允許短暫停頓的場合由影像模型繪製文字較多的畫面,連續操作則交給影片模型處理。
可信度同樣是課題。在教學或商業交易的場合,看似合理的錯誤比不回答更有害。目前的做法是用真實的商品影像與參考素材組成第一格畫面,把生成錨定在現實上;但如何在生成過程中持續提供經過驗證的資訊作為條件,仍在研究途中。長時間操作下維持一致性,以及與螢幕閱讀器等輔助技術的銜接,也都尚未解決。
Solaris 既不是已經普遍提供的應用程式,也不是 API,更沒有公開權重。Runway 正與合作夥伴一起推動公開發表,目前處於透過申請表單取得早期存取權的階段。
總結
Solaris 是一場拆掉「畫面必須先翻譯成程式碼」這個前提的實驗。它在指令忠實度與行為自然度上都勝過程式碼實作,但文字可讀性、長時間一致性這些直接關係到實用性的部分仍未著手。在談論「應用程式」這個單位逐漸消融的未來之前,該先看的是這輪早期存取會產出什麼。
