按下按钮之后会发生什么?在此之前,这个答案必须提前用代码写好。Runway 于 2026 年 8 月 31 日发布的 Solaris 直接省去了这道工序,用户每操作一次,它就逐帧生成一次画面。这是该公司称为「界面世界模型」的新系列中的第一个模型。
不是「画」出画面,而是持续「生成」画面
在当前的软件开发流程中,设计师做出的视觉稿要先翻译成代码这一中间表示。正因为有这道翻译工序,界面只能响应事先设想过的操作,精细的设计也会因实现上的取舍被削减。
Solaris 没有中间表示。点击、拖拽以及输入的指令会直接作为下一帧的条件,像生成视频那样生成画面。Runway 举的例子是一家虚拟服装店:从衣架上拿起衣服,拖到自己的照片上就是试穿,也可以重新调整陈列。这不是在页面之间跳转,而更接近伸手触碰眼前的环境。
该公司把 Solaris 的特性归纳为 3 点:一切都以视觉信息的形式完成,画面下方没有另一层实现;由于持续生成,光照与反射一直在变化,处于「活着」的状态;以及能够响应开发者未曾设想的操作,是一种开放式的设计。
把视频模型改造成实时引擎
技术底座是 Runway 的视频生成模型 Gen-4.5。Solaris 沿着该公司此前发布的通用世界模型 GWM-1 的路线,把它改造成能够承受交互的速度。
改造分为 3 个阶段。首先切换为自回归生成,每一帧只参考此前的内容。接着把通常要重复数十次的去噪过程蒸馏到只剩几步。最后用高速版自身的输出继续训练,使长时间生成时画质不会崩坏。一般认为操作响应超过 0.5 秒,人就会失去交互感,而每段片段需要数秒到数分钟的传统视频扩散模型无法满足这个要求。
分工方式也很有特点。决定「应该发生什么」的是语言模型,负责「如何呈现」的是世界模型。语言模型解读用户请求,判断是就地修改场景还是切换到新场景,并生成用于绘制的提示词。推理与绘制被拆分开来。
Runway 把这个思路称为「重新定义鼠标」。由于操作的含义用自然语言描述,因此可以随场景改变。点击一只猫,它的毛色与质感就会转移到你接下来触碰的东西上;点击一幅画,就能以那种画风开始作画。
250 人的评测中胜过代码实现
Runway 给出了 2 项验证。
第一项衡量翻译造成的信息损失。研究者让最新的多模态语言模型仅凭一张截图重建 30 种界面,再用 SSIM 与 DINOv3 特征比较重建结果与原图的一致度,参与测试的模型包括 Claude Fable 5。结果显示所有模型都会丢失信息,其中自然图像的损失最大,因为无法落入语言的视觉密度会被丢掉。
第二项是 Solaris 与代码实现的直接对比。研究者把相同的图像和相同的操作要求分别交给 Solaris 和最新的语言模型(Claude Opus 5),由 250 名参与者针对 30 种操作示例做出约 7,500 组两两判定。在对指令的忠实度上,Solaris 为 61%,代码实现为 24%,13% 判为相当。在场景内行为的自然度上,Solaris 为 71%,代码实现为 21%,6% 判为相当。
差距更大的是后者。代码虽然能复现被要求的改动,却把它当作画面上孤立的一次更新来处理。而已经学习过物体、材质与环境行为方式的模型,可以生成与周围逻辑自洽的反应,这是 Runway 的主张。
留下的课题并不小
目前公开的短板也很具体。
最大的难关是文字。稳定生成可读的文字在视频生成中本就困难,而界面对文字的依赖程度又格外高。Runway 认为现实的折中方案是:在允许短暂停顿的场合由图像模型绘制文字较多的画面,连续操作则交给视频模型。
可靠性同样是课题。在讲解或商业交易的场合,看似合理的错误比不回答危害更大。目前的做法是用真实的商品图像和参考素材组成第一帧,把生成锚定在现实上;但如何在生成过程中持续提供经过验证的信息作为条件,仍处在研究阶段。长时间操作下保持一致性,以及与屏幕阅读器等辅助技术的对接,也都尚未解决。
Solaris 既不是已经普遍提供的应用,也不是 API,更没有公开权重。Runway 正在与合作伙伴一起推进面向公众的发布,目前处于通过申请表单获取早期访问权限的阶段。
总结
Solaris 是一次拆掉「画面必须先翻译成代码」这一前提的实验。它在指令忠实度和行为自然度上都胜过代码实现,但文字可读性、长时间一致性这些直接关系到实用性的部分仍未着手。在谈论「应用」这个单位消融的未来之前,先要看的是这轮早期访问会产出什么。
