Runway Solaris 的主视觉卡片,以模型名称和“界面即视频,其下没有任何代码”这句话为标题,位于由五个视频帧组成的条带上方;每个视频帧各包含一个抽象界面元素,这些帧由一条标注为“每次交互都会决定下一帧”的箭头连接,底部为“研究预览版——无公开 API,无公布价格”。
Engineering & Research

Runway Solaris:用视频取代代码的界面世界模型

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Runway SolarisGWM Worlds 2是 Runway 在 2026 年 9 月初发布的两款模型,它们共同押注于一个具体的判断:视频模型接下来真正有用的本事,不是渲染出一段供你观看的短片,而是承载一个你能在其中行动的世界。Solaris 于 8 月 31 日发布,逐帧生成软件界面——一次点击或一次拖拽会成为下一帧的条件,而画面就是应用程序本身,其下没有 HTML、CSS、JavaScript 或 DOM。GWM Worlds 2 于 9 月 3 日发布,把同样的戏法用在环境上:以每秒 24 帧的持续 720p 画面搭配 48 kHz 音频,而且会话不必结束。9 月 10 日,Runway 发布了两者背后的研究,那篇帖子比发布时的报道更有价值,因为它解释了一个扩散视频模型如何快到足以让人感觉是实时的。它没有解释的,是如何获得访问权限。这两款模型都没有公开的 API、没有公布价格,也没有可下载的权重。

Solaris 和 GWM Worlds 2 在 Runway 产品线中的定位

这两个模型同出一源。Runway 的 Gen-4.5 视频模型是基础产物;2025 年 12 月宣布的 GWM-1 通用世界模型计划提供了“世界模型”这一框架;2026 年早些时候的 Runway Characters 则首次公开了这一理念:你可以向视频模型发出提示,并得到会回应而非仅仅播放的东西。

Solaris 将这一谱系带向更狭窄、更陌生的地方。Runway 称其为首个 界面世界模型,而其主张并非它生成一幅 UI 的图像,而是生成物 就是 UI 本身。语言模型决定当你交互时应该改变什么;世界模型渲染其后果。Runway 的发布文章将传统应用开发描述为“有损压缩”——设计师的意图被压缩成代码,再由浏览器解压,而你能做的一切都被限制在开发者预先编程的范围内。

GWM Worlds 2 是范围更广的姊妹产品。它生成的是交互式环境,而非界面;其控制界面是 Runway 称为 WorldPrompt 的一种格式:一个持久的“创世”提示词,用于固定环境、布局、材质、光照、氛围、主体、物理规则和相机视角,再加一帧首帧来锚定外观;随后是一条带时间戳的事件流,由面向某个主体或场景的自由文本动作组成,并带有开始和结束时间,因此动作可以重叠。

Solaris — 界面世界模型,基于 Gen-4.5 构建,是 Runway 界面世界模型系列中的首个,于 2026 年 8 月 31 日发布

GWM Worlds 2 — 第二个通用世界模型,720p、24 fps,48 kHz 音频(含带同步唇动效果的生成语音),于 2026 年 9 月 3 日发布

会话——为 GWM Worlds 2 提供开放式会话,而非固定时长片段;为 Solaris 提供 720p 会话

访问——Solaris:抢先体验申请表。GWM Worlds 2:联系表单。两者均未公布定价,也没有公开端点

标称延迟 — Solaris 被描述为以交互速度运行,每帧低于 500 毫秒

独立基准测试——没有。迄今为止发布的所有内容均来自 Runway

Single-model scoreboard for Runway Solaris with six rows reading Base model Gen-4.5 video model, Output 720p and under 500 ms per frame (stated), Access Early-access request form, Price Not published, Independent benchmarks None as of 11 Sept 2026, and Text rendering Not solved, with a footer noting all figures are stated by Runway and that no independent benchmarks or latency numbers have been published.

换来半秒的三阶段转换

9月10日的研究文章《迈向即时视频生成》是Runway首次较为详细地描述其机制,而其形态在扩散蒸馏文献中并不陌生,尽管应用场景并非如此。起点是一个标准的双向视频模型——Gen-4.5——其中每个生成步骤都以初始首帧和一段文本描述为条件,并且先前生成的潜变量会保留在上下文中。该模型准确但缓慢:流匹配希望每帧进行多次去噪步骤,而一个必须等待才能得到的帧算不上界面。

转换分三步完成。首先,架构被改造为时间上因果的、逐帧自回归生成器——每一帧只依赖于它之前的内容,这正是流式生成得以可能的前提。其次,分布匹配蒸馏把众多去噪步骤压缩到几步,速度正来源于此。这一过程分两个阶段进行,而 Runway 异常清晰地解释了为何两者都必不可少。离策略阶段让学生模型基于真实上下文预测下一状态,同时由冻结的双向教师模型示范优质生成,并由一个 critic 将学生模型推向教师模型的分布——成本低廉,因为无需展开推演,但仅靠它并不足够,因为在视频中,早期的错误会成为下一帧的上下文,并迅速将模型推离分布之外。因此,在策略阶段会在训练期间进行展开推演,使每个生成的潜在表示成为下一帧的上下文,与推理时的情形完全一致。Runway 表示,大部分真正的收益来自这一阶段,并且逐步增加序列长度的课程式训练优于一开始就在长序列上训练。

第三,该模型会在自身输出上进行训练,以避免长时间会话中出现视觉漂移。正是这三个阶段加在一起,才让 Runway 能够用上“交互式”这个词;它们中的任何一个都没有附带延迟数字、帧率或吞吐量数据。文中给出的最具体说法也只是“延迟表现良好”。文中确实提到的是,瓶颈会从训练转移到推理,因为每一帧都必须足够快地离开模型,才能在共享硬件上播放——而在给定质量下,每个输出的这一成本,才决定了哪些用例究竟可行。

Screenshot of Runway's research post "Towards Instant Video Generation", dated September 10, 2026, showing the opening paragraph that names Solaris and GWM Worlds 2 and a timeline diagram contrasting traditional staged video models with autoregressive causal diffusion.

61比24的研究,请仔细阅读

从 Solaris 发布消息中传播最远的数字是一个偏好评分,因此值得精确说明它衡量了什么。Runway 开展了一项研究,共有 250 名参与者,围绕 30 个交互示例做出了约 7,500 次成对判断。参与者更偏好 Solaris,而非一个编码界面,该界面是由Claude Opus 5生成的,在遵循交互指令方面有 61% 的情况下如此,而选择编码版本的比例为 24%;在行为自然度方面,这一比例为 71 比 21。

这个数字并不代表三件事。它不是一项独立结果——Runway 设计、运行并报告了它,没有任何第三方复现过。它也不是衡量界面是否奏效的标准:指令遵循度和行为自然度评判的是它看起来和感觉如何,而不是任务是否被正确完成。它也不是与 Claude Opus 5 本身进行的比较,因为后者是一个语言模型;它是与由语言模型编写成代码的界面进行的比较。这一区分用一句话概括了整场赌注——其主张并非 Solaris 比大语言模型更聪明,而是跳过代码层能产生更自然的结果。

模型仍然无法做到的事

Runway 对这些差距的坦诚程度,远超通常的发布文章,而这些差距是结构性的,而非表面性的。

文本渲染——对于基于视频生成技术构建的模型来说,清晰、稳定的文字本身就极难实现,而界面恰恰由文字构成。Runway 提出了一种混合方案:在交互暂停期间,让传统图像模型来渲染文字密集的视图

无障碍——生成的界面没有 DOM,因此屏幕阅读器和无障碍 API 没有任何可依附的对象。这不是一个需要提报的 bug;这是该方法本身固有的性质

长时间会话——在持续的开放式交互中,连贯性会下降,而这正是界面所处的典型运行状态

信任与依据——自信却错误的渲染比没有渲染更糟糕,而 Solaris 依赖于其起始帧锚定在经验证的参考素材中

分辨率 — 对于视频片段而言,720p 已相当宽裕;而对于数据密集的桌面软件来说则显得局促

对于 GWM Worlds 2 来说,公认的局限则另有一套:快速旋转相机会降低细节、纹理和几何体的质量;长期记忆不完整,因此你离开后又重新进入的房间可能不会保留相同的物体;图像参考止步于第一帧或预填充片段;而有状态对话通常需要外部测试框架才能跟踪任何内容。

为什么 Runway 认为这是智能体训练基础设施

围绕 Solaris 最有趣的论点根本不在于界面。因为它能生成一个此前从未存在过的界面——而不是检索一个熟悉的布局——所以它可以用来训练那些必须泛化、而非死记硬背的计算机使用智能体。这直击一个真正的弱点:仅在少数几个知名应用布局上训练出来的智能体,一旦布局发生变化,往往就会变得很脆弱。GWM Worlds 2 为具身工作提出了同样的主张,并提供了一个明确的智能体控制模式,让 AI 智能体在该世界内规划并执行任务。

Screenshot of Runway's research page "Introducing GWM Worlds 2", carrying a Research Preview label, dated September 3, 2026, and describing interactive worlds generated in real time at continuous 720p and 24 fps with audio at 48,000 Hz.

这是一个好论点,但也是一个不完整的论点。一个无法可靠地记住它打开的那盏灯仍然亮着的环境,不适合用来训练任何依赖状态的东西,而这是智能体所做的大部分事情。Runway 在其自身的局限性部分也这么说了。诚实的解读是,这是一个有前景的方向,但正对面就摆着一个状态追踪问题。

你今天实际可以调用什么

Solaris 是一个研究预览版。访问需通过面向合作伙伴的早期访问申请表单,且 Runway 尚未公布公开发布日期。Runway 自己的 API 参考文档中没有 Solaris 端点,也没有定价,也没有已发布的权重。GWM Worlds 2 目前需通过联系表单才能访问,Runway 正在与选定的合作伙伴一起对其进行验证。如果你正等着基于其中任何一个来构建,那就只能继续等。

这一点对你如何解读其余报道很重要,因为其中很大一部分是以已发布产品的现在时态来描述 Solaris。它目前还不是这样的产品,而 Runway 也没有声称它是。

这些都不是 OrcaRouter 能帮你调用的东西。我们的目录是文本模型和多模态模型——截至本文撰写时有 195 个,其中没有任何世界模型形态的东西。我们真正负责路由的是技术栈的另一半。如果这里有趣的未来是由智能体驱动生成式界面,那么总还是得有模型来决策做什么,而这一侧今天已经可用:一个密钥即可访问包含 200 多个模型的目录,并享有对供应商标价 0% 加价、提供商服务降级时的自动故障转移、可将多个模型组合成一次调用的路由 DSL,以及在你希望由一组模型共同作答而非单个模型时的模型融合。你可以在生产路径上试用新模型,而不必把整条路径押在它身上。

看什么

决定 Solaris 能否成为产品的问题,不在于生成的界面是否看起来惊艳——它们显然惊艳——而在于 Runway 能否公布一个延迟数字并守住它。所有后续环节都取决于此:智能体训练的叙事、单位输出成本的论证,以及视频是界面未来方向这一主张。

有三个信号值得追踪。一个数字——任何数字——只要它挂在“低于500毫秒”这个说法的后面。对那项偏好研究的第二次独立复现。以及一个端点——因为在 Solaris 带着价格出现在 Runway 的 API 参考文档里之前,正确的对待方式是把它看作一个研究方向,只不过附带了一段异常出色的演示样片:这是一种真实存在的身份,但还不是一个工具。