
Runway Solaris:用视频取代代码的界面世界模型
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 每百万 tokens
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Runway Solaris 和 GWM Worlds 2是 Runway 在 2026 年 9 月初发布的两款模型,它们共同押注于一个具体的判断:视频模型接下来真正有用的本事,不是渲染出一段供你观看的短片,而是承载一个你能在其中行动的世界。Solaris 于 8 月 31 日发布,逐帧生成软件界面——一次点击或一次拖拽会成为下一帧的条件,而画面就是应用程序本身,其下没有 HTML、CSS、JavaScript 或 DOM。GWM Worlds 2 于 9 月 3 日发布,把同样的戏法用在环境上:以每秒 24 帧的持续 720p 画面搭配 48 kHz 音频,而且会话不必结束。9 月 10 日,Runway 发布了两者背后的研究,那篇帖子比发布时的报道更有价值,因为它解释了一个扩散视频模型如何快到足以让人感觉是实时的。它没有解释的,是如何获得访问权限。这两款模型都没有公开的 API、没有公布价格,也没有可下载的权重。
Solaris 和 GWM Worlds 2 在 Runway 产品线中的定位
这两个模型同出一源。Runway 的 Gen-4.5 视频模型是基础产物;2025 年 12 月宣布的 GWM-1 通用世界模型计划提供了“世界模型”这一框架;2026 年早些时候的 Runway Characters 则首次公开了这一理念:你可以向视频模型发出提示,并得到会回应而非仅仅播放的东西。
Solaris 将这一谱系带向更狭窄、更陌生的地方。Runway 称其为首个 界面世界模型,而其主张并非它生成一幅 UI 的图像,而是生成物 就是 UI 本身。语言模型决定当你交互时应该改变什么;世界模型渲染其后果。Runway 的发布文章将传统应用开发描述为“有损压缩”——设计师的意图被压缩成代码,再由浏览器解压,而你能做的一切都被限制在开发者预先编程的范围内。
GWM Worlds 2 是范围更广的姊妹产品。它生成的是交互式环境,而非界面;其控制界面是 Runway 称为 WorldPrompt 的一种格式:一个持久的“创世”提示词,用于固定环境、布局、材质、光照、氛围、主体、物理规则和相机视角,再加一帧首帧来锚定外观;随后是一条带时间戳的事件流,由面向某个主体或场景的自由文本动作组成,并带有开始和结束时间,因此动作可以重叠。
• Solaris — 界面世界模型,基于 Gen-4.5 构建,是 Runway 界面世界模型系列中的首个,于 2026 年 8 月 31 日发布
• GWM Worlds 2 — 第二个通用世界模型,720p、24 fps,48 kHz 音频(含带同步唇动效果的生成语音),于 2026 年 9 月 3 日发布
• 会话——为 GWM Worlds 2 提供开放式会话,而非固定时长片段;为 Solaris 提供 720p 会话
• 访问——Solaris:抢先体验申请表。GWM Worlds 2:联系表单。两者均未公布定价,也没有公开端点
• 标称延迟 — Solaris 被描述为以交互速度运行,每帧低于 500 毫秒
• 独立基准测试——没有。迄今为止发布的所有内容均来自 Runway

换来半秒的三阶段转换
9月10日的研究文章《迈向即时视频生成》是Runway首次较为详细地描述其机制,而其形态在扩散蒸馏文献中并不陌生,尽管应用场景并非如此。起点是一个标准的双向视频模型——Gen-4.5——其中每个生成步骤都以初始首帧和一段文本描述为条件,并且先前生成的潜变量会保留在上下文中。该模型准确但缓慢:流匹配希望每帧进行多次去噪步骤,而一个必须等待才能得到的帧算不上界面。
转换分三步完成。首先,架构被改造为时间上因果的、逐帧自回归生成器——每一帧只依赖于它之前的内容,这正是流式生成得以可能的前提。其次,分布匹配蒸馏把众多去噪步骤压缩到几步,速度正来源于此。这一过程分两个阶段进行,而 Runway 异常清晰地解释了为何两者都必不可少。离策略阶段让学生模型基于真实上下文预测下一状态,同时由冻结的双向教师模型示范优质生成,并由一个 critic 将学生模型推向教师模型的分布——成本低廉,因为无需展开推演,但仅靠它并不足够,因为在视频中,早期的错误会成为下一帧的上下文,并迅速将模型推离分布之外。因此,在策略阶段会在训练期间进行展开推演,使每个生成的潜在表示成为下一帧的上下文,与推理时的情形完全一致。Runway 表示,大部分真正的收益来自这一阶段,并且逐步增加序列长度的课程式训练优于一开始就在长序列上训练。
第三,该模型会在自身输出上进行训练,以避免长时间会话中出现视觉漂移。正是这三个阶段加在一起,才让 Runway 能够用上“交互式”这个词;它们中的任何一个都没有附带延迟数字、帧率或吞吐量数据。文中给出的最具体说法也只是“延迟表现良好”。文中确实提到的是,瓶颈会从训练转移到推理,因为每一帧都必须足够快地离开模型,才能在共享硬件上播放——而在给定质量下,每个输出的这一成本,才决定了哪些用例究竟可行。

61比24的研究,请仔细阅读
从 Solaris 发布消息中传播最远的数字是一个偏好评分,因此值得精确说明它衡量了什么。Runway 开展了一项研究,共有 250 名参与者,围绕 30 个交互示例做出了约 7,500 次成对判断。参与者更偏好 Solaris,而非一个编码界面,该界面是由Claude Opus 5生成的,在遵循交互指令方面有 61% 的情况下如此,而选择编码版本的比例为 24%;在行为自然度方面,这一比例为 71 比 21。
这个数字并不代表三件事。它不是一项独立结果——Runway 设计、运行并报告了它,没有任何第三方复现过。它也不是衡量界面是否奏效的标准:指令遵循度和行为自然度评判的是它看起来和感觉如何,而不是任务是否被正确完成。它也不是与 Claude Opus 5 本身进行的比较,因为后者是一个语言模型;它是与由语言模型编写成代码的界面进行的比较。这一区分用一句话概括了整场赌注——其主张并非 Solaris 比大语言模型更聪明,而是跳过代码层能产生更自然的结果。
模型仍然无法做到的事
Runway 对这些差距的坦诚程度,远超通常的发布文章,而这些差距是结构性的,而非表面性的。
• 文本渲染——对于基于视频生成技术构建的模型来说,清晰、稳定的文字本身就极难实现,而界面恰恰由文字构成。Runway 提出了一种混合方案:在交互暂停期间,让传统图像模型来渲染文字密集的视图
• 无障碍——生成的界面没有 DOM,因此屏幕阅读器和无障碍 API 没有任何可依附的对象。这不是一个需要提报的 bug;这是该方法本身固有的性质
• 长时间会话——在持续的开放式交互中,连贯性会下降,而这正是界面所处的典型运行状态
• 信任与依据——自信却错误的渲染比没有渲染更糟糕,而 Solaris 依赖于其起始帧锚定在经验证的参考素材中
• 分辨率 — 对于视频片段而言,720p 已相当宽裕;而对于数据密集的桌面软件来说则显得局促
对于 GWM Worlds 2 来说,公认的局限则另有一套:快速旋转相机会降低细节、纹理和几何体的质量;长期记忆不完整,因此你离开后又重新进入的房间可能不会保留相同的物体;图像参考止步于第一帧或预填充片段;而有状态对话通常需要外部测试框架才能跟踪任何内容。
为什么 Runway 认为这是智能体训练基础设施
围绕 Solaris 最有趣的论点根本不在于界面。因为它能生成一个此前从未存在过的界面——而不是检索一个熟悉的布局——所以它可以用来训练那些必须泛化、而非死记硬背的计算机使用智能体。这直击一个真正的弱点:仅在少数几个知名应用布局上训练出来的智能体,一旦布局发生变化,往往就会变得很脆弱。GWM Worlds 2 为具身工作提出了同样的主张,并提供了一个明确的智能体控制模式,让 AI 智能体在该世界内规划并执行任务。

这是一个好论点,但也是一个不完整的论点。一个无法可靠地记住它打开的那盏灯仍然亮着的环境,不适合用来训练任何依赖状态的东西,而这是智能体所做的大部分事情。Runway 在其自身的局限性部分也这么说了。诚实的解读是,这是一个有前景的方向,但正对面就摆着一个状态追踪问题。
你今天实际可以调用什么
Solaris 是一个研究预览版。访问需通过面向合作伙伴的早期访问申请表单,且 Runway 尚未公布公开发布日期。Runway 自己的 API 参考文档中没有 Solaris 端点,也没有定价,也没有已发布的权重。GWM Worlds 2 目前需通过联系表单才能访问,Runway 正在与选定的合作伙伴一起对其进行验证。如果你正等着基于其中任何一个来构建,那就只能继续等。
这一点对你如何解读其余报道很重要,因为其中很大一部分是以已发布产品的现在时态来描述 Solaris。它目前还不是这样的产品,而 Runway 也没有声称它是。
这些都不是 OrcaRouter 能帮你调用的东西。我们的目录是文本模型和多模态模型——截至本文撰写时有 195 个,其中没有任何世界模型形态的东西。我们真正负责路由的是技术栈的另一半。如果这里有趣的未来是由智能体驱动生成式界面,那么总还是得有模型来决策做什么,而这一侧今天已经可用:一个密钥即可访问包含 200 多个模型的目录,并享有对供应商标价 0% 加价、提供商服务降级时的自动故障转移、可将多个模型组合成一次调用的路由 DSL,以及在你希望由一组模型共同作答而非单个模型时的模型融合。你可以在生产路径上试用新模型,而不必把整条路径押在它身上。
看什么
决定 Solaris 能否成为产品的问题,不在于生成的界面是否看起来惊艳——它们显然惊艳——而在于 Runway 能否公布一个延迟数字并守住它。所有后续环节都取决于此:智能体训练的叙事、单位输出成本的论证,以及视频是界面未来方向这一主张。
有三个信号值得追踪。一个数字——任何数字——只要它挂在“低于500毫秒”这个说法的后面。对那项偏好研究的第二次独立复现。以及一个端点——因为在 Solaris 带着价格出现在 Runway 的 API 参考文档里之前,正确的对待方式是把它看作一个研究方向,只不过附带了一段异常出色的演示样片:这是一种真实存在的身份,但还不是一个工具。
