Odyssey-3 的标题卡,副标题为“Odyssey 的交互式世界模型,公开研究预览于 2026 年 10 月 8 日开放”,配有两个指标面板:Odyssey-3 在基础档位下为 832x480、16 fps,在自定义提示词上 Physics-IQ +9.99 个百分点、排名 03,归一化成本为每段视频 $0.139;以及 Odyssey-3 Pro 在 Pro 档位下为 1280x720,Physics-IQ +11.15 个百分点、排名 02,在视频到视频赛道上为 66.1,归一化成本为每段视频 $0.267。
Guides & Insights

Odyssey-3:Odyssey 的全新世界模型夺得 Physics-IQ 桂冠,并开放公开预览

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Odyssey-3 Pro 在 Physics-IQ Verified 的视频到视频赛道上得分 66.1,而 Odyssey 在 2026 年 10 月 8 日公布了这个数字,与之并列的是对开发者真正重要的东西:Odyssey-3 的公开研究预览版,这是一个自回归扩散 transformer,旨在根据提示生成一个环境,然后在有人穿行其中、移动镜头或触发事件时实时持续预测该环境。Odyssey-3 是模型本身;Odyssey-3 Pro 是它的 720p 档位,以 1280×720 运行,而基础模型为 832×480。两者在同一天上线,进入一个你可以在 experience.odyssey.systems 上自行体验的预览版,API 访问则另有联系渠道。

这种组合正是它不止是一篇基准测试文章的原因。交互式世界模型两年来一直停留在演示品阶段;那些在固定轨迹上生成几帧看似合理动作的模型,与在你猛按控制键后仍能保持预测连贯的模型,并不是同一种造物。Odyssey 声称自己属于后者,而且它让任何人都能检验这一说法。

具体发布了什么

两个检查点,一种架构,没有权重。

• Odyssey-3 —— 480p 档位,输出 832×480,在基准测试框架上为 16 fps,在排行榜的归一化成本列中标示为每个生成视频 $0.139。

• Odyssey-3 Pro —— 720p 档位,1280×720,按相同基准标价为每段视频 0.267 美元。

• 访问 —— 浏览器中的研究预览,支持第一人称导航、第三人称导航和独立摄像机移动。API 访问方式为联系表单,而非自助式密钥。

• 开放性——零。未发布权重,没有许可证,也未公布按 token 计算的价格。同一网站上的 API 条款页面最后更新于 2026-01-22,至今仍然管辖着“Odyssey-2 API 的原型”,这足以说明其商业界面有多新。

该架构在 Odyssey 自己的技术说明中被描述为一个多步视频扩散 Transformer,通过教师强制和因果掩码以自回归方式扩展,并配有一套后训练流程,将分布匹配与对抗蒸馏结合成一个少步蒸馏变体——正是这一部分让实时交互从根本上成为可能。扩散带来保真度;自回归带来一个能在动作序列中存活的模型;蒸馏带来时钟速度。三者都承重,且三者都是厂商对其自身系统的说法,而非独立的说法。

基准,按董事会实际解读的方式来解读

The Physics-IQ Verified leaderboard from Anates Labs and Google DeepMind, headed “Dynamic ranking of video models by how well they understand physical principles”, read 9 October 2026, with separate image-to-video and video-to-video columns. The visible ranking runs FLUX 3 [large] at 01, Odyssey-3 Pro at 02, Odyssey-3 at 03, then Cosmos-class entries at 04 to 06, Seedance 2.5 at 07, Odyssey-3 at 08, MiniMax H3 at 09, Cosmos3 Nano at 10 and MiniMax H3 Max in the low teens.

Physics-IQ Verified 由 Anates Labs 与 DeepMind 共同运营,它是一个确实很难被钻空子的基准测试:它向模型展示真实物理实验的视频——流体力学、光学、固体力学、磁学、热力学——并根据实际发生的情况对续写结果进行评分。它目前对来自 16 个实验室的 41 个模型进行排名。Odyssey-3 Pro 的 66.1 是 Odyssey 所报告的视频到视频赛道上的最高原始分,而同一榜单的净提升列——以百分点衡量相对于赛道平均值的增益——则讲述了一个微妙不同的故事:

• 相对赛道平均值的净提升——FLUX 3 [large] 以 +12.27 个百分点领先;Odyssey-3 Pro 以 +11.15 个百分点位居第二;Odyssey-3 以 +9.99 个百分点位居第三。

• 每个生成视频的成本——Odyssey-3 Pro 为 $0.267,Odyssey-3 为 $0.139,而 FLUX 3 [large] 为 $0.868,Seedance 2.5 为 $2.838。(在排行榜允许的情况下,成本均已按 24 fps 和 1280 宽度输出进行归一化,因此在帧率各不相同的模型之间仍具可比性。)

• 子指标领先 —— Odyssey-3 以 44.70 在时空子指标上位列第一,领先于 42.97 的 Odyssey-3 Pro;FLUX 3 [large] 以 64.36 拿下空间指标、以 53.25 拿下加权空间指标,两款 Odyssey 产品在空间指标上分列第二和第四。

所以,诚实的解读并不是“Odyssey-3 是世界上最好的视频模型”。而是:一个为交互而构建的世界模型,登上了此前一直为电影级生成器所专有的物理合理性榜单前列,而且其归一化成本大约只有 FLUX 3 的三分之一。Odyssey 的另一项说法——Odyssey-3 Pro 在图像转视频赛道上、best-of-8 取得 54.7 分——也来自同一榜单,并且同样适用这一告诫:这些都是自行提交的配置,而该排行榜混合了使用自定义提示词提交的条目与使用基准自带提示词运行的条目。Odyssey 同时出现在两栏中,这异常透明,也意味着它的两行衡量的并不是同一回事。

Single-column scoreboard headed “Odyssey-3 — the scoreboard” with six rows: Access — browser preview plus contact form; Sizes — 832x480, 1280x720 Pro; Independent scoring — none yet; Physics-IQ, custom prompts — +9.99 pp base, +11.15 pp Pro; Physics-IQ, board prompts — +2.15 pp, rank 08; Published price — none. Footer: “Odyssey-3 figures vendor-reported and unreproduced; Physics-IQ Verified board read Oct 9 2026”.

为什么“世界模型”不是“视频模型”的同义词?

这种区别就是整个产品主张,因此值得直白地说清楚。片段生成器接收一个提示词并返回一个固定对象;无论谁提问,输出都一样。Odyssey-3 接收一个提示词,并返回一个你可以置身其中行动的系统——预览的第一人称和第三人称摄像机模式,以及它在生成中途接收事件的能力,正是它用来预测接下来会发生什么的机制:依据的是你刚刚做了什么,而不是提示词说了什么。

正是这一性质,造就了 Odyssey 发布材料中物理系统结果如今呈现的样子。该公司报告称,一个附加到冻结世界模型上的动作解码器,在数十小时的机器人演示数据上训练后,产生了演示中从未出现过的恢复行为——在抓取失败后重新调整夹爪方向、取回以不寻常姿态掉落的物体。它还报告称,Flexion 在 Odyssey-3 之上、利用数十小时遥操作数据构建的人形策略,在灯光变化下仍能继续执行,而这些变化会让与之比较的 VLA 基线失效。它还报告称,一个在 20 小时模拟数据上训练的驾驶策略,能够在真实道路上闭环行驶,在安全驾驶员介入之间行驶的距离约为使用真实影像训练的策略的 77%。它还报告称,从模拟飞行数据中学到的无人机导航,以及在 GTA V 中的游玩,能够将移动迁移到 Red Dead Redemption 2,将摩托车骑行迁移到 Sleeping Dogs,而无需进一步训练。

这些结果每一项都是供应商报告的结果,没有独立复现,而且其中两项被 Odyssey 明确表述为定性观察,而非测量数据。但对这一主张而言,它们正是恰当的证据:有趣之处并不在于模型能完成它被训练过的任务,而在于一个冻结的主干网络加上一个小型适配器,就能从几十小时的数据中产生有意义的行为,并且偶尔还能泛化到这些数据之外。

什么仍然未被证实

Odyssey's own launch post, “Meet Odyssey-3: Our Most Powerful Foundation World Model”, dated October 8 2026 and credited to Oliver Cameron and other authors, with the Odyssey site navigation (About, News, Careers, Contact) and the opening line “Today we're launching Odyssey-3, our most powerful foundation world model yet.”

三件事,而且都不是小事。

首先,没有任何独立评估者运行过 Odyssey-3。Physics-IQ 的条目是一份提交,而 Odyssey 自己文稿中的第二个评分来源——WorldMark,Odyssey-3 在其四个分项中的三个里排名第一——是一项厂商评估,使用的是基准自带的说明文字,用 Odyssey 的话说,是“其 13 项已报告指标得分的均值”。那是公司拿别人的数据集给自己打分。这比大多数发布所提供的信息要多。但它不是第三方。

其次,在那一评估中,Odyssey-3 唯一没有取胜的那个细分项,恰恰是最接近营销宣传的那个。在第一人称真实环境中,它以 80.6 位列第三,落后于 Lyra 2.0 的 84.4 和 AlayaWorld 的 83.0。该模型在同一评估中的优势集中在风格化和第三人称环境中——第一人称风格化 77.2,第三人称真实 79.0,第三人称风格化 76.3。如果你是在为照片级真实的第一人称具身体验做开发,那么你真正该关注的排名,正是 Odyssey-3 没有登顶的那个。

第三,可用性。那句话里的“研究预览”可不是随便说说的。没有定价页面,没有速率限制说明文档,也没有自助获取的密钥。如果你想把它用在产品里,那就只能排队等。

在没有第二个合约的情况下进行比较

像这样的发布有一个实际问题:Odyssey-3 是本周视频生成领域最有趣的东西,而你仍然无法调用它。你实际会拿来与它做基准对比的那些模型,则是另一回事了。

OrcaRouter 并不托管 Odyssey-3,而且即使我们托管了,也没有公开价格可以透传。一个密钥所能触达的是对比集中的其余部分——minimax/minimax-h3 以 768P 生成视频每秒 $0.08、Kling 视频系列,以及 单个端点背后 200 多个模型——按提供商标价、0% 加价,因此供应商调价会在当天反映到你的账单上,而不是等到下次续费。 跨提供商自动故障转移意味着评估扫描不会因为某个上游“下午状态不佳”而中断,而且路由 DSL 让你可以把多个模型放在一个接口后面,这样正面对比只需改配置,而不用再做一次集成。如果 Odyssey 开放自助式 API,那就是你希望将其接入的形态。

什么能了结它

在并非由它自己选择的测试框架上对 Odyssey-3 进行一次独立运行。十多位拥有预览权限的从业者描述:在一分钟激烈的镜头运动之后,环境在哪些地方仍能保持稳定,在哪些地方则不能。一个价格。上述任何一项都能把它从一次强势发布变成基准参照。

已经成立的事实范围更窄,但仍然值得注意:在唯一一个公开榜单上——它衡量的是生成模型是否理解物理,而不是它是否拍得好看——一个以交互为目的的模型正位列第二和第三,其归一化成本低于排名第一的模型。