
Odyssey-3 预览:Odyssey 的世界模型从观察世界转向在其中行动
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Odyssey-3 是 Odyssey 最新的基础世界模型,由该公司于 2026 年 9 月 15 日发布预览,并在其自己的公告中将其描述为一款旨在赋能“机器人、驾驶汽车、训练 AI、驾驶无人机,甚至玩电子游戏”的模型。值得仔细阅读这次预览的原因,不在于它所列举的各种本体——而在于其机制。Odyssey-3 是一种自回归扩散 Transformer,经过训练可根据视觉观察模拟多样化的场景,而该公司为其附加了一个学习到的 动作解码器,该组件将模型对场景的内部表示转化为特定硬件所需的运动命令。这就是生成一段看似合理的机械臂片段的模型与被要求移动机械臂的模型之间的区别。Odyssey 将这类由此实现的系统称为“物理智能体”——用该公司的话说,这些模型“会说世界的语言”。如果这种提法听起来接近预览报道中流传的“物理代理”标签,那么这是对同一主张的一种合理解读,尽管它不是 Odyssey 自己的说法,而且在现阶段,它描述的是意图而非经过测量的结果。
Odyssey 实际宣布了什么
这篇帖子是预告,而非发布。Odyssey 表示它“很期待在未来几周内公开发布它”,但没有给出日期、价格或访问渠道。公告中没有链接到 Odyssey-3 的技术报告——页面指向的唯一一篇论文是 PROWL-1,即该公司的强化学习成果,而唯一的 PDF 是 Starchild-1 的。这一缺失值得直说,因为它决定了下文的一切:本文中的每一项能力声明都来自 Odyssey,且未经复现,而且还没有任何第三方发布过 Odyssey 未提供的 Odyssey-3 数字。
这篇文章真正具体说明的,是架构和一种训练理念。该模型是一个自回归扩散 Transformer。它训练所依据的是对世界的视觉观察,而非特定于任务的标签,Odyssey 认为,这使它习得了对“物理、动力学、因果关系、人类行为”的理解——并且据其所述,相比未以这种方式预训练的系统,其数据需求更低。其底层的押注正是整个世界模型领域都在下的那一个:大规模预测场景的下一状态,会迫使模型内化物理对象实际如何行为,因为一个把物理规律搞错的模型,在长时程推演中会逐渐陷入不连贯,并且无法恢复。

一骨干,六体
公告中最具体的证据,是由同一个基础模型驱动的具身形态正在扩散。Odyssey 报告称:
• 机械臂——仅凭“数十小时的机器人演示”便学会了控制多种机械臂并完成复杂任务,其中包括演示中完全没有出现过的恢复行为,例如在抓取失败后重新调整夹爪的朝向。
• 人形机器人 — 与 Flexion 合作完成的工作,其策略基于数十小时的人形机器人遥操作数据构建并实时运行,Odyssey 声称其在光照变化方面的泛化能力优于所测试的视觉-语言-动作基线。
• 驾驶——一个冻结的主干网络,为闭环驾驶实时生成路径点,仅用“20 小时的模拟驾驶数据”训练而成。
• 无人机——基于数十小时的模拟飞行数据实现室内避障飞行,并在主干网络冻结的情况下进行定性推演。
• 电子游戏——长时间游玩 Grand Theft Auto V,并可迁移至 Red Dead Redemption 2 和 Sleeping Dogs,且无需在这些作品中额外进行任何策略训练。
• AI 训练环境——生成的世界,用作其他智能体的训练场,与 PROWL-1 工作相关。
这些行所呈现的模式才是真正的核心主张:重点不在于 Odyssey-3 在其中任何单一任务上表现卓越,而在于同一组权重,配上一个小的学习型输出适配器,就能覆盖所有任务。一个关于世界如何运动的通用模型,与针对单个机器人的策略是截然不同的资产,而这正是该预览版取得如此地位的原因。
那个数字,以及它不能证明什么
Odyssey 为 Odyssey-3 只发布了一个对比数字:完全在仿真中训练的驾驶策略,在安全驾驶员干预之间行驶的距离约为用真实录像训练的策略的 77%,使用的是同样的 20 小时模拟数据。这是一个仿真到现实的数字,而且确实很有意思——弥合仿真训练与真实数据训练驾驶之间的差距,哪怕只是一部分,也是这个问题的难点所在。它也是这篇文章中唯一的数字。
没有准确性表格,没有成功率,没有跨本体基准,也没有在共享评估中与其他具名世界模型的比较。页面页脚卡片声称 Odyssey-3 推进了“世界模型物理准确性的最先进水平”,但页面上没有任何数字支撑这一点。Odyssey 还提到与 Poke & Wiggle 建立了评估合作,覆盖“不同的本体、视角和控制”——但尚未公布任何结果。这里的一切都是厂商的宣称;在外部第三方重新运行验证之前,77% 这个数字也应被完全视为这样的宣称。
缺失的基准测试表意味着什么
很容易把基准测试的缺席解读为一个危险信号。但更恰当的理解是,这反映的是该领域的现状。世界模型还没有 MMLU 或 GPQA 的对应物——一种共享的、低成本的、被广泛信任的、人人都据此汇报的评估。Odyssey 自己的表述从另一个方向承认了规模问题:文章称前沿世界模型仍“落后语言模型大约两个数量级”。当评估标准本身尚未确定时,一篇以架构和具身形态分布而非记分牌开篇的预览文章,是在诚实地描述前沿,读者应把其中的定性说法视为方向性的,而非定论。Poke & Wiggle 的合作是值得关注的事:一项跨身体、跨视角并公布数字的评估,将成为对这一切的首次独立解读。

“未来几周”才是真正的头条新闻
对于任何需要在本季度做出决策的人来说,公告中最关键的一句就是关于可用性的那句。Odyssey-3 尚未全面可用,没有公布价格,没有 API 文档,也没有明确日期——只有“未来几周”。这使它与你今天就能评估的模型属于不同类别。这也意味着,那些不可避免会拿它来做对比的对比页面,目前只是在把一个已发布产品和一项研究预览做比较;这是一个真实区别,而非技术性细节:预览可以非常出色,却仍然不是你能在周一就放进流水线里的东西。
时机重要还有第二个原因。Odyssey以14.5亿美元估值完成了3.1亿美元的B轮融资,AWS成为其首选云服务提供商——公司拥有算力来推进前沿世界模型,而在公开发布前几个月放出的预览正是展示这项工作的方式。请把这份公告理解为关于发展轨迹的声明,而非关于当前能力的声明。
如果你今天建造这个,该怎么办
Odyssey-3 本身并不是你能调用的东西,OrcaRouter 也不提供它——没有任何路由层提供,因为目前根本无处可路由。现在值得做的,是把这项决策拆成两部分。第一部分是世界模型,对此最诚实的答案就是等待公开发布以及首次独立评估。第二部分是围绕它的一切:把任务转化为策略可消费内容的语言模型、读取场景的视觉模型、为录制好的演示打标签的转写模型。这层外围技术栈属于常规的路由工作,如今已经可以通过 一个 API 调用 200 多个模型,按供应商标价,0% 加价,还提供自动故障转移,在供应商服务降级时自动接管。之所以现在就该路由这一层,而不是拖到以后,是因为当 Odyssey-3 发布时,你仍在运行这一层;而更换一个提示词模型只是一次配置变更,重写一套集成则不是。
也值得以尽可能低的成本让世界模型这一问题保持开放。当像 Odyssey-3 这样的模型真正进入某个路由提供商时,它当天就会以提供商的标价出现,因此尝试它的成本只是一次 API 调用,而不是一份合同。构建周边流水线,使新模型能够直接接入,是对仍在变动的前沿所做的务实准备。
什么会改变这一解读?
三件事能让这个预览成为既定事实。一份已发布的技术报告,包含架构和训练细节,能让外部团队复现一切。首次独立基准测试——最好是Poke & Wiggle的跨本体工作——将用别人测出的数字取代厂商的断言。而有明确日期和定价的公开版本,将使每一次与Odyssey-3的对比,都成为读者能实际运行的两个事物之间的对比。
在那之前,站得住脚的总结是这样的:Odyssey-3 是对一件真正困难之事——一个世界模型、多个身体、控制而非渲染——的可信主张,来自一家资金充足、在该领域有过往成绩的实验室,却几乎没有给出任何数字,也没有可用日期。这就是前沿预览的样子。把能力声明当作方向性的,把架构当作有趣的部分,把发布日期当作唯一会改变你计划的那一行。

