一张生成的双卡片信息图,标题为“模拟器 vs 渲染器”。左侧卡片标题为 Odyssey-3,内容为“一个你能在其中行动的世界”,行包括输出(世界状态 + 动作)、使用方(机器人和驾驶策略)以及价格(未公布)。右侧卡片标题为 FLUX 3 Video,内容为“一个你可以观看的文件”,行包括输出(1080p SDR MP4)、使用方(观众和剪辑者)以及价格(每秒 $0.06-$0.29)。
Guides & Insights

Odyssey-3 与 FLUX 3 Video:模拟器与渲染器并非同一种工具

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Odyssey-3 和 FLUX 3 Video 之所以会被拿来比较,是因为两者都能生成并不存在的世界的视频,而相似之处大致也就到此为止。FLUX 3 Video 是 Black Forest Labs 的生成模型,自 2026 年 8 月 4 日起普遍可用,可将一段提示词或一张起始帧变成最长二十秒、带原生音频的 1080p SDR MP4,并按输出时长计费。Odyssey-3 是 Odyssey 的基础世界模型,于 2026 年 9 月 15 日预览,尚未公开发布,它模拟场景在动作作用下如何演变,并附带一个学习到的解码器,把这种模拟转化为机械臂、人形机器人、汽车或无人机的运动指令。一个是渲染器:它生成供人观看的观测画面。另一个是模拟器:它生成程序可以据以行动的状态。不过,把两者放在一起正面比较仍然有用——不是为了评出谁胜谁负,而是因为它们所输出的这两样东西,正是当下许多团队试图用同一笔预算去采购的两种不同事物。

区别在于模型输出的内容

区分这两者的最清晰方式,是 World Labs 为世界模型发布的一套分类法,它按照系统输出的是感知—行动回路中的哪一部分来对系统进行分类。渲染器输出观测——也就是像素,面向人类眼睛,以视觉保真度为评判标准。模拟器输出状态——一种对世界的表征,其几何与物理保真度足以让人类和程序都能在其上进行计算。规划器输出动作。FLUX 3 Video 完全属于渲染器,而且是非常出色的一种。Odyssey-3 瞄准的是模拟器这一列,但有一只脚踩在规划器这一列,因为动作解码器正是让模拟能够驱动硬件的东西。

这不是营销上的区别,它有一个实际测试。用视频模型渲染一个房间,把你的视角移出房间,再转过身:家具可能不在你离开时的位置,因为该模型逐帧预测,从未维持一个持久的世界。向模拟器提出同样的问题,答案理应是稳定的,因为模型的关键在于帧之下的状态。Odyssey 自己的公告也倚重这一点——构建动力学模型而非视频生成器的原因在于,在其中训练的策略可以被评估和改进,而不仅仅是被观看。

A generated two-column scoreboard for Odyssey-3 vs FLUX 3 Video using the same six dimension labels on both sides: output, consumer, max length, audio, price and availability. Odyssey-3 reads world state + actions, robot and driving policies, continuous rollout, none, not published, preview only. FLUX 3 Video reads 1080p SDR MP4, viewers and editors, 20s single pass, native, $0.06-$0.29 per second, GA 2026-08-04. The footer reads "Odyssey-3 vendor-reported and unreleased; FLUX 3 Video specs per Black Forest Labs."

FLUX 3 Video,具体来说

Black Forest Labs 于 2026 年 8 月 4 日发布了 FLUX 3 Video,其规格表瞄准的是生产级输出,而非模拟。它单次生成最长可达二十秒、最高 1080p、SDR、MP4 格式,并随画面同步生成原生音频。定价按生成视频的每秒计算:草稿 720p 档为每秒 $0.06,标准 720p 档为 $0.17,1080p 为 $0.29,而视频到视频的工作定价高于上述各档。这些均为厂商数据。

Black Forest Labs 为其附上的唯一一个基准数字,是文生视频方面 1,135 的内部 Elo 分数,这是一项由厂商自行开展的评测,尚未被独立复现——FLUX 3 Video 目前并未出现在独立的视频排行榜上。请把这个排名当作一种宣称。毋庸置疑的是其交付能力:一个已定价、有文档、按秒计费的 API,今天就能返回文件。

具体来说是 Odyssey-3

Odyssey-3 是一个只有架构、没有价格的预览版。它是一个基于视觉观测训练的自回归扩散 Transformer,其显著特征是动作解码器——用 Odyssey 的话说,是"附加在世界模型上的一个习得输出组件",它基于观测-动作对训练,把模型的内部表征转换为特定硬件所需的动作。Odyssey 报告称,它用数十小时的演示数据驱动机器臂,用 Flexion 构建的人形机器人策略可实时运行,基于 20 小时模拟数据实现闭环驾驶,完成室内避障无人机飞行,并在 Grand Theft Auto V 中长时间游玩,还能迁移到 Red Dead Redemption 2 和 Sleeping Dogs,而无需在这些游戏中额外训练策略。该公司还报告了一项对比数据:在模拟数据上训练的驾驶策略,在两次安全员介入之间行驶的距离约为用真实录像训练的策略的 77%。目前没有独立基准测试,没有 Odyssey-3 的技术报告,除"未来几周"外也没有发布日期的说法。所有数字都出自 Odyssey 自己。

逐维度对比

输出内容 — FLUX 3 Video:一个由像素构成的 MP4 文件。Odyssey-3:一个模拟的世界状态,外加通过动作解码器输出的运动动作。

使用者是谁 —— FLUX 3 Video:观看视频的人,或完成剪辑的剪辑师。Odyssey-3:机器人控制器、驾驶策略,或正在训练的 RL 智能体。

最大输出 — FLUX 3 Video:单次生成最长 20 秒,最高支持 1080p SDR,原生音频。Odyssey-3:只要仿真持续运行,即可连续推演,帧率视部署需求而定。

价格 — FLUX 3 Video:720p 草稿 $0.06/秒,720p $0.17/秒,1080p $0.29/秒(供应商)。Odyssey-3:未公布。

可用性 — FLUX 3 Video:自 2026-08-04 起正式可用(GA)。Odyssey-3:预览阶段,官方称“将在未来几周内”推出。

基准测试——FLUX 3 Video:厂商 Elo 1,135 T2V,未经复现,未见于独立榜单。Odyssey-3:没有基准测试表格,只有一项厂商的 sim-to-real 数值。

价格不对称才是最诚实的标题

这两者中,一个标了价,另一个没有,而仅凭这一事实,你能得到的关于如何在它们之间做选择的信息,就比任何能力宣称都更多。FLUX 3 Video 按输出每秒计费,因此团队在生成第一段之前就能算出一百段视频的成本。Odyssey-3 没有公布价格,没有 API,也没有上线日期,所以使用它的成本目前无从得知——账单长什么样同样无从得知。Odyssey 所描述的那一类世界模型,计费方式通常与视频生成截然不同:不是按漂亮画面的秒数,而是按仿真的小时数,因为其使用者是一个可能运行数百万步的训练循环。拿每秒 0.29 美元去和空无一物相比,根本算不上比较,而任何把它当作比较来呈现的页面,都是在用猜测填补空白。

他们实际会相遇的地方

两者并非彼此替代,更有趣的问题是它们能否组合。对于任何交付物是人类观看的文件的任务——产品镜头、广告变体、社交媒体剪辑版、预可视化——FLUX 3 Video 都是更好的工具。Odyssey-3 如果真能兑现,那么对于任何交付物是必须在物理世界中奏效的策略、或程序必须对其推理的场景的任务,它都是更好的工具。在电影或游戏制作流程中,合理的安排并非二选一——世界模型生成交互式环境,渲染器产出最终离开制作室的精修画面。

如今,那种合成确实存在一个实际限制,那就是 SDR 限制。FLUX 3 Video 输出的是 SDR MP4。Odyssey-3 输出的是模拟环境,而不是经过调色的文件。二者都不是 HDR 后期精修工具,因此,对于最终要交付广播或影院版本的工作流来说,在二者之后仍然需要一个母版制作步骤。

路由,以及它在此处涵盖和不涵盖的内容

目前这两款模型都无法通过 OrcaRouter 进行路由。FLUX 3 Video 由 Black Forest Labs 自家的 API 以及若干第三方平台提供;Odyssey-3 则无人可提供,因为它尚未发布。在这类流水线中,路由层真正能站稳脚跟的位置,是在视频模型之上的那一层——起草分镜脚本的语言模型、对照创意简报检查生成画面的视觉模型、把录制好的旁白转成字幕的转录模型。这些都是再普通不过的路由工作负载,而它们依托于一个 API 覆盖 200 多个模型,按供应商标价、0% 加价,因此供应商一旦降价,当天就能反映到你的账单上,而不必等到下一次合同续签。对于多阶段流水线来说,真正关键的是路由 DSL:把多个模型组合进单次调用,并支持自动故障转移——在某个供应商服务劣化时依然能从容应对,这样渲染步骤就不会因为提示词模型的端点那天状态不佳而失败。以上这些都不托管 FLUX 3 Video 或 Odyssey-3,本文也从未如此宣称。

A screenshot of Odyssey's own announcement page for Odyssey-3, dated September 15th 2026, headed "Introducing Odyssey-3: A General-Purpose Physical Intelligence", with the summary line that Odyssey-3 is a foundation world model that can power robots, drive cars, train AIs, pilot drones, and even play video games.

哪一个,给谁

如果你的交付物是一个文件——一段剪辑、一个精简版本、一次预可视化——那么 FLUX 3 Video 就是今天就能买到的那一个,它有公开的按秒计价,具备原生音频和二十秒单次生成输出,而厂商的 Elo 说法更像是一个合理的额外加分项,而不是选择它的理由。如果你的交付物是一个必须在硬件上工作的控制器,那么 Odyssey-3 才是针对你这个问题的产品,而诚实的建议是再等等:目前还没有价格、没有日期,也没有独立的数字,而 77% 的 sim-to-real 数据是 Odyssey 自己给出的,且尚未被复现。

值得关注的不是哪个模型会胜出,因为它们并不是在比赛。关键在于,一旦外部团队能够运行它,Odyssey-3 的动作解码器能否泛化到公告中列出的六种具身形态。这是如果成立、上行空间最大的说法,而目前支持它的证据是一系列演示,而不是一次测量。

A screenshot of Artificial Analysis's Video Model Comparisons page, showing the Video Arena Quality Elo chart and the representative price-per-minute chart across 15 of 37 video models, including Kling 3.0 at 720p and 1080p, Wan 3.0, MiniMax H3 Max and Gemini Omni Flash.