
Odyssey-3 与 FLUX 3 Video:模拟器与渲染器并非同一种工具
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Odyssey-3 和 FLUX 3 Video 之所以会被拿来比较,是因为两者都能生成并不存在的世界的视频,而相似之处大致也就到此为止。FLUX 3 Video 是 Black Forest Labs 的生成模型,自 2026 年 8 月 4 日起普遍可用,可将一段提示词或一张起始帧变成最长二十秒、带原生音频的 1080p SDR MP4,并按输出时长计费。Odyssey-3 是 Odyssey 的基础世界模型,于 2026 年 9 月 15 日预览,尚未公开发布,它模拟场景在动作作用下如何演变,并附带一个学习到的解码器,把这种模拟转化为机械臂、人形机器人、汽车或无人机的运动指令。一个是渲染器:它生成供人观看的观测画面。另一个是模拟器:它生成程序可以据以行动的状态。不过,把两者放在一起正面比较仍然有用——不是为了评出谁胜谁负,而是因为它们所输出的这两样东西,正是当下许多团队试图用同一笔预算去采购的两种不同事物。
区别在于模型输出的内容
区分这两者的最清晰方式,是 World Labs 为世界模型发布的一套分类法,它按照系统输出的是感知—行动回路中的哪一部分来对系统进行分类。渲染器输出观测——也就是像素,面向人类眼睛,以视觉保真度为评判标准。模拟器输出状态——一种对世界的表征,其几何与物理保真度足以让人类和程序都能在其上进行计算。规划器输出动作。FLUX 3 Video 完全属于渲染器,而且是非常出色的一种。Odyssey-3 瞄准的是模拟器这一列,但有一只脚踩在规划器这一列,因为动作解码器正是让模拟能够驱动硬件的东西。
这不是营销上的区别,它有一个实际测试。用视频模型渲染一个房间,把你的视角移出房间,再转过身:家具可能不在你离开时的位置,因为该模型逐帧预测,从未维持一个持久的世界。向模拟器提出同样的问题,答案理应是稳定的,因为模型的关键在于帧之下的状态。Odyssey 自己的公告也倚重这一点——构建动力学模型而非视频生成器的原因在于,在其中训练的策略可以被评估和改进,而不仅仅是被观看。

FLUX 3 Video,具体来说
Black Forest Labs 于 2026 年 8 月 4 日发布了 FLUX 3 Video,其规格表瞄准的是生产级输出,而非模拟。它单次生成最长可达二十秒、最高 1080p、SDR、MP4 格式,并随画面同步生成原生音频。定价按生成视频的每秒计算:草稿 720p 档为每秒 $0.06,标准 720p 档为 $0.17,1080p 为 $0.29,而视频到视频的工作定价高于上述各档。这些均为厂商数据。
Black Forest Labs 为其附上的唯一一个基准数字,是文生视频方面 1,135 的内部 Elo 分数,这是一项由厂商自行开展的评测,尚未被独立复现——FLUX 3 Video 目前并未出现在独立的视频排行榜上。请把这个排名当作一种宣称。毋庸置疑的是其交付能力:一个已定价、有文档、按秒计费的 API,今天就能返回文件。
具体来说是 Odyssey-3
Odyssey-3 是一个只有架构、没有价格的预览版。它是一个基于视觉观测训练的自回归扩散 Transformer,其显著特征是动作解码器——用 Odyssey 的话说,是"附加在世界模型上的一个习得输出组件",它基于观测-动作对训练,把模型的内部表征转换为特定硬件所需的动作。Odyssey 报告称,它用数十小时的演示数据驱动机器臂,用 Flexion 构建的人形机器人策略可实时运行,基于 20 小时模拟数据实现闭环驾驶,完成室内避障无人机飞行,并在 Grand Theft Auto V 中长时间游玩,还能迁移到 Red Dead Redemption 2 和 Sleeping Dogs,而无需在这些游戏中额外训练策略。该公司还报告了一项对比数据:在模拟数据上训练的驾驶策略,在两次安全员介入之间行驶的距离约为用真实录像训练的策略的 77%。目前没有独立基准测试,没有 Odyssey-3 的技术报告,除"未来几周"外也没有发布日期的说法。所有数字都出自 Odyssey 自己。
逐维度对比
• 输出内容 — FLUX 3 Video:一个由像素构成的 MP4 文件。Odyssey-3:一个模拟的世界状态,外加通过动作解码器输出的运动动作。
• 使用者是谁 —— FLUX 3 Video:观看视频的人,或完成剪辑的剪辑师。Odyssey-3:机器人控制器、驾驶策略,或正在训练的 RL 智能体。
• 最大输出 — FLUX 3 Video:单次生成最长 20 秒,最高支持 1080p SDR,原生音频。Odyssey-3:只要仿真持续运行,即可连续推演,帧率视部署需求而定。
• 价格 — FLUX 3 Video:720p 草稿 $0.06/秒,720p $0.17/秒,1080p $0.29/秒(供应商)。Odyssey-3:未公布。
• 可用性 — FLUX 3 Video:自 2026-08-04 起正式可用(GA)。Odyssey-3:预览阶段,官方称“将在未来几周内”推出。
• 基准测试——FLUX 3 Video:厂商 Elo 1,135 T2V,未经复现,未见于独立榜单。Odyssey-3:没有基准测试表格,只有一项厂商的 sim-to-real 数值。
价格不对称才是最诚实的标题
这两者中,一个标了价,另一个没有,而仅凭这一事实,你能得到的关于如何在它们之间做选择的信息,就比任何能力宣称都更多。FLUX 3 Video 按输出每秒计费,因此团队在生成第一段之前就能算出一百段视频的成本。Odyssey-3 没有公布价格,没有 API,也没有上线日期,所以使用它的成本目前无从得知——账单长什么样同样无从得知。Odyssey 所描述的那一类世界模型,计费方式通常与视频生成截然不同:不是按漂亮画面的秒数,而是按仿真的小时数,因为其使用者是一个可能运行数百万步的训练循环。拿每秒 0.29 美元去和空无一物相比,根本算不上比较,而任何把它当作比较来呈现的页面,都是在用猜测填补空白。
他们实际会相遇的地方
两者并非彼此替代,更有趣的问题是它们能否组合。对于任何交付物是人类观看的文件的任务——产品镜头、广告变体、社交媒体剪辑版、预可视化——FLUX 3 Video 都是更好的工具。Odyssey-3 如果真能兑现,那么对于任何交付物是必须在物理世界中奏效的策略、或程序必须对其推理的场景的任务,它都是更好的工具。在电影或游戏制作流程中,合理的安排并非二选一——世界模型生成交互式环境,渲染器产出最终离开制作室的精修画面。
如今,那种合成确实存在一个实际限制,那就是 SDR 限制。FLUX 3 Video 输出的是 SDR MP4。Odyssey-3 输出的是模拟环境,而不是经过调色的文件。二者都不是 HDR 后期精修工具,因此,对于最终要交付广播或影院版本的工作流来说,在二者之后仍然需要一个母版制作步骤。
路由,以及它在此处涵盖和不涵盖的内容
目前这两款模型都无法通过 OrcaRouter 进行路由。FLUX 3 Video 由 Black Forest Labs 自家的 API 以及若干第三方平台提供;Odyssey-3 则无人可提供,因为它尚未发布。在这类流水线中,路由层真正能站稳脚跟的位置,是在视频模型之上的那一层——起草分镜脚本的语言模型、对照创意简报检查生成画面的视觉模型、把录制好的旁白转成字幕的转录模型。这些都是再普通不过的路由工作负载,而它们依托于一个 API 覆盖 200 多个模型,按供应商标价、0% 加价,因此供应商一旦降价,当天就能反映到你的账单上,而不必等到下一次合同续签。对于多阶段流水线来说,真正关键的是路由 DSL:把多个模型组合进单次调用,并支持自动故障转移——在某个供应商服务劣化时依然能从容应对,这样渲染步骤就不会因为提示词模型的端点那天状态不佳而失败。以上这些都不托管 FLUX 3 Video 或 Odyssey-3,本文也从未如此宣称。

哪一个,给谁
如果你的交付物是一个文件——一段剪辑、一个精简版本、一次预可视化——那么 FLUX 3 Video 就是今天就能买到的那一个,它有公开的按秒计价,具备原生音频和二十秒单次生成输出,而厂商的 Elo 说法更像是一个合理的额外加分项,而不是选择它的理由。如果你的交付物是一个必须在硬件上工作的控制器,那么 Odyssey-3 才是针对你这个问题的产品,而诚实的建议是再等等:目前还没有价格、没有日期,也没有独立的数字,而 77% 的 sim-to-real 数据是 Odyssey 自己给出的,且尚未被复现。
值得关注的不是哪个模型会胜出,因为它们并不是在比赛。关键在于,一旦外部团队能够运行它,Odyssey-3 的动作解码器能否泛化到公告中列出的六种具身形态。这是如果成立、上行空间最大的说法,而目前支持它的证据是一系列演示,而不是一次测量。

