
Odyssey-3 与 Luma Ray 3.2:一个可进入的世界,还是一份待调色的文件
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Luma Ray 3.2 做了视频生成领域几乎其他任何东西都做不到的一件事:它向你提供符合 ACES2065-1 EXR 标准的 10 位、12 位和 16 位 HDR 帧,而这正是调色师真正想要的格式,也是该模型以当前形态存在的原因。Odyssey-3 则做了任何视频模型都完全做不到的事:它把动作作为输入,预测世界接下来会发生什么,然后将该预测转化为机械臂、人形机器人、汽车或无人机的运动指令。Luma Ray 3.2 由 Luma AI 于 2026 年 6 月 9 日发布,是一款带有开发者 API 的、贴近后期制作的生成工具。Odyssey-3 由 Odyssey 于 2026 年 9 月 15 日预览,是一款尚未发布的基础世界模型,没有价格,也没有发布日期。比较它们与其说是一场对决,不如说是在问:你的流程真正缺的是两种截然不同输出中的哪一种——一帧已调色的画面,还是一个能响应控制的世界。
Ray 3.2 是围绕可交付成果打造的
Ray 3.2 版本的引人注目之处,与其说在于它的生成质量,不如说在于它止步于何处。它可生成 540p、720p 和 1080p 视频,片段时长为 5 秒或 10 秒,支持六种宽高比,涵盖竖屏、方形和宽屏,并接受文本、起始帧、结束帧或现有视频进行修改。HDR 路径是其差异化所在,但也伴随着一些值得精确说明的实际限制:ACES2065-1 EXR 格式的 10 位、12 位和 16 位 HDR 输出仅在 720p 和 1080p 下提供,且仅限 5 秒片段。必须通过启用 HDR 来请求 EXR 导出。标准输出为 MP4。无缝循环适用于 5 秒片段。每个片段最多 16 个关键帧,提供更接近动画制作而非提示输入的镜头级控制,面部表演跟踪最多可覆盖八张人脸。
另外两个事实会影响购买决策。Ray 3.2 是 Ray 系列中首个提供完整开发者 API 的模型——此前的 Ray 模型仅支持订阅制——该 API 分为按使用量付费的 Build 层级和带 SLA 的预留吞吐量 Scale 层级。并且,它不会为文生视频或图生视频生成同步音频;音频只保留在修改与重新取景路径中。Luma 自行进行了一项评估,声称与 Google 的 Veo 3 持平,并领先于若干竞争对手,但这些都是由厂商主导的对比,没有公布数值评分,应被视为定位宣传,而非实际测量。

Odyssey-3 以控制器为核心打造
Odyssey-3 的设计中心位于流水线的另一端。它是一个基于对世界的视觉观察训练的自回归扩散 Transformer,其与众不同之处在于一个学习到的动作解码器——用 Odyssey 的话说,就是“附加到世界模型上的学习输出组件”,它把模型的内部表示转化为给定硬件所需的动作。Odyssey 报告称,同一个主干网络能够根据数十小时的演示控制机械臂,实时驱动用 Flexion 构建的人形机器人策略,从在 20 小时模拟数据上训练的冻结主干网络生成闭环驾驶路点,让无人机在室内绕过障碍物飞行,以及玩 Grand Theft Auto V,并能迁移到 Red Dead Redemption 2 和 Sleeping Dogs,而无需在这些游戏中额外训练策略。
Odyssey 公布的唯一一个对比数字是:在安全员介入之间,经过模拟训练的驾驶策略所行驶的距离约为用真实影像训练的驾驶策略的 77%。没有基准测试表,没有 Odyssey-3 技术报告,没有独立评估,除了“未来几周”之外也没有可用日期。它是一个预览版,而且定价为零,因为它无法购买。
逐维度对比
• 输出内容 — Luma Ray 3.2:MP4,启用 HDR 时还提供 10/12/16 位 ACES2065-1 EXR。Odyssey-3:模拟世界状态加电机动作。
• 格式上限 — Luma Ray 3.2:ACES2065-1 EXR,仅支持 720p 和 1080p 的 5 秒片段。Odyssey-3:不是文件格式;其输出为分阶段推出。
• 分辨率和时长 — Luma Ray 3.2:最高 1080p,5 秒或 10 秒(10 秒仅支持文本生成视频)。Odyssey-3:连续运行,速率视部署需求而定。
• 音频 — Luma Ray 3.2:T2V/I2V 均为无音频;在修改和重新构图时会保留。Odyssey-3:无音频;它并非媒体生成器。
• 价格—— Luma Ray 3.2:每个视频按分辨率、动态范围和时长计费,HDR 和 EXR 导出会使片段成本成倍增加;第三方报价显示,5 秒 720p 片段约为 0.30 美元,1080p 约为 1.20 美元。Odyssey-3:未公布。
• 可用性 — Luma Ray 3.2:已于 2026-06-09 发布,提供 Build 和 Scale API 层级。Odyssey-3:预览版,“将在未来几周内推出。”
交付物与环境对比
这种组合之所以具有启发性而非随意为之,是因为这两个模型最终落脚的地方不同。Ray 3.2 最终输出的是一个会交给调色师、合成师或后期制作公司的文件——EXR 路径的存在,正是为了让生成的图像在经历调色、合成和再次调色后仍能保持完整、不至于崩坏。这是一个工作流程层面的决定,也正因如此,Ray 3.2 更直接地与后期制作工具竞争,而不是与其他生成器竞争。
Odyssey-3 从文件意义上说根本不会终止。它的输出是一种持续运行的模拟状态,而它的消费方是一个程序。检验它是否奏效的标准,不是帧看起来是否正确,而是其中训练出的策略能否迁移到硬件上。这些是由不同的人衡量的不同成功标准,而且无论双方的分辨率有多高,都无法让它们变得可比。
可能衔接的地方在于从预览到最终成片的这条路径。世界模型是交互式探索空间的天然工具——改变一个镜头运动、重新调度一场戏、立刻看到结果,而这恰恰是固定的生成片段做不到的。像 Ray 3.2 这样的模型,则是把选定的结果转化为可交付 HDR 成品的天然工具。如今这条路径中间有一个缺口,因为 Odyssey-3 尚不可用,也不产出任何最终制作流程能够消费的文件格式。
绕过两者
Luma Ray 3.2 和 Odyssey-3 都不由 OrcaRouter 提供服务,本文也并未声称其中任何一个由我们提供。真正值得留意的是,这样一条流水线中有多大一部分其实与这两个模型无关。起草镜头描述的提示词模型、对照需求简报核验画面的视觉模型、从参考音轨中还原对白的转写模型——它们持续不断地运行,单条片段的成本只是视频模型的一小部分,而恰恰是这些环节会在不合时宜的时间出故障。将它们运行在同一个 API 上,覆盖 200 多个模型,按供应商标价、0% 加价,可以让这一层共用一把密钥、一份账单,而自动故障转移意味着一个性能下降的提示词端点会被重新路由,而不是让排在其后的队列停滞。当某家供应商下调视频模型价格时,这种直通意味着降价当天这里就会生效——但仅限我们实际提供服务的模型,而目前并不包括这两个。

每一个值得等待的是什么
Ray 3.2 现已推出,而选择它的理由很具体:如果你的交付成果需要经过色彩管线,那么 ACES2065-1 EXR 路径是大多数生成器根本不具备的能力,而分辨率和时长方面的限制——1080p 上限、HDR 仅限 5 秒片段、无原生音频——就是入场代价。如果你需要同步的声音,那这款模型就不适合你,你应该去看看能生成声音的模型。
Odyssey-3 值得关注只有一个原因,而且不是 Ray 3.2 的任何维度。如果同一组权重真的能驱动机械臂、人形机器人、汽车、无人机和三款游戏,且每一项都来自数十小时的数据,那这就是一项关于通用性的主张,没有任何渲染器会作出这样的主张,而这也是当前领域中最具上行空间的主张。问题在于,如今支持它的证据,只有 Odyssey 自己的演示影片和一个 sim-to-real 数字。真正会改变解读的,不是更好的演示——而是一个价格、一个日期,以及一个由某个不在那里工作的人测出的数字。

