
Odyssey-3 vs Google Veo 3.1:前沿物理对决十个月的制作
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Odyssey-3 与 Veo 3.1 之间的对比,本质上是在对比两个日期。Veo 3.1 自 2025 年 11 月 17 日起已全面可用——已经历十个月的生产使用、公布了按秒计价的价格、原生支持 4K,并且其服务栈至少经历过一次企业审查。Odyssey-3 则由 Odyssey 于 2026 年 9 月 15 日预览,没有公布价格,没有 API 文档,没有独立基准测试,发布窗口是“未来几周”。把它们并排放在一起仍然值得做,因为它们会被一同提及的原因是真实存在的:Veo 3.1 能渲染出漂亮的视频,而 Odyssey-3 试图模拟一个在控制下行为正确的世界。这就是团队一直用“视频”一词混为一谈的两类不同产品,而它们之间的差距,正是采购决策真正所在之处。
十个月的持续交付能为你带来什么
Veo 3.1 的优势并非某项功能,而是时间的积累。该模型自 2025 年 10 月起以预览版形式交到付费客户手中,自 11 月 17 日起作为 GA 产品提供,并于 2026 年 3 月 31 日增加 Lite 层级,4 月 2 日增加免费层级。这样的历程能带来预览版无法产生的东西:有文档记录的 API 接口、一套已被从业者摸清的既有故障模式,以及财务团队可以建模的成本曲线。
规格表也体现出同样的成熟度。Veo 3.1 可生成 720p、1080p 和原生 4K 视频,帧率为每秒 24 帧,原生时长为 4 秒、6 秒或 8 秒;更长的输出据称在 1080p 下实现,并可在此基础上通过场景扩展链式延长。它最多接受三张参考图像,用于保持角色和场景一致性,此外还提供种子和负面提示词控制。输出带有 SynthID 和 C2PA 来源元数据。对于品牌、广播或大屏项目而言,原生 4K 路径是大多数竞争对手根本不具备的一项能力——也正是 Veo 3.1 不断赢得那些并非靠价格拿下的项目的原因。

悄然使每一次对比产生偏差的音频默认设置
Veo 3.1 可原生生成 48kHz 立体声音频——对白、环境音、拟音——并与画面同步生成,这确实是它最突出的特性之一。不过在 API 上,音频参数默认是关闭的,而且无声生成的定价低于带音频生成。在 Google 公布的标准档(Standard tier)中,这大致相当于无声每秒约 0.20 美元,带音频每秒约 0.40 美元。由此产生两个后果。第一,Veo 片段的实际价格完全取决于一个大多数人从不改动的标志位,因此对于同一个模型,“每秒 0.20 美元”和“每秒 0.40 美元”两种说法都可能是正确的。第二,也更微妙的是,这意味着你读过的许多正面交锋的对比测试,都是拿无声的 Veo 3.1 去对阵音频始终开启的竞品,然后在一个音频感知的排行榜上给它们打分。如果你的输出需要声音,那么据以做规划的诚实数字应该是开启音频的那个。
Odyssey-3 实际主张的是什么
Odyssey-3 并不是更好的视频生成器,也无意自称如此。它是一个自回归扩散 Transformer,基于对世界的视觉观察进行训练,而此次发布的核心能力是一个动作解码器——“一种附加到世界模型上的学习输出组件”,它将模型内部的场景表征转化为特定硬件的运动指令。Odyssey 报告称,它能够基于数十小时的演示控制机械臂,实时驱动用 Flexion 构建的人形机器人策略,从基于 20 小时模拟数据训练的冻结骨干网络生成闭环驾驶路点,在室内绕障碍物飞行无人机,以及玩 Grand Theft Auto V,并能迁移到 Red Dead Redemption 2 和 Sleeping Dogs,而无需在那里进行额外的策略训练。唯一公布的对比数字是:在安全驾驶员干预之间,模拟训练的驾驶策略行驶距离约为真实录像训练策略的 77%。
注意这些是什么样的论断。它们无一涉及输出看起来如何。每一条都涉及模型下游的程序能用它做什么。
不重叠的维度
• 输出 — Google Veo 3.1:一段渲染好的视频片段,最高支持原生 4K,可选配 48kHz 立体声音频。Odyssey-3:一个模拟的世界状态,以及通过动作解码器生成的运动动作。
• 消费者——Google Veo 3.1:观看者或编辑者。Odyssey-3:机器人控制器、驾驶策略,或训练循环。
• 片段时长 — Google Veo 3.1:原生支持 4/6/8 秒,1080p 下更长,可通过扩展链进一步延长。Odyssey-3:连续生成,没有片段的概念。
• 价格 — Google Veo 3.1:标准档无音频约 $0.20/秒,带音频约 $0.40/秒;Fast 和 Lite 档位价格更低。Odyssey-3:未公布任何价格。
• 可用性 — Google Veo 3.1:自 2025-11-17 起正式发布(GA)。Odyssey-3:于 2026-09-15 预览,公开发布时间"将在未来几周内"公布。
• 证据——Google Veo 3.1:十个月的实际生产环境使用,并在独立排行榜上占有一席之地。Odyssey-3:仅有厂商演示,没有基准测试表,也没有技术报告。
物理学论断在何处真正见效——又在何处不见效
人们很容易以为,物理效果更好的模型就能做出更好的视频,而这并不是 Odyssey 在卖的东西。视频团队的问题几乎从来都不是片段里的世界在物理上不一致——而是这个镜头需要是 4K,或者角色在三个不同布景中看起来必须一致,又或者交付物需要在法务签字之前附上来源元数据。Veo 3.1 今天就能回答这些问题。一个物理精确的模拟器回答的是另一个问题:我能不能在这里训练出某种在那边也能用的东西。如果你并不是在训练任何东西,那么 Odyssey-3 的物理精确性就是一个在你的工作流中找不到买主的功能。
真正交汇之处在于预可视化。一位想要以交互方式探索空间的导演——让摄影机穿过片场、改变走位选择、看到结果——想要的正是世界模型所能提供、而渲染出的片段所无法提供的东西,因为片段一旦生成就被固定下来了。这是一个真实的用例,而且在这个用例中,尚未发布的预览版还不是一个可用选项。
在生产环境中运行它,而不押注于单一端点
生产团队之所以关心模型周边的架构,是因为一条视频流水线很少只靠一次调用完成。提示词模型起草分镜清单,图像模型生成起始帧,视觉模型对照需求简报检查结果,转录模型处理旁白。每一个环节都是依赖项,都可能在凌晨两点挂掉;而如果你分别采购它们,每一个都是一次单独的集成。把这层能力放到一个 API 上,覆盖 200 多个模型,按供应商标价、零加价,就能把集成工作收拢到一处,而自动故障转移意味着提示词模型一旦中断,流量会改道绕行,而不是让整个渲染队列停摆。在这种场景下,路由 DSL 比在单模型工作流中更为重要,因为把多个模型组合成一次调用,才能让多阶段流水线逐阶段优雅降级,而不是整体崩掉。需要明确一下范围:OrcaRouter 并不提供 Google Veo 3.1 或 Odyssey-3,这两个模型都无法通过它访问。

谁应该现在行动,谁应该等待
如果你的交付截止日期就在本季度,而交付物是一个文件,那么 Google Veo 3.1 就是经得起推敲的选择,而它的价格——1080p 带音频约每秒 0.40 美元,Fast 和 Lite 档位更低——正是一个已在生产环境中用得足够久、久到乏味的模型所应付出的成本。要刻意把音频这一项计入预算,而不是事后才发现它。
如果你的问题是一个必须在硬件上奏效的策略,Odyssey-3 就是针对你这类需求的,但目前仍然没有可买的东西。要等三件事:公布的价格、一个确切日期而非时间窗口的发布日期,以及一个独立的数据。77% 的 sim-to-real 数字来自 Odyssey 自己;在公司外部有人重新跑出这个结果之前,正确的姿态是保持兴趣,而不是做规划。与此同时,周边技术栈才是你可以构建的部分,而把它构建成日后能够接入新模型的样子,是成本最低的站位。

