Odyssey-3 与 Grok Imagine Video 对比的标题卡,左侧面板标题为 Odyssey-3,标注为交互式环境,无公开价格,832x480 或 1280x720 Pro,无音频;右侧面板标题为 Grok Imagine Video,标注为 xAI Imagine API,按秒计费,由你创作的片段,版本 1.5 原生 1080p,Physics-IQ -4.04 pp,排名第 13。
Guides & Insights

Odyssey-3 与 Grok Imagine Video 对比:按量计费的视频 API 对决无定价的模拟器

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Grok Imagine Video 附有一份价目表,却无法对它进行任何操控。Odyssey-3 于 2026 年 10 月 8 日由 Odyssey 作为公开研究预览发布,它具备操控方式,却完全没有价目表。真正勾勒出这场对比形态的,是这种不对称,而非任何一行基准测试数据:xAI 按秒出售生成的视频,并为每种分辨率公布价格,而 Odyssey-3 则以交互式世界模型的形式发布,你可以在浏览器中驱动它,却还无法购买。这两者之中,有一个你今天下午就能放进产品里。另一个,你只能评估。

他们对视频生成究竟是为什么而存在也意见不一,而这种分歧在各自的厂商页面上显露无遗。G​rok Imagine Video 的文档以参考图像、钉定帧、唇形同步语音和声音参考打头——这是制作控制的语汇。Odyssey-3 的主打则是一个环境:当你穿行其中或触发某个事件时,它会预测接下来会发生什么。两者都是基于扩散模型的视频生成器。可除此之外,几乎再无交集。

每一个是什么

Odyssey-3是一种自回归扩散 Transformer。Odyssey 将其描述为一个多步视频扩散模型,通过教师强制和因果掩码以自回归方式加以扩展,因此它能从先前的观测继续,并以动作输入为条件预测未来状态,随后再通过分布匹配和对抗蒸馏提炼为能够实时交互的少步变体。它以 832×480 运行,Odyssey-3 Pro 则为 1280×720,公开预览版提供第一人称导航、第三人称导航和独立镜头移动。没有音频。

Grok Imagine Video是 xAI 在 Imagine API 中的视频模型。当前一代为 Grok Imagine Video 1.5,据 xAI 的发行说明记载,它支持文本生视频、图像生视频和参考生视频,并可选用预设语音,前两者原生支持 1080p——其中文本生视频在底层实现为先文生图、再图生视频。它最多接受十四张参考图像和三段参考语音,支持固定帧与唇形同步语音,并按生成输出的秒数计费。此前的 grok-imagine-video 仍有文档记录且仍在定价之列,480p 为每秒 0.05 美元,720p 为每秒 0.07 美元,输入视频按每秒 0.01 美元计费,输入图像按每张 0.002 美元计费。

费率卡,这才是你真正可以据此规划的部分

xAI's Grok API documentation page for grok-imagine-video, read 9 October 2026, showing the model header with a “Latest” badge, an at-a-glance table listing modalities as text, image and video under the heading “Text > Video”, a pricing heading, and release notes tabs, with the navigation marked “APIs / Grok / Build”.

• 价格 — Grok Imagine Video 按秒计费:原模型在 480p 下为 $0.05/秒、在 720p 下为 $0.07/秒,Grok Imagine Video 1.5 在 480p、720p 和 1080p 下均从 $0.08/秒起。Grok Imagine Video 1.5 Lite 起点为 $0.02/秒,最高支持 1080p 和十五秒时长。Odyssey-3 完全没有公布价格;其唯一公开的成本数字是排行榜的归一化估算值——Odyssey-3 每段生成视频为 $0.139,Odyssey-3 Pro 为 $0.267。

• 一段十秒的片段,算下来——在 Grok Imagine Video 上,480p 要 0.50 美元,720p 要 0.70 美元;Grok Imagine Video 1.5 上要 0.80 美元;Lite 层级上要 0.20 美元。Odyssey-3 没法这样定价,因为你买不到它的十秒钟。

• 分辨率 — G​rok Imagine Video 1.5 的文本生视频和图生视频均原生支持 1080p。Odyssey-3 在 Pro 档位最高仅为 1280×720。

• 时长 — G​rok Imagine Video 1.5 Lite 能达到十五秒。Odyssey-3 的单位不是一段剪辑,而是一次会话,其边界取决于预览能保持其预测连贯多久。

• 音频 — Grok Imagine Video 生成唇形同步的语音,并接受语音参考。Odyssey-3 则完全不生成这些内容。

• 控制 — 参考图像、固定帧、首帧和末帧,以及语音参考,全部在生成前指定。而对照的是生成过程中的实时导航与生成中途事件。G​rok 侧重创作,Odyssey-3 侧重交互。

• 可用性 — Grok Imagine Video 现已提供自助式 API 密钥。Odyssey-3 则提供联系表单和浏览器预览。

物理委员会把它们放在哪里

Physics-IQ Verified 是 Anates Labs 与 DeepMind 的基准测试,它会对真实物理实验的延续进行评分,目前对 41 个模型进行排名,而这两者都位列其中——这使其成为唯一一个能让二者进行对比的第三方平台。

• G​rok Imagine Video — 排名第 13,在本基准测试自带的提示词下,相对于赛道均值净改善 −4.04 个百分点,24 fps,每条视频归一化成本 $0.352。

• Odyssey-3 —— 在同一提示集上排名第 8,提升 +2.15 个百分点,成本 $0.129;在自定义提示上排名第 3,提升 +9.99 个百分点。

这一差距并不小,而且它不是分辨率造成的假象:在输入允许的情况下,该榜单会将成本归一化到 24 fps 和 1280 宽输出,并且会为每一行列出提示词模式。净改进得分为负,并不表示 Grok Imagine Video 生成糟糕的视频——它显然并非如此,而且它已投入生产,价格也使其易于使用。它说明的是:在正确延续一项物理实验这一具体任务上,它的表现不如该榜单上的平均模型,而 Odyssey-3 在两种不同的提示词模式下,两次都优于该榜单上的平均模型。

Odyssey-3 自己打出的头条宣称更加强劲:Odyssey-3 Pro 在视频到视频赛道上达到 66.1,这是 Odyssey 报告的最高分;同一档位在图像到视频上则达到 54.7。这些数字来自 Odyssey 自己的文章,而非独立运行结果,因此也应当这样看待。

Two-column scoreboard headed “Odyssey-3 vs Grok Imagine Video — the scoreboard” with six shared dimension labels. Odyssey-3: published price none; 832x480, 1280x720 Pro; a session, not a clip; no audio; Physics-IQ board prompts +2.15 pp rank 08; custom prompts +9.99 pp rank 03. Grok Imagine Video: $0.05/sec at 480p and $0.07/sec at 720p; native 1080p on version 1.5; up to 15 seconds on the Lite tier; lip-synced speech and voice references; Physics-IQ -4.04 pp rank 13; no custom-prompt entry. Footer: “Odyssey-3 figures vendor-reported and unreproduced; Grok Imagine Video rates per xAI documentation; Physics-IQ Verified board read Oct 9 2026”.

价目表未涵盖的事项

每秒费率背后隐藏着一种值得点明的类别差异,因为它决定了你该选择其中的哪一个。

Grok Imagine Video 的计费模式——按输出每秒多少美元——是对吞吐量的一种承诺。每一美元都买到固定数量的成品视频,唯一的问题是:带唇形同步的 1080p 十五秒视频是否值 $1.20。对于广告单元、社交模板、营销流水线来说,这是一个出色的问题,且答案清晰,而 $0.02/sec 的 Lite 档位让这个答案在多数情况下都变得简单。

Odyssey-3 并非按那种方式计费,也不可能那样计费,因为它的产出并非固定量。交互式环境的消耗取决于有人在其内部停留多久、又多少次改变主意,而这让按秒计费的模型变得毫无意义。当 Odyssey 公布价格时——目前没有任何迹象表明会在何时——它只能采用会话价格、算力价格,或是这个品类尚未发明出来的其他某种定价方式。这并不是反对 Odyssey-3 的理由,而正是目前开发者无法完成对这两者进行比较的原因。

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

今天联系那个计量的

Grok Imagine Video 是 xAI 自己的 API,OrcaRouter 并不托管它。Odyssey-3 不在任何我们能验证的托管平台上,而且即使它在,也没有公布的价格可供任何人路由。

一个 OrcaRouter 密钥真正能触达的,是你围绕这场对比会搭建的其余视频与模型技术栈:MiniMax-H3 的 768P 输出为每秒 $0.08、K​ling 视频产品线,以及 通过单一端点可访问的 200 多个模型,均按提供商标价、0% 加价提供——因此当某家实验室下调每秒费率时,这一变化当天就会体现在你的用量上,而不是等到下一次合同续签。 跨提供商的自动故障转移能让混合了多个视频模型的批处理任务避免因某个上游的糟糕时段而失败,而路由 DSL 让你能把一个托管的视频模型和一个文本或视觉模型接入同一个接口,这正是先生成再评估的流水线真正需要的。目前,那个目录中既没有 Odyssey-3,也没有 G​rok Imagine Video。

你想要哪一个?

如果你需要带声音的 1080p 视频输出,价格低到可以直接填进电子表格,而且本周就要拿到,那么 Grok Imagine Video 是一个可行的答案,而 Odyssey-3 并不在候选之列——它没有音频,分辨率上限更低,而且根本买不到。

如果你正在构建任何必须预测某个动作之后会发生什么的东西——一项策略、一个控制回路、一个训练环境——那么价目表无关紧要,而物理榜则不然。Odyssey-3 正是按这一能力来评分的,而且它接近榜单顶部;G​rok Imagine Video 很擅长生成成品镜头,却在同一测试中低于该赛道的均值。不同的问题,答案并不重叠。