Odyssey-3 对比 ByteDance Seedance 2 的标题卡:左侧面板标题为 Odyssey-3,内容为“一个由你实时操控的世界”,832x480 或 1280x720 Pro,Physics-IQ +9.99 pp,排名 03;右侧面板标题为 ByteDance Seedance 2,内容为自 2026 年 2 月 12 日起 GA,计量计费平台,成片最长 15 秒,分辨率未公布,Physics-IQ 未提交。
Guides & Insights

Odyssey-3 对比 ByteDance Seedance 2:一个你能置身其中行动的环境,对比一段你只能观看的片段

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

把 Odyssey-3 和 ByteDance Seedance 2 并排放在一起,首先会注意到的是,它们并不是在争夺同一个请求。Odyssey-3 由 Odyssey 于 2026 年 10 月 8 日发布,它会根据提示词生成一个环境,然后在你穿行其中或触发事件时实时持续预测它——它是一台由你操控摄像机的模拟器。ByteDance Seedance 2 则是一台带导演椅的片段生成器:输入文本、图像、音频和视频参考,输出一段成品视频,最长可达十五秒,一次生成完成,并作为固定对象交付。其中一个有控制输入;另一个有时间线。不过,这种比较仍然值得做,因为两者正在向同一个买家靠拢,也因为它们对生成式视频模型的价值究竟存在于何处押下了相反的赌注。

有一个共享的记分牌,而它比看上去的要单薄。Seedance 2 本身并未出现在 Physics-IQ Verified 上——那是 Anates Labs 和 DeepMind 的榜单,用于评估模型预测真实物理实验的表现。2026 年 7 月 31 日的后继者 Seedance 2.5 则出现在了上面。因此,唯一一个能把这一家族中的任何东西与 Odyssey-3 并列的第三方数字,是一项仅在单侧跨越两代模型的比较;在任何人将其引述为一场公平较量之前,这一点值得先说明。

这两种机制

Odyssey-3 是一种自回归扩散 Transformer。Odyssey 自己的描述是:一个多步视频扩散模型,通过教师强制和因果掩码以自回归方式加以扩展,因此它能从先前的观测接着往下走,并以动作输入为条件预测未来状态;随后一轮分布匹配与对抗蒸馏的后训练,产出了一个步数极少、快到足以让人与之交互的变体。输出不是一个会播放的场景,而是一个会作出回应的场景。该预览开放了第一人称导航、第三人称导航以及独立镜头运动——三种不同的方式去推动同一个预测,并观察它会如何反应。

ByteDance Seedance 2是一款统一的多模态音视频联合生成模型。它接受文本、图像、音频和视频作为参考,一次性生成片段,最长可达十五秒,音频为联合生成,而非事后配音。ByteDance 的页面描述称,图像、音频和视频参考可控制表演、光照、阴影和镜头运动,这是制作的语言,而非模拟:你指定的是一个镜头,而不是操控一个世界。该模型于 2026 年 2 月 12 日发布,数日内便凭借真实演员和现有影片的片段病毒式传播——而这也正是引发版权风暴的缘由:迪士尼和 Netflix 发出停止侵权函,美国电影协会与 SAG-AFTRA 予以谴责,2026 年 3 月两位美国参议员致信要求 ByteDance 将其关停。ByteDance 曾在 2026 年 2 月表示正在加强保障措施。如果你要发布任何商业化内容,这段历史就是该模型规格的一部分。

逐个维度

ByteDance's BytePlus ModelArk developer documentation in English, showing the Ark SDK quick-start with a Python client using model seed-2-0-lite-260228 against base_url https://ark.ap-southeast.bytepluses.com/api/v3, a sidebar covering Models, video generation, image generation and the Model list, and three endpoint cards for Dola Seed 2.0, Dreamina Seedance 2.5 (described as the mainline video generation model with 30s extended storytelling, multimodal references and improved generation quality) and Dola Seedream 5.0.

• 它输出什么——一个你可在其中行动的交互式环境,以一段最长十五秒的固定片段为背景。这一行之后的所有内容都会随之改变。

• 控制界面——实时导航与生成过程中的事件,基于预先指定的提示词以及图像、音频和视频参考。一个在生成过程中被操控;另一个则在生成之前被指导。

• 音频 —— Seedance 2 与视频由同一模型联合生成。Odyssey-3 的发布材料则完全没有提及音频。

• 分辨率 —— Odyssey-3 的运行分辨率为 832×480,Odyssey-3 Pro 则为 1280×720。ByteDance 为 Seedance 2 设立的页面并未公布输出分辨率,而流传的 1080p 数字属于更早的 Seedance 1.0 系列。

• 成本——在 Physics-IQ 的归一化成本列中,Odyssey-3 的标价为每个生成视频 $0.139,Odyssey-3 Pro 为 $0.267,两者均不含提示词处理费用。Seedance 2 未公布任何我们能够核实的按秒或按片段标价;其后续版本 Seedance 2.5 在同一榜单上的标价为每个视频 $2.838。

• 独立评分——两款模型自身的生成结果都没有第三方正面对比。Seedance 2.0 公布的成绩来自 ByteDance 内部的 SeedVideoBench-2.0;Odyssey-3 的则是一份基准测试提交结果,外加一次由供应商在他人数据集上进行的评估。

• 权重——双方均为闭源。Odyssey 未发布任何检查点,Seedance 也从未开放。

• 商业定位 — Odyssey-3 是研究预览版,提供用于申请 API 访问的联系表单,且没有价目表。Seedance 2 通过 Bytedance 自有平台销售,在中国境外则通过 CapCut 以 Dreamina Seedance 2 的形式销售。

真正能比较它们的那个数字

Physics-IQ Verified 以百分点为单位,对模型在物理合理性上相对于赛道均值的净提升进行评分,并记录使用了哪个提示集。在该基准自带的提示上,Seedance 2.5 以 +3.59 个百分点位列第七,归一化成本为每个视频 $2.838。Odyssey-3 在同一提示集上以 +2.15 个百分点位列第八,每个视频 $0.129。仔细看,这是 Seedance 领先 1.44 个百分点的差距,而成本上却处于大约二十二倍的不利差距。

Odyssey-3 的主要行使用的是另一列。使用自定义提示词提交时,Odyssey-3 得分为 +9.99 个百分点,Odyssey-3 Pro 为 +11.15 个百分点——在榜单上分别位列第三和第二,仅次于 +12.27 个百分点的 FLUX 3 [large]。同一个模型家族在同一个排行榜上以两种不同的提示词机制出现两次,得分却相差很大,这是理解如何解读该榜单时最有用的单点:这个数字一部分是模型本身的属性,一部分是写提示词者的属性。

Odyssey 还报告称,Odyssey-3 Pro 在视频生视频赛道上取得 66.1 分,是其宣称的最高分;在图像生视频上则为 54.7 分。这两项都是厂商对自己所提交榜单的自行解读,而非独立测试结果。

Two-column scoreboard headed “Odyssey-3 vs ByteDance Seedance 2 — the scoreboard” with six shared dimension labels. Odyssey-3: an environment you act inside; live navigation and mid-run events; no audio; 832x480, 1280x720 Pro; /bin/bash.139 a video, Pro /bin/bash.267; no independent scoring yet. ByteDance Seedance 2: a fixed clip up to 15 seconds; text, image, audio and video references upfront; audio generated jointly with the video; resolution not published; no per-second list price published; not on Physics-IQ. Footer: “Odyssey-3 figures vendor-reported and unreproduced; Seedance 2 has no third-party score; Seedance 2.5, a later model, is on Physics-IQ at +3.59 pp”.

各自真正胜出的地方

如果你的问题是“我需要一个镜头”,Seedance 2 的设计正是要回答这一点:多模态参考意味着你可以把演员的形象、音频底轨和运镜交给它,然后得到一段带声音的成品片段。Odyssey-3 的预览中没有任何东西能做到这一点,其发布材料中也没有任何内容表明它将会做到。十五秒的上限是一个真实限制,但一个五秒长、没有音频的世界模型推演片段同样如此。

如果你要解决的问题是“我需要知道接下来会发生什么”,那取舍就反过来了。Seedance 2 无法被问一个反事实问题——你只得到一段片段,而要看另一种结果,你得再次提示,得到的却是一段不相关的内容。Odyssey-3 的核心前提是,下一个状态取决于你刚刚采取的动作,这正是它可用于驾驶策略、机械臂或训练环境的原因——在这些场景里,序列比镜头更重要。

物理准确性的证据在机制层面更支持 Odyssey-3,即便评分栏并非如此:该模型是在扰动之后的续帧上接受评估的,而这正是交互式预览所主打的同一项能力。Seedance 2.5 在同一榜单上提升 3.59 个百分点,对一款片段生成器来说是很强的成绩,而且值得注意的是,在匹配的提示词集上还优于 Odyssey-3——正因如此,最诚实的总结是:字节跳动的视频模型在物理合理性上超出了视频模型应有的水准,而不是 Odyssey-3 在自己最擅长的领域被击败了。

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

到达其中任何一个

今天在这里无法调用这两个模型。OrcaRouter 不托管 Odyssey-3 或 ByteDance Seedance 2——Odyssey-3 没有公开价格可供任何人路由,而 Seedance 通过 ByteDance 自己的平台销售。

单个 OrcaRouter 密钥真正能触达的,是视频技术栈的其余部分:MiniMax-H3,768P 输出每秒 $0.08,Kling 视频系列每请求 $0.084 至 $0.28,以及总共 200 多个模型,全部按供应商标价、0% 加价,因此供应商的价格变动当天就会体现在你的账单上,而不是等到续约时。 自动故障转移可在某个上游降级时让评估扫描继续运行,而路由 DSL 能将多个视频模型置于同一接口之后,因此测试新的生成器只是改一下配置,而不是做一次集成。当这两者中的任意一个开放自助式端点时,那就是可以把它直接接入的形态。

看什么

有两点会比任何基准测试更新都更能改变这一比较。第一点是音频:如果 Odyssey-3 的下一代能像 Seedance 那样联合生成声音,那么“在其中行动的环境”就不再是一个更窄的类别。第二点是一个独立评测框架——由第三方在相同片段上并排运行 Seedance 2.0 和 Odyssey-3,而不是一个模型出现在另一个从未提交过的榜单上。在那之前,拿 Odyssey-3 与 B​yteDance Seedance 2 对比时,正确的解读是:它们不是同一项工作的两个候选者。它们是不同问题的两个答案,而你正在问的问题会替你选出模型。