比较 Odyssey-3 和 MiniMax H3 的文章标题卡,副标题为“差异在于一次下载”,三个数据标签分别写着“自 2026 年 8 月 3 日起开放权重”、“社区许可证,768p”以及“Odyssey-3:未公布价格”。
Guides & Insights

Odyssey-3 对比 MiniMax H3:区别就在于一次下载

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年8月3日,一个2K视频模型的权重以任何人都能下载并运行的名字登上了Hugging Face:MiniMax H3。六周后,9月15日,Odyssey发布了一个关于Odyssey-3的研究页面——一个驱动机械臂、一辆汽车、一架无人机和三款电子游戏的基础世界模型——并在原本会放下载链接的地方写上了一句话:它将在“未来几周内”公开发布。这两句话就是整场对比的全部。其中一个模型今晚就能进入你的集群,部署在你自己的芯片上,依据一份你能阅读的许可证。另一个则无法被其实验室之外的任何人购买、租用或下载,而公司也没有说明这种情况何时会改变。这种不对称不是这场对决的脚注。它就是这场对决本身。

MiniMax H3 到底能带给你什么

H3 于 2026 年 7 月 31 日发布,并于 8 月 3 日开源。它是一个通用模型,而非单一任务的视频生成器:它可将文本、图像、视频和音频作为上下文读取,并能生成最长 15 秒、最高 2K 的视频,原生立体声音频为 32 kHz、每秒 24 帧。它支持六种宽高比(从 21:9 到 9:16),并稳定支持十一种语言的对话。开源基础模型发布了两个变体——H3-Base-FL2VA 用于文本到视频以及首帧、尾帧或首尾帧生成;以及 H3-Base-Ref2VA,它最多可接受九张图像、三个视频片段和三个音频片段,输入文件上限为十二个。

这个对比真正关键的地方,在于开放的那一半止步于哪里。完整的 H3 系统是一条三阶段流水线:H3-Context-IR 负责预处理和编排上下文,H3-Base 以 768p 生成,H3-Regenerate-2K 再把结果提升到 2K。只有 H3-Base 的权重是公开的,而且它采用的是 MiniMax H3 Community License,而非 Apache 或 MIT——这是一份附带条件的许可证,在把它纳入商业流水线之前值得一读。Context-IR 阶段和 2K 再生模块都运行在 MiniMax 一侧。所以这里的“开放权重”,买到的只是流水线的中段。一个团队下载 H3-Base 并自行托管,得到的是 768p 视频生成能力,若不调用厂商的服务,就没有通往 2K 的路径。

Two-column scoreboard for Odyssey-3 and MiniMax H3 across six shared dimensions — what it produces, what you can download, price, availability, third-party runs and evidence. MiniMax H3 reads H3-Base weights under a community licence, $0.08/s at 768p and $0.13/s at 2K, open since 3 Aug 2026; Odyssey-3 reads nothing yet, not published, announced 15 Sep 2026 with no date.

而是 Odyssey-3 为你带来的东西

Odyssey-3 给你的,取而代之的是一个主张和一组演示。Odyssey 将其称为基础世界模型,而它已公布的架构细节足够具体,日后可供核查:一个自回归扩散 Transformer,在大量关于世界的视觉观测数据上训练而成,公司称这带来了对物理、动力学、因果关系和人类行为的学习所得的理解。任务适配的做法是外挂一个在观测—动作配对数据上训练的动作解码器,同时预训练的世界模型保持冻结——由一个小型策略读取冻结模型的表征,而不是对模型本身进行微调。

这些演示涵盖六种具身形态。机械臂在数十小时的演示之后,包括不在训练数据中的恢复行为——在抓取失败后重新调整夹爪方向。使用 Flexion 基于数十小时遥操作数据构建的人形机器人策略,Odyssey 称其泛化能力优于所测试的 VLA 基线,但没有公布数字。从二十小时模拟数据中学到的闭环驾驶,在印度实际行驶。基于模拟数据的室内避障无人机飞行。游戏环境,包括在 Grand Theft Auto V 中训练的策略,无需在这些作品中额外训练就迁移到 Red Dead Redemption 2 和 Sleeping Dogs;大约两小时的 GTA 影像就足以在 RDR2 中生成骑马动作。以及用于训练其他 AI 的环境生成,与公司的 PROWL 强化学习工作相关。

页面上唯一一个确凿的数字,是与真实录像的对比:Odyssey 报告称,经仿真训练的驾驶策略在两次安全员介入之间行驶的距离约为用真实数据训练的策略的 77%。这是一个厂商数据,未经复现,背后没有技术报告,也没有任何第三方发表过针对 Odyssey-3 的结果。这类数字恰恰决定了一个世界模型是否有用,而目前它只是一家公司的一面之词。

两种看似毫无相似之处的锁定效应

人们很容易把 MiniMax H3 归为“开放的那个”,把 Odyssey-3 归为“闭源的那个”,但许可层面的现实比这更有意思,而且它并非单向。

MiniMax H3 在中间是开放的,在边缘是封闭的。你可以持有生成器、检查它、微调它,并在无需网络调用的情况下运行它。你无法持有让它成为通用模型的上下文编排,也无法持有 2K 步骤。如果你的产品质量宣称取决于输出分辨率,那么你的开放权重部署就存在一个只有供应商的托管层级才能突破的上限。

Odyssey-3 在每一个层面都是封闭的,而公司自己的说法正是这件事显得奇怪的原因。一个面向机器人、无人机和车辆的世界模型,推销对象是在自己掌控的硬件上运行推理的买家——工厂车间、测试车辆、机体。这些买家无法把托管端点用于控制回路;延迟和连接性排除了这种可能。因此,像这样的模型,其商业模式必须涉及权重,否则在 Odyssey 反复提及的细分市场里就不会有客户。如今没有许可证,与其说是在表明某种意图,不如说是在表明商业条款仍在拟定之中。Odyssey 于 2026 年 6 月宣布的 3.1 亿美元 B 轮融资,估值 14.5 亿美元,AWS 为首选云服务商,Trainium 为算力基座——这些条款将在这个背景下被确定。

逐个维度

输出内容 — MiniMax H3:一段渲染出的片段,时长 4–15 秒,最高可达 2K,并带立体声音频。Odyssey-3:模拟世界状态,以及面向所连接硬件的电机动作。

你可以下载的内容 — MiniMax H3:H3-Base 权重、社区许可证、768p。Odyssey-3:什么都没有;没有权重,没有许可证,没有代码仓库。

厂商保留的内容 —— MiniMax H3:H3-Context-IR 和 H3-Regenerate-2K,这两个模块使其具备通用性并实现 2K。Odyssey-3:所有内容。

价格 — MiniMax H3:公布按秒计费费率,768p 约为 $0.08,2K 约为 $0.13,另加每秒钟重新生成输出 $0.05(厂商数据)。Odyssey-3:任何渠道均未公布。

可用性 — MiniMax H3:自 2026 年 8 月 3 日起开放,现已可调用。Odyssey-3:于 2026 年 9 月 15 日发布,“将在未来几周内”推出,尚无具体日期。

第三方证据 — MiniMax H3:在第三方评测中,视频编辑排名第一,文本生成视频和图像生成视频排名第二或第三。Odyssey-3:仅有一项厂商数据,完全没有外部测试运行结果。

如果你这个月需要构建点什么

实际结果是,这两者中只有一个是你能据以行动的决定。MiniMax H3 在 OrcaRouter 上的路由为 minimax/minimax-h3 按供应商标价,0% 加价——因此供应商的价格就是你支付的价格,当 MiniMax 调整某个数字时,你的账单会在同一天随之变动,而不是等到续约时。对于按秒计费的视频模型来说,这一点比大多数情况都更重要,因为 768p 到 2K 的价差接近二比一,而原型与正式发布之间的差别,可能就在于这两个档位之间。

这里选择路由器而不是直接进行厂商集成,还有第二个原因。H3 的开放部分本身确实很有用,而最可能在意这一点的团队,正是那些拥有 GPU、并且对 GPU 有自己看法的团队。这类团队最终会落入一种混合配置:用自托管的 H3-Base 承担大批量工作,用托管路径处理 2K 重新生成,再用一两个其他模型来满足视频周边管线的任何需求。在这种形态下,跨提供商的一把密钥和自动故障转移,比在单一模型栈中更有价值;而路由 DSL 能把周边模型——一个提示词模型、一个用于起始帧的图像模型、视频模型——组合成一次调用,而不是三套集成。

Odyssey-3,明确地说,并非由 OrcaRouter 或任何其他方路由。没有可供路由的端点,也没有可供传递的价格。本文并未声称相反。

值得向两家供应商提出的问题

MiniMax 已经回答了关于 H3 的那个有趣问题,答案是“中间档,768p,在我们的许可下”。如果你正在评估 H3,要测试的是:开放基础版本加上你自己的基础设施,在每可用秒成本上能否胜过托管的 2K 路径——并且要在你基于 2K 输出构建产品主张之前就测试。

Odyssey 尚未就自己的版本给出回应。当发布窗口关闭时,首要问题不是基准测试,而是许可:这六种具身形态中,哪一种才是受支持的部署,运行在谁的硬件上,价格是多少,以及那个让冻结的世界模型驱动机械臂的动作解码器,究竟是由客户训练,还是由 Odyssey 交付。一个世界模型,仅凭单一主干就能触及机械臂、人形机器人、汽车、无人机和三款游戏,这是一种通用性主张;而通用性正是使它成为基础模型而非策略的原因——这也正是为什么决定谁能使用它的,会是商业条款,而不是演示视频。

Screenshot of Odyssey's “Introducing Odyssey-3: A General-Purpose Physical Intelligence” page, dated September 15th, 2026, showing the model subtitle “Odyssey-3 is a foundation world model that can power robots, drive cars, train AIs, pilot drones, and even play video games” and the authors Oliver Cameron and Jeff Hawke.

在那之前,诚实的记分牌上写着:一个你可以拉取的模型,一个你只能观望的模型。先看有没有代码仓库和许可证,其次才是基准测试——顺序就是如此,因为少了前两样,第三样便无从验证。

Screenshot of the OrcaRouter model page for MiniMax-H3, model ID minimax/minimax-h3, showing a release date of 2026-07-31, 4–15 second clips at 768P or 2K with native stereo audio, and pricing of $0.08 per second at 768P and $0.13 per second at 2K.

将整条流水线置于一个具备自动故障转移的 API 密钥之后,而无需三个独立的集成。