一张生成的标题卡,上面写着“Vidu Q4 Preview 对比 MiniMax H3”,副标题是“Elo 相差十六分,榜单上相差三位”,还有三个统计卡片,分别写着“1,195 MiniMax H3 Max”、“1,181 MiniMax H3”和“1,179 Vidu Q4 Preview”,每个都标注为“图生视频 Elo”。OrcaRouter 标志被合成在右下角。
Guides & Insights

Vidu Q4 Preview vs MiniMax H3:榜首打成平手,而其中只有一个登上了三个榜单

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Artificial Analysis 的图生视频排行榜(读取日期为 2026 年 10 月 8 日)将MiniMax H3 Max列为第一,Elo 为 1,195;MiniMax H3位列第二,为 1,181;Vidu Q4 Preview排名第三,为 1,179。第一名与第三名相差 16 分,而置信区间分别约为 ±10 和 ±11,投票数则分别为 5,894、7,284 和 5,543。这不过是一场被包装成领奖台的统计平局,任何以宣布该榜单胜者开篇的页面,读到的都是噪声。

所以有趣的问题并不是这两个模型中哪一个更好,而是一旦你离开两者同时出现的那一个榜单,这种比较会发生什么变化——因为 MiniMax H3 于 2026 年 7 月 31 日发布,是一个全模态模型,能把文本、图像、视频和音频引用当作单一上下文来读取,而 Vidu Q4 Preview 于 2026 年 10 月 7 日推出,带有两种输入模式和两个 API 端点。其中一个在三处被测量。另一个只在一处被测量。

三方并列意味着什么,又不意味着什么

MiniMax 的两个条目和 Vidu 的版本都落在彼此的区间内,所以诚实的说法是:在当前样本量下,排名前三的图像到视频模型在人类偏好上无法区分。有两个细节让这个平局并不像听起来那样对所有人都那么有利。

第一个是时效性。MiniMax H3 的票数来自 2026 年 7 月,H3 Max 的来自 8 月,而 Vidu Q4 Preview 的则来自 10 月。更大、更早的投票池所衡量的,是不同的竞争格局和不同的对手阵容,这一点是双向的:测量得更充分,但针对的却是一个略有不同的问题。在这里,无论哪个方向出现 16 分的差距,都算不上证据。

第二列是价格列。Artificial Analysis 在该榜单上记录 MiniMax H3 为每分钟 7.80 美元,H3 Max 为每分钟 4.80 美元。Vidu Q4 Preview 记录为 7.20 美元。若把这些当作排名来看,H3 Max 似乎是三者中的性价比之选——但底层厂商费率解释了这个标签,而不是与之矛盾。我们在自己的模型卡上将 MiniMax-H3 列为 768P 下每秒 0.08 美元、2K 下每秒 0.13 美元,也就是每分钟 4.80 美元和 7.80 美元。榜单上的两个 MiniMax 数字是同一模型在两个分辨率档位上的定价,而不是高端档和廉价档。偏好榜单上的每分钟列对于数量级判断有用,但对于任何更精细的比较则很危险。

在 MiniMax H3 出现、而 Vidu Q4 Preview 不出现的地方

这是对决中在平局后依然保留的部分,这是一种结构性差异,而不是质量上的差异。

MiniMax H3 (768p) 以 1,137 Elo、8,315 票位列文生视频榜单第四,H3 Max 以 1,130 Elo、5,719 票位列第五。它在视频编辑榜单上同样位列第四,获得 1,119 Elo、7,023 票;该榜单根据模型按照文本指令编辑视频并保留音频的表现进行排名。Vidu Q4 Preview 在两个榜单上均未出现。

这种缺失并非测量上的空白——它就是这款产品的本质。Vidu Q4 Preview 的 API 文档记录了两个端点,/ent/v2/img2video以及 /ent/v2/reference2video,而产品页面列出了两种模式:图生视频和参考生视频。文档中没有文生视频的路径,也没有视频编辑的路径,这意味着该模型无法拿一段现成的视频片段并修改其中的内容。MiniMax H3 两者都能做到,而它的全模态框架——在同一上下文中融合文本、图像、视频和音频参考——正是它能够做到的原因。

音频方面值得说得更精确一些,因为两个模型都做原生音频,而这两者并不是一回事。Vidu Q4 Preview 同时生成音频和视频,在图像转视频端点中有一个 audio参数,可输出带对话和音效的视频,并且最多接受三段参考音频片段,以保持角色声音一致。MiniMax H3 输出原生立体声音频,并接受音频作为与图像、视频并列的输入模态。参考声音这一用例是 Vidu 的专长;参考一切这一用例则是 MiniMax 的。

每秒的算术,逐层来看

两个模型都按生成输出的秒数计费,这使得这次对比难得地可以直接将各自的费率表相互对照,而无需进行换算。

• 540p — 仅 Vidu Q4 Preview:每秒 9 积分,按平台公布的 $0.005 标准积分费率计算,约合 $0.045

• 720P / 768P — Vidu Q4 Preview 每秒 19 积分,约 $0.095,对比 MiniMax-H3 每秒 $0.08

• 1080p — Vidu Q4 Preview 每秒 24 积分,约合 $0.12;相比之下 MiniMax-H3 未公布 1080p 档位

• 2K — Vidu Q4 Preview 每秒 38 积分,约合 $0.19,而 MiniMax-H3 为每秒 $0.13

• 4K — 仅限 Vidu Q4 Preview:每秒 78 积分,约 $0.39

由此得出的规律并不是"某一家更便宜"。Vidu Q4 Preview 的价格下限确实更低——它的 540p 档位就是一个 blocking 档位,定价恰好对应其用途:在支付全分辨率渲染费用之前先验证构图,而 MiniMax 的价目表里没有任何档位扮演这个角色。在 2K 这一两款模型共有的最高档位上,MiniMax H3 要便宜约三分之一。而 Vidu 的 4K 档位是本次对比中唯一的 4K 生成档位,其定价也反映了这一点。

Vidu 发布时一同公布的每秒 0.014 美元这一数字,是 540p 档位按折扣积分费率计算的价格,并非通用费率。Shengshu 平台目前正对积分包推出最高 30% 的限时套餐折扣,这会让每个档位一起下移,而不会改变曲线的形状。请以标价费率曲线作为比较基准,把折扣视为临时抵减。

在我们这边:我们为 MiniMax-H3 提供路由。它已在公共模型 API 上线,地址为 minimax/minimax-h3,按生成输出的每秒计费,采用供应商的标价原样透传、不额外加价,可通过与我们提供的所有文本模型相同的 OpenAI 兼容端点调用。Vidu Q4 Preview 不是 OrcaRouter 的路由,本页面也没有声称它是——我们确实提供的视频模型与语言模型共用同一个密钥和同一种请求形态,正是这种安排让比较其中多个模型变得成本很低。透传定价的一个实际结果:当供应商调整每秒费率时,这一变动当天就会在路由上显现,而不是等到合同续签时才体现。

在实际请求中,“全模态”能带来什么

MiniMax H3 的统一上下文很容易被当作一份功能列表来解读,从而错过它作为一种工程差异的意义。一个将视频作为输入参考的模型,可以被指向某个现有镜头,并要求它继续、扩展或重新风格化该镜头;而没有视频输入的模型则做不到。这正是 H3 能出现在编辑板上的机制,也是为什么该模型 4–15 秒的输出范围并不像这个数字所暗示的那样构成限制——多轮扩展才是用它构建更长序列的常规方式。

Vidu Q4 Preview 的 16 秒上限同样是按次生成计算的,其 Reference-to-Video 模式就是为在这一时间窗口内进行多镜头叙事而打造的,文档中描述了智能镜头切换以及多个机位之间的一致性。它不具备的,是接受一段你已经拍好的片段并对其进行修改的途径。如果你的工作流是从实拍素材出发,而不是从一张静态图或一组参考图出发,那么这两个模型中就有一个根本用不上,再高的 Elo 分数也弥补不了这一点。

哪个,按工作

当输入是图像或参考集以外的任何内容时,选择 MiniMax H3。文生视频、视频到视频编辑、音频输入、超过十五秒的多轮延长,或者模型需要覆盖三块不同板卡所能承载的用例的流水线——那是 H3 的领域,而且它是两者中唯一具备其中任何一项的。在它们共有的最高档位中,它的 2K 费率也是两者中更便宜的。

当你需要保证演员与声音的一致性时,或需要 4K 生成层级时,又或者想在正式投入前用廉价的 540p 走位粗排反复打磨某个镜头时,就选 Vidu Q4 Preview。十五个图像参考加三个音频参考,这一公开的参考额度比 MiniMax 所公布的要大,而且本次对比中没有其他模型能原生生成 4K。代价则是它的模式集更窄。

会改变这一点的是:Vidu Q4 完整版发布,新增文生视频端点,这将把这两个模型放到同一批榜单上,并让这变成一场正面较量。AA-Video-I2V v2.0 宣布将全面支持 1080p,并采用修订后的能力分类体系,它将替换榜首的票数,而不是重新排序——它还将弄清当前的三方并列究竟是并列,还是测量极限。在那之前,要记住的数字是十六,旁边配上榜单名称和日期。

从领奖台本身唯一值得得出的结论是:在如此宽的区间下,第一名只比第三名高出 16 Elo,这算不上排名。这是人类投票者无法区分的三个模型,而它们之间的抉择必须来自本页其余的所有内容。

A generated two-column scoreboard titled 'Vidu Q4 Preview vs MiniMax H3 - the scoreboard'. The left column reads: Image-to-video Elo 1,179 (3rd); Text-to-video not present; Video editing not present; Max resolution 4K generation tier; Clip length 1-16 seconds; Price at 2K about 0.19 USD per second. The right column reads: Image-to-video Elo 1,181 (2nd); Text-to-video 4th, 1,137; Video editing 4th, 1,119; Max resolution 2K; Clip length 4-15 seconds; Price at 2K 0.13 USD per second. A footer reads 'All Elo and rank figures per Artificial Analysis, 8 Oct 2026; prices per vendor rate cards.'A screenshot of the Vidu API documentation for Vidu Q4 Preview, showing the left navigation with the Vidu Q4 Preview entry selected and the 'Image to Video' page open, including the Create Task endpoint, the Authorization header and a cURL request example whose body sets model to viduq4-preview with a duration and resolution and the audio parameter set true.A screenshot of the OrcaRouter model page for minimax/minimax-h3, showing MiniMax-H3 described as MiniMax's omni-modal video generation model and the Hailuo 3 generation, released July 31, 2026, reading text, image, video and audio references as one unified context and generating 4-15 second videos at 768P or 2K with native stereo audio, billed per second of generated output at $0.08/s at 768P and $0.13/s at 2K, with an OpenAI-compatible code sample and a per-second price of $0.0800.