对比用标题卡,上方显示“Grok Imagine Video 1.5 Lite vs Hailuo 2.3”,下方一行是“所谓的经济档才是贵的那个”,以及“$8.40 / min vs ~$4.80 / min”,并带有两个扁平描边的卡片形状,由一条分隔线从中分开。
Guides & Insights

Grok Imagine Video 1.5 Lite vs Hailuo 2.3:"Lite"模型才是昂贵的那一个

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

先从一个打破假设的数字说起。Grok Imagine Video 1.5 Lite 是 SpaceXAI 的 Grok Imagine Video 系列中的经济型档位,在 Artificial Analysis 的 AA-Video-T2V v2.0 榜单上报价为每分钟 8.40 美元。Hailuo 2.3 是 MiniMax 于 2026 年 4 月发布的视频模型,经销商报价约为每秒 0.08 美元——约合每分钟 4.80 美元,略高于 Lite 费率的一半。在廉价版 Grok 与 Hailuo 2.3 的对比中,廉价版 Grok 反而是更贵的模型。这就是整个对比的一句话总结,而本页其余内容都在讲:为什么这个标价差距比看起来更小、也更奇怪,以及为什么这两款模型实际上并不是在争夺同一个片段。

两个价格,两份截然不同的合同

按秒比较是真实的,但它掩盖了账单的形态。G​rok Imagine 1.5 Lite 按输出秒数计费,没有最低消费,也没有承诺量——每分钟 8.40 美元的费率意味着一段六秒的草稿花费 0.84 美元,而生成失败则完全不收费。H​ailuo 2.3 的官方渠道则反其道而行:M​iniMax 出售从 1,000 美元到 6,000 美元不等的预付点数套餐,而这些点数按固定费率消耗——一段六秒 768p 标准片段扣一个点数,一段十秒 768p 或六秒 1080p 片段扣两个点数,而更快的 H​ailuo-2.3-Fast 变体则将这两项分别降至 0.7 和大约 1.1 至 1.3。转售商则报出更平稳的每单位 0.067 至 0.08 美元,这就是人们熟悉的“H​ailuo 便宜得离谱”这个数字的来源。

所以说,价格这一行的实话是这样的:如果你还在试水阶段,Grok 模型的商业形态更合适,Hailuo 的单价更划算;如果你已经在大批量采购 MiniMax 点数,那 Hailuo 的单条视频更便宜,而且差距还很明显。这两种定价方式都没错,它们针对的是不同规模的客户,而一个独立创作者拿 0.84 美元一版的草稿去和 1,000 美元的起购门槛相比,其实根本算不上是在比价。

逐个维度

• 价格 — G​rok Imagine Video 1.5 Lite 每分钟 8.40 美元,按秒计费、无最低消费;相比之下,H​ailuo 2.3 通过经销商约为每秒 0.067–0.08 美元,或使用 M​iniMax 起价 1,000 美元的预付费积分套餐。H​ailuo 在费率上胜出;Lite 在入门成本上胜出。

• 分辨率 — Lite 以 720p 渲染 1080p 再进行放大;H​ailuo 2.3 原生输出 1080p,而 M​iniMax 并未为其附加任何"需靠放大"的说明。在这一项上,H​ailuo 无疑更胜一筹。

• 片段时长——Lite 在任何支持的分辨率下均为 1 至 15 秒,而 Hailuo 2.3 在 1080p 下上限为 6 秒、768p 下为 10 秒。在完整分辨率下,Lite 的时长窗口是后者的两倍多。

• 音频 —— Grok Imagine Video 系列在其完整版模型上原生支持音频,而 Lite 版本自身的列表并未单独说明音频通道,因此请将 Lite 的音频视为未经验证。Hailuo 2.3 完全没有原生音频;早一代 Hailuo 曾具备该功能,而 2.3 将其取消了。若不亲自核实,这两个模型都无法提供可靠的配乐。

• 帧控制 — Lite 接受首帧图像,而该系列的全模型文档记载了首帧、尾帧和中间帧的固定,因此序列可以按设计进行串联。H​ailuo 2.3 没有尾帧控制,这正是导致在其上实现多镜头连续性需要手动拼接的原因。

• 宽高比——Grok 这边有七种(16:9、9:16、1:1、4:3、3:4、3:2、2:3)。MiniMax 并未将 Hailuo 2.3 作为以宽高比为先的模型来呈现;它的辨识度在于其观感,而不是其画幅菜单。

• 独立排名——Grok Imagine Video 1 Lite 在 v2.0 带音频榜单上以 Elo 993(±10,5,715 个样本)位列第 17。Hailuo 2.3 在较早版本的 Artificial Analysis 视频榜单上曾以约 1,180 Elo 排名第 28 左右,且未出现在 v2.0 的前 29 名中,因此两者是在同一榜单的不同版本上被衡量的,其 Elo 数值并不能直接比较。任何把 993 和 1,180 并列在一起的人,都是在比较两种不同的量表。

• 风格 — Lite 继承了通才的广博;Hailuo 2.3 则是一位风格专精者。电影级镜头运动、人物动作与微表情,以及风格化或动漫类内容,都是它的强项,而 MiniMax 也直言,照片级写实并非其目标。

A two-column scoreboard comparing Grok Imagine Video 1.5 Lite ($8.40/min, per-second billing with no minimum, 720p upscaled to 1080p, 1–15 second clips, audio not documented, rank #17 at Elo 993) with Hailuo 2.3 (about $4.80/min through resellers, prepaid points from $1,000, native 1080p, 6 seconds at 1080p and 10 at 768p, no audio, ranked around #28 on an earlier board), with a footer separating the sources.

H​ailuo 真正胜出的地方

抛开定价把戏不谈,Hailuo 2.3 相比 Grok Imagine Video 1.5 Lite 拥有两个实打实的优势,而这两点都关乎像素,而非价格。

首先是原生分辨率。海螺的 1080p 就是真正的 1080p。Lite 的 1080p 则是由 720p 渲染放大而来的。对于一段只会待在信息流里的片段,这种区别会消失得无影无踪;而对于一段要被裁剪、抠像或调色的片段,这就是决定成败的全部,也正是为什么 Lite 更低的每分钟价格并非其档位名称所暗示的那种免费午餐。

第二个就是观感本身。H​ail 2.3 的镜头运动和人物微表情处理是它存在的理由,它会呈现出一种特定的美学——风格化、富有动感、刻意为之——而这正是通用模型不会按要求复现的。如果那正是你的项目需要的观感,那么 G​rok 那边再多的排名优势也无法替代它,因为你买的不是分数,而是一种招牌风格。

A capture of the OrcaRouter models page, showing the model catalogue with vendor groupings and model entries.

Lite在哪些方面胜出,以及胜出多少

片段时长是第一位的,也是分量最重的。任何分辨率下的十五秒,对上 1080p 的六秒,这不是量级之差;而是另一种镜头。十五秒的窗口能撑起一个节拍、一次揭示、一段短序列;六秒的窗口只能撑起一个瞬间,再长就只能是拼接。把这一点与 Grok 家族的帧锁定结合起来,多镜头序列就被设计进了 API 里,而无需事后在剪辑器中拼装。

第二个是商业门槛。无最低消费,按秒计费,生成失败不计费,也无需在开始前先估算积分套餐规模。对于任何首先会问“这个模型到底能不能用于我的内容”的人来说,这就是测试一个下午与做出购买决定之间的区别。

第三点是广度。七种宽高比、文生视频和图生视频、首帧输入和参考图像:Lite 是以折扣价提供的通用型工具包,也是进入这个家族的更便宜途径,而该家族的完整模型在发布时是本系列中最强的通用视频模型。H​ailuo 是专家型模型,只有当专长恰好是你所需时,专家型模型才是正确选择。

A capture of the LMArena text-to-video leaderboard showing grok-imagine-video-1.5-720p in seventh place among models including wan-3.0-720p-audio, gemini-omni-flash and flux-3-video-20260811.

你实际上会如何购买两者中的任意一个

OrcaRouter 不为这两款模型提供服务。我们既不托管 G​rok Imagine Video 1.5 Lite,也不托管 H​ailuo 2.3,两者都通过厂商自有 API 和若干第三方平台访问——Lite 通过 S​paceXAI 的 API 按秒访问,H​ailuo 2.3 则通过 M​iniMax 的积分套餐和经销商访问。这是技术栈中路由问题确实不适用的一环,值得把这一点说出来,而不是暗示并非如此。

真正起作用的是片段上游的一切。指定镜头的提示词、把十个镜头排成序列的分镜表、随导出文件一同交付的字幕与元数据、决定四十份草稿中哪一份留用的那轮筛选——这些都是文本模型的工作,而它们在 OrcaRouter 上运行的方式是用一套 API 覆盖 200+ 模型,供应商目录价按 0% 加价透传,跨供应商自动故障转移,以及一套能把多个模型组合成一次调用的路由 DSL。两家视频厂商的合同都不会改变这一层,这正是为什么路由器不是用来找更便宜片段的地方,而是用来找围绕它的更便宜流水线的地方。

决定

当你需要以可用的最低每秒费率获得原生 1080p,并且想要具有电影感运动的特定风格化外观时——以及当预付积分套餐是你愿意进行的购买时——购买 H​ailuo 2.3。当你需要长于六秒的片段时,当你想按秒付费且无最低消费、同时了解该模型是否适合你的内容时,以及当你请求中的 1080p 字符串只是标签而非交付规格时,购买 G​rok Imagine Video 1.5 Lite。

这个组合之所以看起来奇怪,只是因为名称误导了人。“Lite”描述的是 Lite 在自家产品家族中的定位,而不是它在市场中的定位;而自 2026 年 4 月以来,Hailuo 2.3 在费率上一直低于这一领域的大多数产品。把这个对比中的两行分别看作费率低廉的专业型模型和入门价格低廉的通用型模型,选择就显而易见了——只不过,这并非档位名称所暗示的那个选择。