一张用于对比的标题卡,在“52 Elo 每分钟 $6.60”和“$8.40 / 分钟 vs $15.00 / 分钟”这行上方显示“Grok Imagine Video 1.5 Lite vs Grok Imagine Video”,并带有两个由分隔线分开的扁平描边卡片形状。
Guides & Insights

Grok Imagine Video 1.5 Lite 对比 Grok Imagine Video:每分钟六美元换 52 Elo

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Here is the whole decision in one sentence. G​rok Imagine Video 1.5 Lite costs $8.40 a minute and scores Elo 993 on Artificial Analysis's AA-Video-T2V v2.0 board; G​rok Imagine Video 1.5 costs $15.00 a minute and scores Elo 1045. Same family, same interface, same 1-to-15-second clip length, same seven aspect ratios — and a $6.60-per-minute gap that buys you a 52-point preference score and one hidden difference that does not appear in either headline number. G​rok Imagine Video 1.5 is the original: x​AI's fast generation model, first released January 29, 2026, stable at version 1.5 since June 16, 2026, with native audio and native 1080p. G​rok Imagine Video 1.5 Lite is the distilled sibling, dated August 2026 on the board, quicker and cheaper by construction. The question this page answers is not which model is better — the board already decided that — but which one your output actually needs.

价格表所隐藏的唯一差异

在看要点之前,先说一句比 Elo 分差更能决定实际部署成败的话。在 Grok Imagine Video 1.5 Lite 上,1080p 输出是以 720p 渲染后再放大而成的。而在 Grok Imagine Video 1.5 上,1080p 就是 1080p。

这就是全部。以 1080p 请求的 Lite 片段,实际上是一段 720p 渲染,再叠加一次放大处理。在手机信息流中、以社交平台的码率、经过一个无论如何都会抹平差异的压缩步骤,这一点看不出来。可一旦这个片段进入需要裁剪、抠像、合成、重新取景或调色的流程,缺失的细节就是剪辑师最先注意到、却最无法补救的东西。完整模型没有这个问题,而这也是它每分钟价格几乎翻倍的主要原因。

逐个维度

• 价格 — G​rok Imagine Video 1.5 为每分钟 15.00 美元,而 G​rok Imagine Video 1.5 Lite 为每分钟 8.40 美元,两者均由 Artificial Analysis 在 1080p 默认设置下报价。完整模型公布的每秒费率为 480p 时 0.096 美元、720p 时 0.168 美元、1080p 时 0.300 美元,另加每张输入图像 0.05 美元。

• 榜单排名 —— 在带音频的 AA-Video-T2V v2.0 榜单上,完整模型以 Elo 1045 位列第 11,Lite 以 Elo 993 位列第 17。Lite 的区间为 983 至 1003,即 ±10 的区间,与上方七行处父模型的位置不重叠。

• 有效分辨率 —— 原生 1080p 与将 720p 渲染画面放大至 1080p 容器后的对比。本列表中影响最为关键的一行。

• 片段长度 — 两者均为 1 到 15 秒,且以整秒为单位。在聊天界面中,完整模型默认时长为 10 秒;较长的时长则通过 API 提供。

• 宽高比——两者均为相同的七种:16:9、9:16、1:1、4:3、3:4、3:2 和 2:3。

• 音频 — 完整的 G​rok Imagine Video 1.5 原生自带音频,包含对话、音效和音乐。Lite 自身的列表并未单独说明音频通道,而且公告也将其归入该产品线的无音频版本,因此,如果配乐对你的交付成果至关重要,请在确定采用之前先在 Lite 上核实。

• 输入与条件控制 —— 该系列 API 接收一张首帧图像以及额外的参考图像,完整版模型的文档说明其支持基于参考条件的生成,最多可使用七张图像以实现角色一致性。Lite 的产品说明中描述了文生视频和图生视频支持。

• 成熟度 — 完整模型自2026年6月16日起一直稳定在1.5版本,在发布时于Artificial Analysis的竞技场中同时位居文生视频和图生视频榜首,并在LMArena上以约1,400 Elo的分数保持图生视频第一名。Lite的榜单日期为2026年8月,其分数背后有5,715次盲比较支撑。

A two-column scoreboard comparing Grok Imagine Video 1.5 Lite ($8.40/min, rank #17, Elo 993, 720p upscaled to 1080p, 1–15 second clips, audio not documented) with Grok Imagine Video 1.5 ($15.00/min, rank #11, Elo 1045, native 1080p, 1–15 second clips, native audio), with a footer separating the Artificial Analysis figures from the vendor-reported details.

账单,算好了

抽象的单分钟计价很难落地执行,所以要把它放进一个真实的需求里来看。假设你每个月需要二十条完成的十秒短片。

• 按 G​rok Imagine Video 1.5 Lite每分钟 8.40 美元计算,十秒是它的六分之一,所以每个生成的片段为 1.40 美元。二十个片段是 28.00 美元,尚未计入重试。

• 在Grok Imagine Video 1.5上,按每分钟 $15.00 计算,同样的十秒是 $2.50,二十个片段每月 $50.00。

• 差额是每月 $22.00,也就是每年约 $264,对应每年大约一百五十个片段。

这个数字会让低价档看起来像是一个方向错的舍入误差,而且值得直说:在这个量级下,价格差距并不是选择 Lite 的理由。选择 Lite 的理由是迭代速度。如果 Lite 能更快返回一版草稿,那么上面这二十条剪辑实际上就是六十或八十次生成,其中三分之二都被丢掉了,同样的 22 美元算法就会变成真正不同的一个月。每秒价格是看得见的杠杆;每次生成的实际耗时才是撬动账单的杠杆。

这把选择重新框定为一个工作流问题,而不是价格问题。故障转移是更便宜的同门模型的另一个实用用途:把第一轮交给 Lite 处理、再只对保留下来的结果以完整质量重跑,只需改动请求中所指的模型名称即可,两行代码搞定;而且这是在不必把交付日期押在答案上的前提下,判断 Lite 对你的内容是否够用的最省钱办法。这两个模型都不由 OrcaRouter 提供——我们既不托管 Grok Imagine Video 1.5,也不托管 Grok Imagine Video 1.5 Lite,两者都通过厂商自己的 API 和若干第三方平台访问——但决定生成什么、撰写提示词、归档输出的那一层属于文本工作,而文本工作正是 OrcaRouter 覆盖的范围:一个 API 覆盖 200+ 模型,按提供商标价、0% 加价,自动故障转移,以及能把多个模型组合成一次调用的路由 DSL。

当更便宜的模型是错误的选择时

失效模式很具体,值得命名,因为很容易不小心踩进去。团队为了节省成本而采用 Lite,基于它做了一个月的工作,结果在第一次交付时才发现,1080p 素材根本经不起裁剪。

当片段的去向是信息流、快拍、社交帖子或内部审阅时——也就是输出会以生成时的尺寸被观看的任何场景——Lite 就是合适的模型。当你在反复迭代,而最终保留的那一版无论如何都会以完整质量重新生成时,它就是合适的模型。当产量很高,而单位成本才是关键约束时,它就是合适的模型。

当片段需要以不同的宽高比剪进更长的成片时,当合成师需要提取遮罩或抠像时,当素材需要调色时,或者当交付物带有写入合同的分辨率规格时,这种模式就是错误的选择。在所有这些情况下,你每分钟省下的 6.60 美元,都会在有人不得不重新生成一切的那一刻被还回去,而 Elo 差距根本无关紧要。

A capture of the LMArena text-to-video leaderboard showing grok-imagine-video-1.5-720p in seventh place, behind wan-3.0-720p-audio, gemini-omni-flash, flux-3-video-20260811 and dreamina-seedance-2.5-720p.

诚实地审视局势

关于上面这些数字,有两点需要说明。第一点是 Arena 评分的常见问题:993 和 1045 是盲测的两两偏好投票,而不是衡量一段片段是否符合需求的指标。一个模型可能靠色彩赢下一票,却输掉整个镜头。第二点则与这组对比本身有关——两个模型之间的差距小到读者应该把它视为一种排序,而非一段距离。五十二分的 Elo 意味着 Lite 在与它的母模型对比时,输掉的比较多于赢下的比较;这并不意味着 Lite 在你的镜头上差了 5%,更不意味着一段恰好精准命中需求的 Lite 片段,会比一段没能达标的全模型片段更差。

榜单真正确定的,是这笔交易的方向和幅度。Lite 既不是它所在价格区间里最便宜的,也不是最好的模型:PixVerse V6 就在它下方一行,Elo 985,每分钟 6.90 美元;而 Kling 3.0 1080p(Pro)在它上方一行,Elo 1000,每分钟 10.08 美元。不寻常之处在于它与自家上一代之间的差距——用 52 Elo 换取 44% 的降价,这个质量让渡比通常“次旗舰”折扣所付出的代价更小,而正是这个比值撑起了公告中的前沿宣言。这也正是为什么这是一次真正的选择,而非一个营销层级。

A capture of the OrcaRouter models page, showing the model catalogue with vendor groupings and model entries.

哪一个,根据输出?

If your clips are watched where they are generated — social, mobile, review, iteration — Grok Video 1. Lite is the model to start with, at $8.40 per minute, a hundred experiments cost less than twenty deliveries. Regenerate the survivors on the full model. 如果你的剪辑是在它们被生成的地方被观看的——社交、移动端、审阅、迭代——那就从 Grok Video 1. Lite 这个模型开始,每分钟 8.40 美元,一百次实验的成本还不到二十次交付。在完整模型上重新生成存活下来的那些。

如果你的片段是要交付成品而非仅供观看——经过裁剪、抠像、调色、按规格交付——那就彻底跳过 Lite,直接付 15.00 美元。Grok Imagine Video 1.5 是这两者中唯一能输出原生 1080p 的模型,而如果交付成果需要重新生成,那么按秒省下的那点成本再怎么攒也救不回来。

几乎没有人需要同时用到两者。任何大批量生成的人最终都会两者都用,顺序就是这样——先用 Lite 找到那一镜,再用完整模型把它留住。