一张生成的标题卡,上面写着“Kandinsky 6.0 Video 对比 Grok Imagine Video”,副标题为“排行榜易主”,其下方是一行图标,分别标注为“视频生成”“同步音频”和“开放权重部署”。OrcaRouter 标志位于右下角。
Guides & Insights

Kandinsky 6.0 Video vs Grok Imagine Video:排行榜易主

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年1月,当Grok Imagine Video发布时,它在两种模式下都登顶了 Artificial Analysis 视频竞技场。如今,同一榜单将其当前版本在文生视频中排在第11或第12位。这不是丑闻,也不是失败——这就是一个快速发展的类别在九个月里会发生的事,也正是现在将 xAI 的生成模型与Kandinsky 6.0 Video进行比较的诚实理由。其中之一是一项针对你能多快再生成一个片段而优化的服务;另一个是 MIT 许可的检查点,Pro 尺寸为 29B 参数,Lite 为 3B,由 Sber 的 Kandinsky Lab 于 2026 年 10 月第一周发布,可生成五秒视频,并带有同步的 44 kHz 音频和唇形同步。有趣的问题不是哪一个在榜单上领先——而是它们各自在结构上接下来能够做什么。

在它下方移动的那块板

Grok Imagine Video 是 xAI 的生成模型,于 2026 年 1 月 29 日首次发布,自 6 月 16 日起稳定在 1.5 版本。在 Artificial Analysis 的文生视频排行榜上,其 1.5 版本以 Elo 1,045(±9)的分数、基于 4,056 张投票位列第 11–12 名,标价为每分钟 15.00 美元。最初的版本并未出现在该榜单上。

图像转视频是该系列表现更强的地方,也是两个构建版本以值得仔细研读的方式分道扬镳之处:

• grok-imagine-video-1.5 — 第7–9名,Elo 1,098(±8),5,267 票,$8.40/分钟。

• grok-imagine-video(一月版本)——第 12–17 名,Elo 1,072(±7),14,371 票,$4.20/分钟。

• 作为参照,该 I2V 榜单的榜首——MiniMax H3 Max——在 5,894 票下 Elo 为 1,195(±9),而 Wan 3.0 以 1,164 位列第六。

以下有两种解读,而两者都成立。xAI 较新的版本在图像生视频上确实领先自己的上一代 26 Elo,而代价是每分钟的花费翻了一倍。至于发布周的那个故事——一个一登场便登顶的模型——并没有维持住:赛道在变,竞技场在十几个更新的系统上累积了数万张选票,而九个月的角逐之后,一个快速、通用的生成器所处的位置正是中游。

Kandinsky 6.0 Video 在任何榜单上都没有 Elo 评分。其依据是一次 VABench 测试和一次由实验室开展的人工评估,两者均由 Sber 发布,且均未在该机构之外得到复现。把未经审计的开源模型与已有评分的商业模型并列,恰恰是那种需要谨慎对待的比较:有评分的模型,其位置是真实且并不好看的;而未评分的模型,其位置则无从得知。“未知”不等于“更好”。

快有两种,而其中只有一种是用秒来衡量的

Grok Imagine Video 的设计目标是提升每位创作者的生产吞吐量。它深度接入 X,返回带声音的成品片段,其功能集就像一份列人们在信息流中实际会做的事情的清单:多种宽高比、镜头运动、对象添加、移除与替换、风格迁移、基于多张图像的参考条件生成以实现角色一致性、包含对白、音效和音乐的原生音频。片段时长最长可达十五秒,分辨率最高为 1080p。整个产品的构建方式,使得第二次尝试只需花费几分钟和几美分。

Kandinsky 6.0 Video 的快是另一种意义上的快——不是体现在每次尝试上,而是体现在每一份所有权上。它没有任何环节是瞬时的。该仓库自己给出的非蒸馏模型运行时间(预热之后,且不计权重加载和 MP4 编码)显示,一段五秒的 Pro Full HD 片段在 H100 上约为 402 秒,在 RTX 5090 上为 854 秒,在 RTX 4090 上为 1,247 秒,在 RTX 5060 Ti 上为 3,530 秒。Lite Full HD 在 H100 上为 284 秒。让这一切变得尚可忍受的工具是蒸馏检查点,论文测得它与完整模型持平——在多数评判标准上更受偏好或与之打平,平均偏好为 51% 对 49%,没有任何单项差异达到显著。作为渲染缓慢的交换,你得到的是躺在自己磁盘上的模型,完全没有按片段运行的计量器。

这才是这场对决的真正格局。Grok Imagine Video 优化的是第十次尝试的成本。Kandinsky 6.0 Video 优化的是第一万次尝试的成本,而代价是让你在硬件和耐心上为第一次尝试买单。

两者都能生成音频——但这两者并不是同一个主张

这是一个如果做草率比较就会说成“平局”却实则判断错误的维度。

Grok Imagine Video 生成原生音频,包括对话、音效和音乐,作为众多功能之一。它是一个恰好包含声音的通用生成器。

Kandinsky 6.0 Video 以声音为核心构建。该架构是双流 CrossDiT,将由 Kandinsky 5.0 Video 初始化的视频流与在大型音频语料库上从零开始训练的音频流配对,通过双向交叉注意力连接,并进行联合训练。输出为 44 kHz,并具有显式唇形同步;论文的强化学习阶段据称将生成语音的词错误率降低了 47%——使用 Whisper-large-v3 测量,而 Whisper-large-v3 正是 RL 奖励模型之一;这一细节很重要,因为论文还报告了另一个不可比的 WER,与 VABench 并列,使用 Qwen3-ASR-1.7B 测得。语音正是该模型进行后训练所针对的对象。

相比之下,Sber 自己的研究坦率地指出了它在哪些方面处于劣势。在该实验室的并排评估中,MiniMax H3 和 Dreamina Seedance 2.0 在视觉标准上以显著优势更受青睐,而该模型被描述为具有竞争力而非领先。真正值得认真对待的说法更具体也更实用:在与 Kling 2.6 和 Veo 3.1 Fast 的对比中,结果逐项标准互有胜负,而 Kandinsky 6.0 Video 在语音质量和音视频同步方面仍保持竞争力,其中很大一部分比较结果持平。

十五秒对五秒,以及达到各自所需付出的代价

• 最大片段 — Grok Imagine Video:最长可达 15 秒。Kandinsky 6.0 Video:固定 5 秒,24 帧/秒下共 121 帧,发布版本中无扩展模式。

• 分辨率 — Grok Imagine Video:最高支持 1080p。Kandinsky 6.0 Video:通过专用超分辨率模型实现 SD、HD 和 Full HD,可将五秒片段放大至 x2、x4 或 x2.25。

• 参考输入 —— Grok Imagine Video:基于多张图像进行参考条件生成以实现角色一致性,并支持对象的添加/移除/替换。Kandinsky 6.0 Video:单张图像,作为掩码尾帧应用。

• 定价 — Grok Imagine Video:按输出时长每秒计费,价格从区间低端一直延伸到 1080p 下最高 $0.30/秒,且每输入一张图像额外收费;免费使用权限则须通过 X 的订阅层级获取。Kandinsky 6.0 Video:无——没有服务,没有费率,只有你自己提供的 GPU 时间。

• 权重 — Grok Imagine Video:无。Kandinsky 6.0 Video:MIT,Pro 和 Lite,并支持 diffusers 集成。

较新 Grok 版本的溢价才是那个值得圈出来的数字。从 1 月版本换到 1.5,在图生视频榜单上每分钟成本翻了一倍,换来的是 26 个 Elo 分。这是实打实的提升,也标着实打实的价格,而这正是眼下每一家视频厂商都在要求买家做的同一笔取舍。

路由器适合用在哪里,又不适合用在哪里

OrcaRouter 不提供 Grok Imagine Video 或 Kandinsky 6.0 Video,本文也没有任何相反的说法:Kandinsky 可由你自行下载和运行,Grok Imagine Video 则通过 xAI 自己的渠道访问。基于其中任一模型构建的流水线,需要路由器提供的是渲染周边的文本——分镜清单、把想法变成这些模型训练时所用长描述或短描述的提示词扩展、描述生成与转录工作,以及决定保留哪次生成结果的评审摘要。这些都通过一个 OpenAI 兼容端点运行,覆盖 200 多个文本模型,按提供商标价、0% 加价,因此供应商降价一旦落地,当天就会在同一密钥上生效,并具备自动故障转移,让渲染队列中途失败的调用重新路由,而不是拖住整批任务。即使视频模型本身不可路由,围绕视频模型的编排仍是一个路由问题;今天这两个模型都是如此。

哪一个,用来做什么?

当活儿拼的是量时,就该选 Grok Imagine Video:社交短片、快速迭代、一个要重生成六次才能满意的镜头,还有不会往后拖的截止日期。它按次付费的定价本身就是产品,而它如今位居中游而非榜首,正是一个变化如此之快的品类所要付出的正常代价。

当工作是一条流水线时,就该选 Kandinsky 6.0 Video:可批量处理的固定五秒单元、以对所提供的静帧之还原度为核心的图生视频环节、你希望清晰可懂的语音,以及一份你宁愿不必租用的成品。为渲染留出预算,在任何消费级硬件上都别指望它快,并且把本文中的每一项质量数据都当作 Sber 自家之言,直到实验室之外有人给它打分为止。

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Grok Imagine Video — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'T2V Elo: not scored', 'I2V Elo: not scored', 'Audio: 44 kHz, always on', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Grok Imagine Video column reads 'Max clip: up to 15s', 'T2V Elo: 1,045, 11th', 'I2V Elo: 1,098, 7th', 'Audio: native, optional', 'Weights: none', 'Price: $4.20 to $15.00/min'. A footer reads 'Grok figures per Artificial Analysis; Kandinsky unscored. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-I2V V1.0 leaderboard, ranking image-to-video models by Elo from pairwise human preference votes with audio. MiniMax H3 Max is first at 1,195 over 5,894 samples at $4.80 per minute (Aug 2026); MiniMax H3 is second at 1,181 over 7,284 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,178 over 12,327 samples at $6.00 per minute (May 2026); Wan 3.0 is sixth at 1,164 over 9,302 samples at $12.00 per minute (Aug 2026); grok-imagine-video-1.5 is eighth at 1,098 over 5,267 samples at $8.40 per minute (May 2026); Wan 2.7 is twelfth at 1,077 over 4,571 samples at $9.00 per minute (Apr 2026); grok-imagine-video is thirteenth at 1,072 over 14,371 samples at $4.20 per minute (Jan 2026). The board carries a note that AA-Video-I2V v2.0 is coming soon.

让这对组合值得关注的是,哪一方能扛住一个糟糕的季度。如果 Grok Imagine Video 在竞技场中进一步下滑,答案就是一个更好的模型和一个新的价格——这个品类就是这样运作的,而 xAI 已经表明它会推出一个。如果 Kandinsky 6.0 Video 在被评分后最终处于中游,那个检查点依然存在,依然能运行,依然能微调;许可证不会因为那个数字而改变任何东西。那是不同种类的持久力,而其中只有一种是由 Elo 衡量的。

A screenshot of OrcaRouter's own model page for kling/kling-v3-omni, titled 'kling/kling-v3-omni' with a FLAGSHIP badge and credited to Kling, showing the route endpoint /v1/video/generations and a per-request price of $0.08, with a description reading that Kling 3.0 Omni is a unified text-to-video and image-to-video API with multi-shot, subject control and video-reference, 3-15 second clips and up to native 4K.