
Kandinsky 6.0 Video vs Grok Imagine Video:排行榜易主
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 150 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
2026年1月,当Grok Imagine Video发布时,它在两种模式下都登顶了 Artificial Analysis 视频竞技场。如今,同一榜单将其当前版本在文生视频中排在第11或第12位。这不是丑闻,也不是失败——这就是一个快速发展的类别在九个月里会发生的事,也正是现在将 xAI 的生成模型与Kandinsky 6.0 Video进行比较的诚实理由。其中之一是一项针对你能多快再生成一个片段而优化的服务;另一个是 MIT 许可的检查点,Pro 尺寸为 29B 参数,Lite 为 3B,由 Sber 的 Kandinsky Lab 于 2026 年 10 月第一周发布,可生成五秒视频,并带有同步的 44 kHz 音频和唇形同步。有趣的问题不是哪一个在榜单上领先——而是它们各自在结构上接下来能够做什么。
在它下方移动的那块板
Grok Imagine Video 是 xAI 的生成模型,于 2026 年 1 月 29 日首次发布,自 6 月 16 日起稳定在 1.5 版本。在 Artificial Analysis 的文生视频排行榜上,其 1.5 版本以 Elo 1,045(±9)的分数、基于 4,056 张投票位列第 11–12 名,标价为每分钟 15.00 美元。最初的版本并未出现在该榜单上。
图像转视频是该系列表现更强的地方,也是两个构建版本以值得仔细研读的方式分道扬镳之处:
• grok-imagine-video-1.5 — 第7–9名,Elo 1,098(±8),5,267 票,$8.40/分钟。
• grok-imagine-video(一月版本)——第 12–17 名,Elo 1,072(±7),14,371 票,$4.20/分钟。
• 作为参照,该 I2V 榜单的榜首——MiniMax H3 Max——在 5,894 票下 Elo 为 1,195(±9),而 Wan 3.0 以 1,164 位列第六。
以下有两种解读,而两者都成立。xAI 较新的版本在图像生视频上确实领先自己的上一代 26 Elo,而代价是每分钟的花费翻了一倍。至于发布周的那个故事——一个一登场便登顶的模型——并没有维持住:赛道在变,竞技场在十几个更新的系统上累积了数万张选票,而九个月的角逐之后,一个快速、通用的生成器所处的位置正是中游。
Kandinsky 6.0 Video 在任何榜单上都没有 Elo 评分。其依据是一次 VABench 测试和一次由实验室开展的人工评估,两者均由 Sber 发布,且均未在该机构之外得到复现。把未经审计的开源模型与已有评分的商业模型并列,恰恰是那种需要谨慎对待的比较:有评分的模型,其位置是真实且并不好看的;而未评分的模型,其位置则无从得知。“未知”不等于“更好”。
快有两种,而其中只有一种是用秒来衡量的
Grok Imagine Video 的设计目标是提升每位创作者的生产吞吐量。它深度接入 X,返回带声音的成品片段,其功能集就像一份列人们在信息流中实际会做的事情的清单:多种宽高比、镜头运动、对象添加、移除与替换、风格迁移、基于多张图像的参考条件生成以实现角色一致性、包含对白、音效和音乐的原生音频。片段时长最长可达十五秒,分辨率最高为 1080p。整个产品的构建方式,使得第二次尝试只需花费几分钟和几美分。
Kandinsky 6.0 Video 的快是另一种意义上的快——不是体现在每次尝试上,而是体现在每一份所有权上。它没有任何环节是瞬时的。该仓库自己给出的非蒸馏模型运行时间(预热之后,且不计权重加载和 MP4 编码)显示,一段五秒的 Pro Full HD 片段在 H100 上约为 402 秒,在 RTX 5090 上为 854 秒,在 RTX 4090 上为 1,247 秒,在 RTX 5060 Ti 上为 3,530 秒。Lite Full HD 在 H100 上为 284 秒。让这一切变得尚可忍受的工具是蒸馏检查点,论文测得它与完整模型持平——在多数评判标准上更受偏好或与之打平,平均偏好为 51% 对 49%,没有任何单项差异达到显著。作为渲染缓慢的交换,你得到的是躺在自己磁盘上的模型,完全没有按片段运行的计量器。
这才是这场对决的真正格局。Grok Imagine Video 优化的是第十次尝试的成本。Kandinsky 6.0 Video 优化的是第一万次尝试的成本,而代价是让你在硬件和耐心上为第一次尝试买单。
两者都能生成音频——但这两者并不是同一个主张
这是一个如果做草率比较就会说成“平局”却实则判断错误的维度。
Grok Imagine Video 生成原生音频,包括对话、音效和音乐,作为众多功能之一。它是一个恰好包含声音的通用生成器。
Kandinsky 6.0 Video 以声音为核心构建。该架构是双流 CrossDiT,将由 Kandinsky 5.0 Video 初始化的视频流与在大型音频语料库上从零开始训练的音频流配对,通过双向交叉注意力连接,并进行联合训练。输出为 44 kHz,并具有显式唇形同步;论文的强化学习阶段据称将生成语音的词错误率降低了 47%——使用 Whisper-large-v3 测量,而 Whisper-large-v3 正是 RL 奖励模型之一;这一细节很重要,因为论文还报告了另一个不可比的 WER,与 VABench 并列,使用 Qwen3-ASR-1.7B 测得。语音正是该模型进行后训练所针对的对象。
相比之下,Sber 自己的研究坦率地指出了它在哪些方面处于劣势。在该实验室的并排评估中,MiniMax H3 和 Dreamina Seedance 2.0 在视觉标准上以显著优势更受青睐,而该模型被描述为具有竞争力而非领先。真正值得认真对待的说法更具体也更实用:在与 Kling 2.6 和 Veo 3.1 Fast 的对比中,结果逐项标准互有胜负,而 Kandinsky 6.0 Video 在语音质量和音视频同步方面仍保持竞争力,其中很大一部分比较结果持平。
十五秒对五秒,以及达到各自所需付出的代价
• 最大片段 — Grok Imagine Video:最长可达 15 秒。Kandinsky 6.0 Video:固定 5 秒,24 帧/秒下共 121 帧,发布版本中无扩展模式。
• 分辨率 — Grok Imagine Video:最高支持 1080p。Kandinsky 6.0 Video:通过专用超分辨率模型实现 SD、HD 和 Full HD,可将五秒片段放大至 x2、x4 或 x2.25。
• 参考输入 —— Grok Imagine Video:基于多张图像进行参考条件生成以实现角色一致性,并支持对象的添加/移除/替换。Kandinsky 6.0 Video:单张图像,作为掩码尾帧应用。
• 定价 — Grok Imagine Video:按输出时长每秒计费,价格从区间低端一直延伸到 1080p 下最高 $0.30/秒,且每输入一张图像额外收费;免费使用权限则须通过 X 的订阅层级获取。Kandinsky 6.0 Video:无——没有服务,没有费率,只有你自己提供的 GPU 时间。
• 权重 — Grok Imagine Video:无。Kandinsky 6.0 Video:MIT,Pro 和 Lite,并支持 diffusers 集成。
较新 Grok 版本的溢价才是那个值得圈出来的数字。从 1 月版本换到 1.5,在图生视频榜单上每分钟成本翻了一倍,换来的是 26 个 Elo 分。这是实打实的提升,也标着实打实的价格,而这正是眼下每一家视频厂商都在要求买家做的同一笔取舍。
路由器适合用在哪里,又不适合用在哪里
OrcaRouter 不提供 Grok Imagine Video 或 Kandinsky 6.0 Video,本文也没有任何相反的说法:Kandinsky 可由你自行下载和运行,Grok Imagine Video 则通过 xAI 自己的渠道访问。基于其中任一模型构建的流水线,需要路由器提供的是渲染周边的文本——分镜清单、把想法变成这些模型训练时所用长描述或短描述的提示词扩展、描述生成与转录工作,以及决定保留哪次生成结果的评审摘要。这些都通过一个 OpenAI 兼容端点运行,覆盖 200 多个文本模型,按提供商标价、0% 加价,因此供应商降价一旦落地,当天就会在同一密钥上生效,并具备自动故障转移,让渲染队列中途失败的调用重新路由,而不是拖住整批任务。即使视频模型本身不可路由,围绕视频模型的编排仍是一个路由问题;今天这两个模型都是如此。
哪一个,用来做什么?
当活儿拼的是量时,就该选 Grok Imagine Video:社交短片、快速迭代、一个要重生成六次才能满意的镜头,还有不会往后拖的截止日期。它按次付费的定价本身就是产品,而它如今位居中游而非榜首,正是一个变化如此之快的品类所要付出的正常代价。
当工作是一条流水线时,就该选 Kandinsky 6.0 Video:可批量处理的固定五秒单元、以对所提供的静帧之还原度为核心的图生视频环节、你希望清晰可懂的语音,以及一份你宁愿不必租用的成品。为渲染留出预算,在任何消费级硬件上都别指望它快,并且把本文中的每一项质量数据都当作 Sber 自家之言,直到实验室之外有人给它打分为止。


让这对组合值得关注的是,哪一方能扛住一个糟糕的季度。如果 Grok Imagine Video 在竞技场中进一步下滑,答案就是一个更好的模型和一个新的价格——这个品类就是这样运作的,而 xAI 已经表明它会推出一个。如果 Kandinsky 6.0 Video 在被评分后最终处于中游,那个检查点依然存在,依然能运行,依然能微调;许可证不会因为那个数字而改变任何东西。那是不同种类的持久力,而其中只有一种是由 Elo 衡量的。

