
Kandinsky 6.0 Video 对比 Google Veo 3.1:三档对两种尺寸
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 150 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
打开 Sber 为 Kandinsky 6.0 Video发布的技术报告,找到正面对比(head-to-head)章节,你就会发现一个对比页面都未曾提及的细节:它的对手并不是 Veo 3.1,而是 Veo 3.1 Fast。Sber 的人类评估对标的是 Veo 三个层级中的中间那一档,而仅凭这一选择,就比其中任何一句质量主张都更能说明这场对决的实质。Veo 3.1 自 2025 年 11 月 17 日起以三个服务层级全面开放;Kandinsky 6.0 Video 则在 2026 年 10 月第一周推出,提供两种可下载规格——Pro 为 290 亿参数,Lite 为 30 亿参数,采用 MIT 许可。前者是按秒购买的服务,后者是你自行运行的检查点——而真正决定取舍的,是层级问题,而非质量问题。
Veo 3.1 是三款共用同一个名字的产品
Google 的模型已在 Standard、Fast 和 Lite 中全面可用,三者都生成相同的格式系列:720p、1080p 和原生 4K,24 fps;原生时长为 4、6 或 8 秒,更长的输出据称可在 1080p 下实现,并可通过场景扩展链进一步延长;最多可使用三张参考图像来保持角色和场景一致性;此外还有种子和负面提示词控制。输出带有 SynthID 和 C2PA 溯源元数据。
区分这些档位的是价格和速度,而这份独立榜单对这种差距给出了令人不安的说法。在 Artificial Analysis 的文生视频排行榜上,三者彼此相差在 14 Elo 以内——Veo 3.1 为 962(±10),基于 2,998 票;Veo 3.1 Fast 为 961(±10),基于 4,325 票;Veo 3.1 Lite 为 948(±10),基于 2,903 票——而它们标出的费率分别是每分钟 $24.00、$7.20 和 $4.80。把这些放在一起看,这个竞技场是在告诉你:它无法可靠地按偏好区分这些档位。这并不意味着各档位完全相同;它意味着,买家真正的问题是哪个档位能跨过他们的门槛,因为偏好榜单不会替他们回答这个问题。
Kandinsky 6.0 Video 在变化性方面采取了相反的思路。它有两个规模版本——29B 的 Pro 和 3B 的 Lite——共用同一套架构和同一种固定输出格式:5 秒、24 fps 下的 121 帧、同步的 44 kHz 音频并支持唇形同步,输入可以是文本或参考图像,另有一个独立的超分辨率模型将结果提升至 Full HD。它没有 Fast 变体,也没有延长模式。你只需选择规模版本和 GPU。
实验室自己的评估实际声称的内容
这是这两个系统之间唯一存在的直接对比数据,而且斜杠两侧的数据都由厂商自行报告——是 Sber 运行的,是 Sber 发布的,而 Sber 之外的任何人都不曾复现过。准确陈述此事,比有利陈述更重要。
在文本到音视频模式中,报告显示 Kandinsky 6.0 Video Pro 在伪影和镜头运动方面更受偏好,且优势具有统计显著性,并在平局居多的运动真实感方面略微领先。Veo 3.1 Fast 在视觉提示词遵循、语音质量、音视频同步、整体音频质量、声音提示词遵循和用户任务解决方面领先,除语音外均达到显著性。整体视觉质量几乎持平,Veo 略占优势。
在图像到视频方面,这一模式在视觉这一半发生了反转。Kandinsky 6.0 Video Pro 在整体视觉质量、参考图像对齐、伪影和镜头运动方面更受青睐,且均具有显著性。Veo 3.1 Fast 仍在视觉提示遵循、音视频同步、整体音频质量、声音提示遵循和用户任务解决方面保持领先,同样具有显著性。运动真实感和语音质量则接近持平。
接下来有两点。图生视频的结果才是真正的发现:一个开放模型在参考图像一致性和整体视觉质量上被判定优于 Google 级别,而且是在该实验室自己的研究中,这是一个值得认真权衡的真实主张。而音频结果则是 Veo 无论何种模式都保持领先之处——这就把我们带到了那个无人提及的警示信号。
决定该评估是否公平的音频标志
Veo 3.1 可原生生成 48 kHz 立体声音频——对白、环境音、拟音——并与画面联合生成。这是该模型最强大的功能之一。不过在 API 上,audio 参数默认关闭,而且无声生成的定价低于带音频生成:在 Google 公布的 Standard 档位下,无声生成约为每秒 $0.20,带音频则约为每秒 $0.40。
Kandinsky 6.0 Video 没有这样的开关。音频是输出的一部分,而合并进 vLLM-Omni 的服务管线默认输出 44.1 kHz AAC。因此,这两个模型面对的默认设置并不相同:一个是音频优先,另一个是静音优先,声音则作为升级项。
这种不对称在对比中会带来特定代价。任何让无声的 Veo 3.1 与一个音频始终随附的竞品正面对决、再在音频感知榜单上给这两者打分的做法,都会因为一个默认设置上的意外而让 Veo 处于劣势。当你读到上面 Sber 的数据——或任何其他人的数据——时,首先要问的是 Veo 那一侧是否开启了音频。第二个问题是价格差是多少,因为在 Standard 档位,开启声音会让价格翻倍。
五秒对八秒,以及 1080p 对原生 4K
格式上的差距,正是两款模型设计简报显现的地方。
• 片段长度 — Kandinsky 6.0 Video:固定 5 秒,24 fps 下 121 帧,不支持延长。Veo 3.1:原生 4、6 或 8 秒,1080p 下可更长,超出后可通过场景扩展链接延长。
• 分辨率 — Kandinsky 6.0 Video:通过超分辨率处理提供 SD、HD 和全高清(1920×1080)。Veo 3.1:720p、1080p 和原生 4K。
• 溯源 — Kandinsky 6.0 Video:发布中未声明任何溯源信息。Veo 3.1:输出内容带有 SynthID 和 C2PA 元数据。
• 参考输入 — Kandinsky 6.0 Video:一张图像,作为遮罩尾帧应用。Veo 3.1:最多三张参考图像,外加种子和负向提示词。
• 格式 — Kandinsky 6.0 Video:44.1 kHz AAC,随画面始终开启。Veo 3.1:48 kHz 立体声,可选,有两种定价方式。
溯源这一项,才是真正会带来采购后果的那一条。如果你的交付物必须可追溯——品牌项目、广播内容,任何法务团队会过目的东西——Veo 3.1 会附带标明素材为生成内容的元数据,而 Kandinsky 6.0 Video 不会。这不是质量差异,任何基准测试也测不出来,但它属于那种本身就能决定选哪家供应商的硬性要求,而一个缺少这项能力的开源模型,对需要它的团队来说并不是能直接顶替的替代品。
4K 这条线同样重要,原因也一样。Kandinsky 6.0 Video 的 Full HD 是实打实的——有专门的 SR 模型,仓库里的 SR 包能处理五秒片段的 x2、x4 和 x2.25 超分——但它的上限,恰好是 Veo 3.1 原生路径在高端起步的地方。对于大屏制作来说,这个上限没有商量余地。
每一方一个片段的成本是多少
Veo 3.1 按秒计费。在 Standard 档位,一段带音频的五秒 1080p 视频约为 2.00 美元,而同样一段无声视频约为 1.00 美元;Fast 和 Lite 的价格都低于此,而且由于它们在竞技场中的得分落在 Standard 的置信区间内,从证据来看,很难对更便宜的档位提出异议。
Kandinsky 6.0 Video 没有账单。它消耗的是 GPU 时间。仓库中针对非蒸馏模型的数字——在预热后测得,并排除了权重加载和 MP4 编码——显示一段五秒的 Pro Full HD 片段在 H100 上约为 402 秒,在 RTX 5090 上为 854 秒,在 RTX 4090 上为 1,247 秒,在 RTX 5060 Ti 上为 3,530 秒。Lite Full HD 在 H100 上为 284 秒。Pro SD 运行的峰值分配达到 72.8 GiB,因此任何低于该值的配置都需要块卸载——而 16 GB 预设将文本编码器量化为 NF4,这是论文确认会改变片段本身、而非仅引入舍入级噪声的唯一预设改动。
这两种成本结构根本不能相提并论。一种是按成片秒数预估的账单;另一种是你买下的机器、以分钟计的渲染,以及微调的选项——而 Veo 3.1 在任何档位都不提供这些。
层级问题是一个路由问题
OrcaRouter 既不提供 Google Veo 3.1,也不提供 Kandinsky 6.0 Video,此处也并未暗示这一点——Veo 3.1 需经由 Google 自家的渠道获取,而 Kandinsky 则需你自行下载。但 Veo 这一决策的结构值得点明,因为它正是我们的路由层在文本侧致力于解决的问题:三个档位,各自独立的评分难分伯仲,价格却相差五倍——这正是“先路由到便宜的那个,只有在未达标时才升级”胜过“统一采用旗舰款”的典型情形。OrcaRouter 的自适应路由与路由 DSL 将这一点表达为一项可配置策略,覆盖单一 OpenAI 兼容端点上的 200 多个文本模型,按供应商标价、0% 加价,并在某条路由故障时自动故障转移。把同样的直觉用于视频开销——默认用 Fast,重要镜头用 Standard——是你在今天无需任何路由器就能做出的采购决策。
哪一个,给谁
如果需要认真对待声音,如果交付物需要 4K 或时长超过五秒的片段,或者下游有人要求来源元数据,就选择 Veo 3.1。要有意识地挑选档位,而不是默认选 Standard;并且提前把音频标记的费用纳入预算,而不是等到看账单时才发现。
如果你想要的是权重、五秒正好契合你的工作单元,并且任务是对照一张给定静帧的图像到视频保真度——这是该实验室自己的研究显示它能以一个 Veo 层级显著幅度领先的唯一维度——那就选 Kandinsky 6.0 Video。上手前要知道:音频始终开启,出处信息缺失,而质量方面的说法完全依赖于其作者自己撰写的一份报告。


值得把握的不对称性在于:Veo 3.1 已经投入生产十一个月,因此积累了一个本月发布的开源模型无法拥有的东西:一套其用户已经公开的、已梳理成图谱的失效模式,以及一条财务团队可以建模的价格曲线。与之相对,Kandinsky 的 MIT 许可证意味着你磁盘上的模型不依赖任何人的路线图。这两者哪个更有价值,并不是一个基准测试问题。

