
Kandinsky 6.0 Video 与 Seedance 2.5:论文中的版本并非你买到的版本
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 150 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
这场对比中被引用最多的一句话,是拿错误的模型来做比较。Kandinsky 6.0 Video 技术报告于 2026 年 10 月 6 日随 MIT 许可发布的权重一同公布,其基准测试的对比对象是Dreamina Seedance 2.0——上一代模型。Seedance 2.5,即字节跳动当前的视频与音频模型,自 2026 年 7 月 31 日起便已交付,也正是如今在售的那一个。所以,当报告得出结论称 Seedance“在视觉标准上更受青睐,且在整体视觉质量、伪影、运动真实感和视觉提示词遵循方面均具有统计显著的领先优势”时,它描述的其实是一个你今天无法获得授权的版本,评估方还是撰写Kandinsky 6.0 Video的那家实验室。这句话的两半都很重要,而两者都不是忽视这项比较的理由——版本差距为它能告诉你的信息量划定了下限,而叙述的立场则告诉你,在哪些方面该信任谁。
两个 Seedance 版本之间有什么变化
从 2.0 到 2.5 的这一步并非重绘,正因如此,这种替换才不是表面功夫。Seedance 2.5 单次即可生成最长三十秒的内容——是报告中该模型时长的六倍,也是 Kandinsky 6.0 Video 固定五秒的六倍。它新增了时间戳级定位与区域级生成后编辑,意味着可以把改动应用到片段的某个时间窗口或画面的某个局部,而无需重新生成整段内容。它能在一次请求中读取文本以及约三十张图像、十段视频和十段音频作为参考素材,相比之下 Kandinsky 6.0 Video 只能使用单张带掩码的尾帧。而且它能生成带对白的同步音频,这正是这两者会被放进同一篇文章的唯一原因。
其中每一项都是该报告的评估没有测试过的能力。因此,视觉质量结果告诉你,Kandinsky 6.0 Video 在整体视觉质量、伪影、运动真实感和提示词遵循方面落后于 Seedance 的上一代。它并没有告诉你当前版本会表现如何,而诚实的假设是,新一代不会在其自身发布说明所强调的维度上变得更差。
报告自身的评估确立了什么、没有确立什么
该方法披露得足够详尽,可供评判。由两个模型基于同一提示生成的并排配对,两个片段均作匿名化处理,每个任务中左右位置随机化,任务顺序打乱,视觉问题先禁用音频,随后对音频问题启用音频,提供对称的平局选项,以及在某个标准无法评判时提供明确的 N/A 选项,跨标注者进行多数投票汇总,并且对每个被评估标准进行约 200 次或更多成对比较。
在该方法上,Seedance 2.0 的结果出现了分化,任何读过同一份报告中 Kling 对比部分的人都会觉得这种分化似曾相识。视觉指标以明显超过显著性阈值的差距归于 Seedance。音频领域则接近得多:音视频同步几乎持平,而语音质量更有利于 Kandinsky 6.0 Video Pro。整个决策就位于这两句话之间,因为这意味着最新的开放音视频检查点在片段看起来如何上可测量地落后,而在其中的语音听起来如何上可测量地领先。
该结果的局限性都是常见的那类,其中没有一条对它是致命的。它是由 Kandinsky 的作者们使用他们自行选择的提示词、并由他们招募的标注员跑出来的。没有任何公开盲测竞技场对 Kandinsky 6.0 Video 进行评分,因此没有任何外部测试检验过陌生人的提示词能否复现这一差距。报告还披露了它所比照的上限:最长五秒的片段,基础生成在 SD 分辨率下完成,并通过超分辨率阶段达到 Full HD,以及在视觉质量和整体音频质量上与最强专有系统仍存在的差距。
任何基准测试都无法捕捉的三个结构性缺口
时长是最首要、也最直白的问题。Kandinsky 6.0 Video 的训练与评估都在 121 帧上进行,推理也在 121 帧,即 24 fps 下的 5 秒,且发布时不提供任何续接模式——一段三十秒的片子意味着六次生成、五次拼接,以及由你自己承担的连贯性风险。Seedance 2.5 一次生成就能完成三十秒。对于一段对话往来、一次产品走查,或任何拼接处会被看见的场景,这并非基准测试上的差异;它决定的是这件事究竟只是一次渲染,还是多出了一道组装工序。
第二个是参考条件化,而这种不对称性十分鲜明。Kandinsky 6.0 Video 取一张参考图像,将其作为经过掩码的尾帧来应用——一个可供插值趋近的关键帧。Seedance 2.5 则把大约三十张图像、十个视频片段和十个音频片段组成的工作集当作一个上下文。序列中的角色一致性、从情绪板进行的风格迁移、从现有片段带入的表演:这些正是参考数量所能支撑、而单帧模式不会尝试的工作负载。
第三点在于可编辑性,它改变的是整个工作流程,而不只是单次生成。区域级与时间戳级编辑意味着,一个有瑕疵的三秒片段可以就地修复。Kandinsky 6.0 Video 没有可编辑的界面——糟糕的五秒钟只能重新生成,而如果它与其他四段拼接在一起,接缝处也得一并重新考量。那些把重渲染当作常态来核算成本的团队,应该把这一差异计入模型选型的评估中,而不是等到用起来才发现。
• 时长 — Kandinsky 6.0 Video:固定为 5 秒,24 fps 下 121 帧,无扩展模式。Seedance 2.5:单次处理最长可达 30 秒。
• 参考条件控制 — Kandinsky 6.0 Video:一张图像,作为带遮罩的尾帧应用。Seedance 2.5:每次请求约三十张图像、十个视频和十个音频片段。
• 编辑 — Kandinsky 6.0 Video:无;重新生成并重新拼接。Seedance 2.5:时间戳级定位与区域级生成后编辑。
• 分辨率 — Kandinsky 6.0 Video:标清为 512×768,全高清 1920×1080 则通过内置超分辨率处理阶段实现。Seedance 2.5:取决于具体模式,每段视频的价格由您所选择的分辨率决定。
• 音频 — Kandinsky 6.0 Video:44 kHz,具备唇形同步,与画面联合生成。Seedance 2.5:同步音频,含对话,随视频一并生成。
• 权重 — Kandinsky 6.0 Video:MIT,Lite 3B 和 Pro 29B,附带代码与 diffusers 集成。Seedance 2.5:无。
两个不能相互转换的仪表
Seedance 2.5 按 token 计量,一段五秒的 480p 片段约为 $0.51,720p 则约为 $1.16。之所以这样表述,而不是给出每秒费率,是因为 token 数量会随素材时长成比例增长,所以一次三十秒的生成并不是按固定费率乘以三十秒——在相同设置下,它是五秒生成 token 量的六倍,而编辑操作则按其触及的内容计价。一条习惯性反复重新生成的流水线会发现,计费表会对这一习惯作出反应。
Kandinsky 6.0 Video 没有计费表,因为没有什么可买的。它的成本是一台机器和一只时钟,而报告提供了这只时钟:一段 Pro Full HD 五秒片段在 H100 上大约需要 402 秒的工作时间,在 RTX 5090 上为 854 秒,在 RTX 4090 上为 1,247 秒;低于 72.8 GiB 峰值分配时需要启用块卸载;还有一个 16 GB VRAM 预设,可将文本编码器量化为 NF4——报告称,这是唯一一个会改变片段本身的预设改动。那个蒸馏检查点——经测量与完整模型持平,平均偏好为 51% 对 49%,且没有任何标准达到统计显著性——正是让这些数字变得可行的关键。
• 每五秒成本 — Kandinsky 6.0 Video:无标价;视显卡而定,需一块 GPU 运行六到二十一分钟。Seedance 2.5:480p 约 $0.51,720p 约 $1.16,按 token 计费。
这两行数据之间没有任何可通约之处,而人们通常想把它们归并成一个数字——用每 GPU 小时的价格除以五秒片段——这种做法暗中假定了满负荷运转、零空闲时间,以及显卡本就归你所有。更有意义的比较是定性的:Seedance 2.5 的成本随你的生成量而伸缩,一旦停止便随之消失;而 Kandinsky 6.0 Video 的成本,无论你是否生成,都照样产生。

在哪里可以到达每一个
这两个模型都不在 OrcaRouter 上,也没有任何这样的声称。Seedance 2.5 是通过供应商自己的平台和若干第三方服务访问的;Kandinsky 6.0 Video 是一个在 MIT 许可下下载并在自己硬件上运行的检查点。任何告诉你这两者在多模型平台上只需一次 API 调用即可获得的页面,描述的其实是不同的模型。
在 Kandinsky 或 Seedance 流水线中,路由层之所以仍值得提及,是因为按调用次数看,这些系统大多是文本,而按成本看,它们大多是视频。提示词扩展会把一条镜头备注变成 T2AV 模型所期望的那种长结构化字幕。对白会在唇形同步环节尝试处理它之前先起草好,并在该环节把它搞乱时重写。同一个节拍的六个候选生成会被审查,然后选出一个——这是针对视频产物做出的文本判断,也是正确做出昂贵决策的最便宜方式。在一个覆盖 200 多款模型的单一 OpenAI 兼容端点上,按提供商列表价以 0% 加价透传,这些调用只收取提供商所收的费用,不会更多,包括供应商更改费率后的第二天也是如此。当同一调用点上的廉价审查者和仔细审查者应该是不同模型时,路由 DSL 就体现了价值;而自动故障转移之所以有价值,是因为当六段剪辑中的第四段正在渲染时,如果字幕生成挂掉,它应该重新路由,而不是终止会话。
什么会改变这场对决
版本差距就是事情的全部,也是解决它的最短路径。让 Seedance 2.5 与 Kandinsky 6.0 Video 进行一次对比测试,就能确定报告中记录的、相较于 2.0 的视觉标准损失是扩大了、缩小了还是逆转了——报告无法回答这一点,其作者当时也无从回答。就目前而言,站得住脚的立场比任何一方的营销宣传所希望的都要更有限:根据该模型自家实验室发布的证据,Seedance 在视频片段的观感上领先,而 Kandinsky 6.0 Video 在片段中语音的听感上领先,而这一说法所依据的 Seedance 版本比你将会买到的版本落后一代。
据此选择。如果工作是长篇幅、参考素材密集或剪辑驱动的,那么在质量登场之前,结构性差距就已经决定了结果。如果工作是五秒钟的对话镜头,且对白必须第一次就听起来正确,那么 Kandinsky 6.0 Video 的可衡量优势恰恰就在这一标准上——而 MIT 许可证意味着答案并不取决于任何人的路线图。值得关注的不是排行榜,而是对一项比较的重演——那份报告从未能进行这项比较。


以最低成本正确完成高成本调用:一种按阶段切换评审者的路由 DSL,并具备自动故障转移,因此某个字幕失效也不会让整个片段付出代价。
