一张生成的标题卡,上面写着“Kandinsky 6.0 Video vs Alibaba Wan 2.7”,副标题为“开放权重对抗四模型套件”。OrcaRouter 标志位于右下角。
Guides & Insights

Kandinsky 6.0 Video 对比 Alibaba Wan 2.7:开放权重对决四模型套件

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Kandinsky 6.0 Video为你提供一个 29B 参数的检查点供下载,作为回报给你一段五秒的短片。Wan 2.7为你提供四个针对特定任务的变体、最长十五秒的短片,以及按秒计费的账单。这两句话就是对比本身,而它之所以值得写下来,是因为大多数正面交锋的对比页面都在视觉质量上比较二者,可在这方面两者都没有一个能一锤定音的独立评分——却跳过了它们真正产生分歧的那个维度,也就是各自期待你带来的东西。

Sber 的 Kandinsky Lab 于 2026 年 10 月第一周以 MIT 许可证开源了 Kandinsky 6.0 Video,提供两种规格——Pro 为 29B,Lite 为 3B——并附带代码、检查点以及 diffusers 集成。阿里巴巴的 Wan 2.7 于 2026 年 4 月 3 日作为一套套件发布:文本到视频、图像到视频、参考到视频和视频编辑,按生成视频的秒数计费。其中一个是你可以自行运行的模型;另一个是你购买的服务。有趣的问题不在于哪个更好,而在于哪一个才是适合这项工作的形态。

唯一能直接比较的一个维度

两个模型都能直接生成带声音的视频,而不是先出画面、再另外配乐。这比听起来要罕见得多,也正是这两个模型会被放在一起提及的原因——该领域的大多数方案至今仍只产出一个无声的 MP4,把音频留给另外单独的一道工序。

Kandinsky 6.0 Video 通过双流 CrossDiT 实现这一点:一个从 Kandinsky 5.0 Video 检查点初始化的视频流,一个在大型音频语料库上从头训练的音频流,以及将它们连接起来的双向交叉注意力,在连续预训练阶段后进行联合训练。输出为带有唇形同步的 44 kHz 音频,来自文本提示(T2AV)或参考图像(I2AV)。

Wan 2.7 也能生成原生音频,只是没有以同样详尽的程度公开其机制。它自己的文档把音频质量和屏幕文字准确度列为仍待改进的两个方面——这是一条值得记住的保真度警示,因为说这话的是厂商自己,而非评测者的猜测。

相似之处就到此为止。此线以下的一切都是分歧,而非排名。

五秒对十五秒,以及这会如何影响一份镜头清单

Kandinsky 6.0 Video 以 121 帧、24 fps 训练——也就是五秒——且该版本不包含扩展模式。论文、合并进 vLLM-Omni 的服务方案,以及仓库中的性能表,全都围绕这一固定片段长度构建。一段三十秒的作品就是六次生成加五次拼接,而拼接的痕迹得由你自己来隐藏。

Wan 2.7 单次生成即可覆盖两到十五秒,具体时长按请求决定。对于口播类片段、产品插入镜头或单次运镜而言,这一差异并非只是方便与否——它决定了是一步渲染完成,还是多出一道拼接工序。而对于任何逐个镜头搭建的内容来说,五秒本就是一个常规的工作单位,这一差距也就基本不存在了。

• 最大片段长度 — Kandinsky 6.0 Video:5 秒,固定,24 fps 下 121 帧。Wan 2.7:2–15 秒,按请求设置。

• 分辨率 — Kandinsky 6.0 Video:通过单独的超分辨率模型支持 SD、HD 和 Full HD(1920×1080)。Wan 2.7:最高 1080p。

• 参考条件控制 — Kandinsky 6.0 Video:一张图像,作为带遮罩的尾帧应用。Wan 2.7:最多五张主体图像和五个参考片段,每次请求十个素材。

• 任务 — Kandinsky 6.0 Video:T2AV 和 I2AV。Wan 2.7:文本生视频、图像生视频、参考生视频和视频编辑作为独立变体,单独计费。

• 权重 — Kandinsky 6.0 Video:MIT,可下载,Pro 和 Lite。Wan 2.7:无。

四项任务对两种模式

任务数量是 Wan 2.7 在对比表格中被低估的那部分,因为它并非一项质量主张——而是一项覆盖面主张。对现有素材进行基于指令的编辑,也就是你描述一处改动、然后拿回同一个镜头且该改动已应用其上,这种工作负载是 Kandinsky 6.0 Video 完全不会尝试的。参考生视频,即由所提供的表演来驱动生成的主体,同样不在它的两种模式之列。

其计费方式反映了工作量范围。Wan 2.7 的文生视频和图生视频变体仅按输出时长计费——在新加坡国际端点,720p 为 $0.10/秒,1080p 为 $0.15/秒,而北京和东京对相同工作分别报价 $0.086/秒和 $0.143/秒。参考视频生视频变体还会对输入视频计费,上限为五秒,因此一个五秒的参考视频驱动十五秒的生成,会按二十秒的工作量计费。视频编辑变体仅对输出计费,并将输入素材视为免费——这是该系列中最优惠的单一费率,也是编辑成为 2.7 真正便宜之处的原因。

这些数字旁边还应当补充两个生命周期方面的事实。阿里巴巴为其自家的百炼和 Qwen Cloud 平台提供了限时 30% 的发布折扣,该折扣已于 2026 年 9 月 23 日结束。另外,阿里云 Model Studio 的退役通知(ID 118434)将于 2026 年 10 月 10 日下线若干较旧的模型,而wan2.7-r2v和wan2.7-image就在该名单之中。这是变体级别的下线,而非整个代际的关停——wan2.7-t2v和wan2.7-i2v仍在列表中并保持有效费率——但如果你关注 2.7 是因为参考视频(reference-to-video)功能,那这条路只剩下四天了。

独立董事会显示了什么,又没有显示什么

这一部分是大多数关于这两个模型的比较悄悄作弊的地方,因此值得精确说明实际存在什么。

Wan 2.7 在三个不同的 Artificial Analysis 视频榜单上拥有各自独立的评分,而这些评分彼此并不一致,因为它们衡量的是不同的东西:

• 文生视频 — Wan2.7-260612(六月版本)在 5,571 张投票中以 Elo 1,030(±9)位列第 13–14 名,价格为 $9.00/分钟。

• 图生视频 — Wan 2.7(四月版本)在 4,571 票中以 Elo 1,077(±8)位列第 12,价格为每分钟 9.00 美元。

• 视频编辑——Wan 2.7 以 Elo 1,077(±5)在 17,988 票中位列第 5,价格为每分钟 16.90 美元。

把这三者放在一起看,有用的结论并不是“Wan 2.7 在视频方面排第十二”。而是:在各自对应的榜单上,这个模型在编辑方面明显强于生成方面,而且为它引用一个单一数字,无论朝哪个方向都是错误的。

Kandinsky 6.0 Video 在其中任何一项上都没有得分。其已公开的证据来自厂商一方,值得确切说明它究竟是什么:一次 VABench 运行,其中该实验室报告称,在受评估的三个系统中,Pro 在语音质量、音频美学、文本-视频和音频-视频对齐、唇形同步准确度、不同步程度以及视觉真实感方面领先——另外两个系统是其自家的 Lite 模型和 LTX 2.5——以及一项由实验室开展的并排人工评估,每个标准约有 200 次或更多次成对比较,其中 Pro 与 Kling 2.6 和 Veo 3.1 Fast 具有竞争力,在视觉标准上落后于 MiniMax H3 和 Dreamina Seedance 2.0,并在语音质量和音频-视频同步方面保持竞争力。这些内容无一在 Sber 之外得到复现,也没有任何一项是盲测公开榜单上的 Elo。正确的解读是“有前景但未经审计”,而不是“媲美 Veo”。

每一项的成本,均按各方使用的术语来表述。

这两种定价模型无法被简化为一个数字,而假装它们可以,正是团队做出错误决策的原因。

Wan 2.7 是按秒计费的。一段十五秒的 1080p 短片大约 2.25 美元。一条三十秒的成片需要两次生成再加一次剪辑——4.50 美元的原始生成费用,外加你的组装时间;如果由剪辑变体来完成这项工作,费用会更低,因为它不对输入计费。

Kandinsky 6.0 Video 根本没有费率,因为并没有可供购买的服务。它有的是由你提供的 GPU 小时成本。该仓库自身的数据划定了下限:一段 Pro Full HD 五秒片段在预热后,在 H100 上约需 402 秒工作时间,在 RTX 5090 上为 854 秒,在 RTX 4090 上为 1,247 秒。蒸馏检查点——论文测得它与完整模型持平,平均偏好为 51% 对 49%,且没有任何评判标准达到显著性——才是你实际会用于服务的那个。任何低于 72.8 GiB 峰值分配的情况都需要块卸载,而 16 GB 预设会把文本编码器量化为 NF4,论文证实这是唯一会改变片段本身的预设变更。

说得直白些:Wan 2.7 的成本,是发票上一行你可以预先估算的数字。Kandinsky 6.0 Video 的成本,则是一台归你所有的机器、每五秒就要花上数分钟的渲染时间,以及可微调——而非必须微调——的选择权。

路由器在这其中的位置

OrcaRouter 既不提供 Kandinsky 6.0 Video,也不提供 Alibaba Wan 2.7,这里也没有作出这两种声称。Kandinsky 由你自行下载并运行;Wan 2.7 则通过阿里巴巴自己的平台访问。基于任一模型构建的流水线需要路由器提供的,是围绕渲染的文本层:把镜头描述转换为这些模型训练时所用的长描述或短描述的提示词扩展、为图生视频环节提供输入的描述文本与对白处理,以及决定多次生成结果中哪一次应被保留的审阅摘要。这些都是普通的文本调用,它们运行在一个兼容 OpenAI 的端点上,覆盖 200 多个模型,供应商列表价格按 0% 加价率透传,因此供应商降价当天就能生效,而不是要等一个合同周期之后。自动故障转移在这里比在聊天工作负载中更有价值,因为在问答会话进行到第四分钟时失败的一次描述文本调用,应当重新路由,而不是让这次渲染丢失。

决定,每项一行

如果交付物是一段带声音的成品剪辑,而你又不想自己拥有一块 GPU,那么 Wan 2.7 是两者中唯一能提供这一点的,并且根据现有证据,它的编辑变体是该系列中最强的。在决定采用 reference-to-video 之前,请先确认 10 月 10 日的停用安排。

如果交付物是你掌控的流水线,如果五秒单元适合你的镜头清单,并且如果你想微调或离线运行,那么 Kandinsky 6.0 Video 是两者中唯一允许这一点的——代价是在消费级硬件上渲染缓慢,以及质量声明仍完全出自该实验室自己。那一侧值得关注的事件很简单:一个 Elo。

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Alibaba Wan 2.7 — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'Resolution: Full HD plus SR', 'Tasks: text and image to AV', 'Reference input: one image', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Alibaba Wan 2.7 column reads 'Max clip: 2 to 15s', 'Resolution: up to 1080p', 'Tasks: four variants', 'Reference input: ten assets', 'Weights: none', 'Price: $0.10 to $0.15/s'. A footer reads 'Kandinsky figures vendor-reported; Wan pricing per Alibaba. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-Editing V1.0 leaderboard, ranking video-editing models by Elo from pairwise human preference votes with audio kept. Wan 3.0 is first at 1,156 over 5,255 samples at $12.00 per minute (Aug 2026); MiniMax H3 is second at 1,132 over 12,043 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,125 over 14,815 samples at $6.00 per minute (May 2026); HappyHorse-1.0 is fourth at 1,089 over 21,673 samples at $27.04 per minute (Apr 2026); Wan 2.7 is fifth at 1,077 over 17,988 samples at $16.90 per minute (Apr 2026); Dreamina Seedance 2.0 720p is sixth at 1,034 over 21,507 samples at $5.57 per minute (Mar 2026); Aleph 2.0 is seventh at 1,012 over 19,183 samples at $16.80 per minute (May 2026); Kling 3.0 Omni 1080p (Pro) is eighth at 1,000 over 17,447 samples at $10.91 per minute (Feb 2026); SkyReels V4 is ninth at 953 over 14,441 samples at $37.50 per minute (Mar 2026).

在收尾之前,有一个不对称之处值得点明,因为它会比这两个模型都存活得更久。Wan 2.7 的上限在合同和技术上都由阿里巴巴设定——当该套件的各个变体被下架或重新定价时,你的流水线就会继承这一决定。Kandinsky 6.0 Video 的上限则取决于你自己的硬件,而 MIT 许可证意味着一个分叉可以比实验室的路线图活得更久。那些曾因某个模型从目录中消失而吃过亏的团队,往往在一年之后比在选择当天更看重这一差异。

A screenshot of OrcaRouter's own model page for minimax/minimax-h3, titled 'MiniMax-H3' and credited to MiniMax, showing the route endpoint /v1/video/generations, a price of $0.08 per second at 768P and $0.13 at 2K, and a description explaining that MiniMax-H3 is MiniMax's omni-modal video generation model (the Hailuo 3 generation), released July 31 2026, reading text, image, video and audio references as one unified context and generating 4-15 second videos at 768P or 2K with native stereo audio.