Wan 3.0 与 Kling 3.0 对比的标题卡,副标题为“一镜到底,对阵预先规划好的六镜头序列”,并带有三个数据标签,分别显示“Arena 排名:#2 对 #12”、“最长片段:30 秒 对 15 秒”和“多镜头:否 对 是”。页脚:“Elo 数据来自 Artificial Analysis,采集于 2026 年 9 月 18 日。Kling 供应商定价存在争议。”
Guides & Insights

Wan 3.0 对比 Kling 3:一镜到底对决六个规划好的镜头

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

从一个无人能解释的矛盾说起。Wan 3.0只有一个公开报价。Kling 3.0——快手当前的视频旗舰模型——却有两个,而且两者相差三倍。快手自家的 API 文档将 Kling Video 3.0 的标准档列为每秒 0.084 美元,专业档为 0.112 美元。而 Artificial Analysis 在同一份它也列出 Wan 3.0 的排行榜上,将同一模型 1080p 专业档的定价标为每分钟 20.16 美元——即每秒 0.336 美元。两者不可能是在描述相同设置下的同一次生成。在有人公布二者如何调和之前,对这两个模型进行的任何每秒成本比较,所依据的数字可能衡量的并不是同一回事。

真正能诚实比较的,是规格、盲投得分和设计理念——而在这些方面,两个模型几乎在所有关键点上都各执一词。Kuaishou 围绕多镜头序列打造了 Kling 3.0。Alibaba 围绕单条一镜到底的镜头打造了 Wan 3.0。这不是营销层面的区别;在价格进入讨论之前,它就已经决定了两者中哪一个更适合你的项目。

两种模型,对“片段”是什么有着两种理解

Kling 3.0 于 2026 年 2 月 5 日发布,是一个包含四款模型的系列——Video 3.0、Video 3.0 Omni、Image 3.0 和 Image 3.0 Omni。其标志性功能是自动多镜头编排:模型会自行规划镜头转换,而自定义模式则允许你设置镜头数量和每个镜头的时长。评测者反馈,单条提示词可生成多达约六个不同镜头的可用序列,并且可以逐镜头指定景别、运镜和叙事节拍。单次生成的上限为 15 秒,下限为 3 秒。

Wan 3.0 则反其道而行。它的上限是单次连续生成 30 秒,而整个设计都指向"不剪辑"——这段时间足够完成一次单一运镜、一场一镜到底的产品演示,或一段无需剪辑也能撑住的独白。它没有多镜头规划器,因为它的卖点就是你本就不该需要它。

实际后果是:这不是一个孰优孰劣的问题,而是一个关于你如何剪辑的问题。短剧、靠剪辑拼出来的广告、任何在角色之间来回交接对白的作品——那正是 Kling 3.0 的形态。连续的产品展示、舞蹈或表演作品、一个必须保持连贯的单一运动镜头——那正是 Wan 3.0 的形态。那些试图把其中一方强行塞进另一方格式的团队会发现,失败模式是结构性的:Kling 3.0 的六个镜头不重新生成就无法做成连续的,而 Wan 3.0 的那三十秒若不丢掉你花钱买来的东西,就无法剪成六个干净利落的镜头。

竞技场数据,按其衡量的内容划分

这是这场对比中报道最差的部分,因为大多数页面引用的 Kling Elo 已经过时五个月。Kuaishou 2026 年 2 月的发布材料将 Kling 3.0 置于文本到视频排行榜榜首,Elo 约为 1,240。这在 2 月是准确的。Artificial Analysis 的实时榜单,截取于 2026 年 9 月 18 日,带音频:

• Wan 3.0 — 第2名,Elo 1,229,$12.00/分钟

• Kling 3.0 1080p Pro — 第12名,Elo 1,095,$20.16/分钟

• Kling 3.0 720p 标准版 — #13,Elo 1,089,$15.12/分钟

• Kling 3.0 Omni 720p Standard — 第18名,Elo 1,082,$13.44/分钟

• Kling 3.0 Omni 1080p Pro — 第22名,Elo 1,075,$16.80/分钟

所以,二月份的领先者在七个月里变成了中游模型,这并非它自身的问题——是整个领域向前走了。还要注意,Kling 自家的各个档位在榜单上分散于十一个名次之间,彼此之间有 20 分的 Elo 差距,这意味着你购买哪个档位对测得质量的影响,小于你选择哪个模型的影响。从 Standard 升级到 Pro,换来的是分辨率,以及在这个榜单上大约 6 个 Elo 点。

接着是一个会让整体局面变得复杂的数字,而且几乎没有人引用它。在图像到视频榜上,不计音频时,Kling 3.0 完全是另一回事:Omni 1080p Pro 档位得到 Elo 1,284,位列第 8;1080p Pro 档位得到 1,282,位列第 9。这属于前十的位置,明显好于它在文生视频上的表现。解读是:当 Kling 3.0 从提供的图像出发、且不以生成的音频作为评判依据时,它表现最强——而这恰好符合现实中大量商业工作的情况。如果你的流程是图生视频,并且音频由你自己打分,那么上面这些竞技场数据就大大低估了这个模型。

音频,其中两者都做出相同的宣称,而其中一个存在有记录的问题

两款模型都能在同一次生成过程中原生生成音频。Kuaishou 的版本支持中文、英语、日语、韩语和西班牙语,能处理同一片段内的混合语言对话,在多角色场景中为每个角色绑定不同的声音,并提供地区口音——美式英语、英式英语和印度英语;东北话、北京话、台湾国语、粤语和四川话。Wan 3.0 的音频默认开启,可通过一个标志禁用,并最多接受五个参考音频片段来引导结果。

表面上,这是一场平局,只是语言列表不同。就报告的结果而言,却并非如此。唇形同步一致性是独立 Kling 3.0 评测中最常被指出的单一弱点——一项上手测试发现,大约五段对话片段中就有两段需要重拍,而即便在画面表现上给它高分的评测者,也仍将唇形同步描述为不稳定。报告中的音频伪影主要集中在嘈杂环境下的对话上,在这些环境中,水声和风声背景可能让语音变得发闷。Alibaba 的问题则性质不同:其自家发布材料将音频质量列为仍需改进的领域,这承认的是保真度问题,而非同步问题。

两家厂商都还没有拿出成品级的对话工具。如果你的项目核心就是对话,那么首先要测的不是画质,而是在整整15秒或30秒的片段里,口型是否与台词对得上——因为这两家的问题都出在这里,重拍的麻烦也正源于此。

Artificial Analysis's Text to Video Leaderboard (With Audio), read 18 September 2026, showing Wan 3.0 second at Elo 1,229 and $12.00/min with Kling's four tiers spread from twelfth to twenty-second — Kling 3.0 1080p Pro at 1,095 and $20.16/min, Kling 3.0 720p Standard at 1,089 and $15.12/min, Kling 3.0 Omni 720p Standard at 1,082 and $13.44/min.

引用控制与解析

• 多镜头 — Kling 3.0:自动分镜规划,并支持自定义模式,可设置每个镜头的数量和时长,最多约六个镜头。Wan 3.0:无;单次连续生成。

• 时长 — Kling 3.0:3 至 15 秒。Wan 3.0:2 至 30 秒,并支持向前、向后和双向延长。

• 分辨率 — Kling 3.0:官方指南中支持 720p 和 1080p,而 Kuaishou 自家文档声称支持原生 4K,价格为 $0.42/秒。Wan 3.0:480p、720p 和 1080p;不支持 4K。

• 帧率 — Kling 3.0:标准 30fps,高性能模式下宣称可达 60fps。Wan 3.0:30fps。

• 参考控制 — Kling 3.0:元素绑定,可在平移和变焦过程中锁定主体,支持上传的图片或角色视频。Wan 3.0:最多 10 张参考图像、5 个参考视频和 5 个音频片段,素材总数上限为 20 个,另可加一份文档或公开网页。

• 接地 — Wan 3.0 接受 DOC、XLS、PPT、PDF、TXT、MD 和公开 URL 作为输入,并将其转化为视频。Kling 3.0 没有对应功能。

分辨率这一行是需要对照你自己的交付规格来核查的,因为它确实存在争议。快手自己的文档声称 Video 3.0 支持原生 4K;其用户指南只列出了 720p 和 1080p。第三方针对 4K 的积分费率在不同来源之间相差超过两倍。如果 4K 是硬性要求,请在你的账户中取得书面确认,而不是通过对比页面——包括本页——来确认。

你实际上可以在哪里给他们打电话

这是本系列赛中唯一一组可用性答案并不对称的对阵,这一点值得直说。

Kling 3.0 已收录在 OrcaRouter 目录中,型号为kling/kling-v3,每次请求定价 0.08 美元,供应商目录价按 0% 加价率透传。这与上文的汇总情况存在实打实的差异:不必再持有一个快手账号,也无需为流水线所需的其他任何模型单独做集成,Kling 3.0 与 200+ 其他模型共用同一个密钥和同一个 OpenAI 兼容端点。由于我们不在供应商价格上增加任何费用,快手的费率调整或促销降价当天就会在我们这边生效,而不必等一个合同周期之后——并且,如果上游供应商服务质量下降或触发限流,自动故障转移会在响应开始之前就改派请求,而不是向你的应用返回错误。

Wan 3.0 不在我们的产品目录中,也不在任何通用路由平台上。它可通过 Alibaba 自有平台——Alibaba Cloud 上的 Model Studio 和 Qwen Cloud——以及 8 月 24 日发布后接入它的第三方创意工具访问,Alibaba 自有渠道还提供限时 30% 折扣,持续至 9 月 23 日。Kuaishou 自家的消费者套餐和 Kling AI 网页应用是另一条路径,按积分计费,没有无限量套餐。

对于一个两者都想要的团队来说,这种不对称正是该决策的实际形态:其中一项只是配置变更,另一项则意味着建立第二段供应商关系。

谁应该选择哪个

• 选择 Wan 3.0:用于超过 15 秒的连续镜头,用于以文档或网页为依据的简报,用于短于三秒的片段,用于以最低公开价格获得最宽裕的参考额度,以及用于原本需要拼接的 30 秒单次生成任务。

• 若想用一条提示词生成多镜头叙事序列,请选择 Kling 3.0;若要做图生视频,且其在无音频榜单中确实跻身前十,也选它;若需在五种支持的语言中进行多语言对话,并为每个角色绑定语音,同样选它;若要在镜头运动间保持元素一致性,以及在你确认了相应档位的前提下使用 4K,也都选它。

老实说,这两者与其说是竞争对手,不如说是按项目类型来选的替代方案;而本可一锤定音的价格对比,目前并不可信——Kuaishou 公布的按秒费率和独立排行榜上的每分钟数字不可能同时正确,而且差距大到足以让决策反转。在这一点解决之前,决定性的证据应该是用你自己的素材做同提示词测试:在 Kling 3.0 上做一个六镜头、15 秒的序列,对比 Wan 3.0 上一条连续 15 秒的一镜到底,均为 1080p,并按你实际会交付的片段来评分。

Two-column scoreboard for Wan 3.0 and Kling 3.0 across six shared dimensions: arena Elo (#2 — 1,229 vs #12 — 1,095), price per minute ($12.00 vs $20.16), max clip (30s one take vs 15s), multi-shot (no vs up to six shots), frame rate (30fps vs 30fps) and native 4K (no vs claimed, unconfirmed). Footer: “Elo per Artificial Analysis, Sept 18 2026; Kling vendor rate disagrees with this column.”

值得关注的不是两家实验室中任何一家的新模型,而是快手的价格表。如果厂商费率是对的,那么 Kling 3.0 就是这一系列中最便宜且可信的视频模型,而竞技场的每分钟一列衡量的是一种大多数人不会购买的配置。如果排行榜上的数字是对的,那么 Kling 3.0 就是这里最贵的模型,它处于中游的位置就是个问题。这两种说法里有一种是真的,但没人说过是哪一种。

OrcaRouter's own model page for kling/kling-v3, showing the model summary “Kling 3.0 — flagship text-to-video and image-to-video, multi-shot + subject + motion control, 3-15s clips, up to native 4K”, the /v1/video/generations endpoint, a per-request price of $0.08, p50 and p95 time-to-first-token of 1.00s, and an OpenAI-compatible code sample against api.orcarouter.ai/v1.