
Wan 3.0 对比 Kling 3:一镜到底对决六个规划好的镜头
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
从一个无人能解释的矛盾说起。Wan 3.0只有一个公开报价。Kling 3.0——快手当前的视频旗舰模型——却有两个,而且两者相差三倍。快手自家的 API 文档将 Kling Video 3.0 的标准档列为每秒 0.084 美元,专业档为 0.112 美元。而 Artificial Analysis 在同一份它也列出 Wan 3.0 的排行榜上,将同一模型 1080p 专业档的定价标为每分钟 20.16 美元——即每秒 0.336 美元。两者不可能是在描述相同设置下的同一次生成。在有人公布二者如何调和之前,对这两个模型进行的任何每秒成本比较,所依据的数字可能衡量的并不是同一回事。
真正能诚实比较的,是规格、盲投得分和设计理念——而在这些方面,两个模型几乎在所有关键点上都各执一词。Kuaishou 围绕多镜头序列打造了 Kling 3.0。Alibaba 围绕单条一镜到底的镜头打造了 Wan 3.0。这不是营销层面的区别;在价格进入讨论之前,它就已经决定了两者中哪一个更适合你的项目。
两种模型,对“片段”是什么有着两种理解
Kling 3.0 于 2026 年 2 月 5 日发布,是一个包含四款模型的系列——Video 3.0、Video 3.0 Omni、Image 3.0 和 Image 3.0 Omni。其标志性功能是自动多镜头编排:模型会自行规划镜头转换,而自定义模式则允许你设置镜头数量和每个镜头的时长。评测者反馈,单条提示词可生成多达约六个不同镜头的可用序列,并且可以逐镜头指定景别、运镜和叙事节拍。单次生成的上限为 15 秒,下限为 3 秒。
Wan 3.0 则反其道而行。它的上限是单次连续生成 30 秒,而整个设计都指向"不剪辑"——这段时间足够完成一次单一运镜、一场一镜到底的产品演示,或一段无需剪辑也能撑住的独白。它没有多镜头规划器,因为它的卖点就是你本就不该需要它。
实际后果是:这不是一个孰优孰劣的问题,而是一个关于你如何剪辑的问题。短剧、靠剪辑拼出来的广告、任何在角色之间来回交接对白的作品——那正是 Kling 3.0 的形态。连续的产品展示、舞蹈或表演作品、一个必须保持连贯的单一运动镜头——那正是 Wan 3.0 的形态。那些试图把其中一方强行塞进另一方格式的团队会发现,失败模式是结构性的:Kling 3.0 的六个镜头不重新生成就无法做成连续的,而 Wan 3.0 的那三十秒若不丢掉你花钱买来的东西,就无法剪成六个干净利落的镜头。
竞技场数据,按其衡量的内容划分
这是这场对比中报道最差的部分,因为大多数页面引用的 Kling Elo 已经过时五个月。Kuaishou 2026 年 2 月的发布材料将 Kling 3.0 置于文本到视频排行榜榜首,Elo 约为 1,240。这在 2 月是准确的。Artificial Analysis 的实时榜单,截取于 2026 年 9 月 18 日,带音频:
• Wan 3.0 — 第2名,Elo 1,229,$12.00/分钟
• Kling 3.0 1080p Pro — 第12名,Elo 1,095,$20.16/分钟
• Kling 3.0 720p 标准版 — #13,Elo 1,089,$15.12/分钟
• Kling 3.0 Omni 720p Standard — 第18名,Elo 1,082,$13.44/分钟
• Kling 3.0 Omni 1080p Pro — 第22名,Elo 1,075,$16.80/分钟
所以,二月份的领先者在七个月里变成了中游模型,这并非它自身的问题——是整个领域向前走了。还要注意,Kling 自家的各个档位在榜单上分散于十一个名次之间,彼此之间有 20 分的 Elo 差距,这意味着你购买哪个档位对测得质量的影响,小于你选择哪个模型的影响。从 Standard 升级到 Pro,换来的是分辨率,以及在这个榜单上大约 6 个 Elo 点。
接着是一个会让整体局面变得复杂的数字,而且几乎没有人引用它。在图像到视频榜上,不计音频时,Kling 3.0 完全是另一回事:Omni 1080p Pro 档位得到 Elo 1,284,位列第 8;1080p Pro 档位得到 1,282,位列第 9。这属于前十的位置,明显好于它在文生视频上的表现。解读是:当 Kling 3.0 从提供的图像出发、且不以生成的音频作为评判依据时,它表现最强——而这恰好符合现实中大量商业工作的情况。如果你的流程是图生视频,并且音频由你自己打分,那么上面这些竞技场数据就大大低估了这个模型。
音频,其中两者都做出相同的宣称,而其中一个存在有记录的问题
两款模型都能在同一次生成过程中原生生成音频。Kuaishou 的版本支持中文、英语、日语、韩语和西班牙语,能处理同一片段内的混合语言对话,在多角色场景中为每个角色绑定不同的声音,并提供地区口音——美式英语、英式英语和印度英语;东北话、北京话、台湾国语、粤语和四川话。Wan 3.0 的音频默认开启,可通过一个标志禁用,并最多接受五个参考音频片段来引导结果。
表面上,这是一场平局,只是语言列表不同。就报告的结果而言,却并非如此。唇形同步一致性是独立 Kling 3.0 评测中最常被指出的单一弱点——一项上手测试发现,大约五段对话片段中就有两段需要重拍,而即便在画面表现上给它高分的评测者,也仍将唇形同步描述为不稳定。报告中的音频伪影主要集中在嘈杂环境下的对话上,在这些环境中,水声和风声背景可能让语音变得发闷。Alibaba 的问题则性质不同:其自家发布材料将音频质量列为仍需改进的领域,这承认的是保真度问题,而非同步问题。
两家厂商都还没有拿出成品级的对话工具。如果你的项目核心就是对话,那么首先要测的不是画质,而是在整整15秒或30秒的片段里,口型是否与台词对得上——因为这两家的问题都出在这里,重拍的麻烦也正源于此。

引用控制与解析
• 多镜头 — Kling 3.0:自动分镜规划,并支持自定义模式,可设置每个镜头的数量和时长,最多约六个镜头。Wan 3.0:无;单次连续生成。
• 时长 — Kling 3.0:3 至 15 秒。Wan 3.0:2 至 30 秒,并支持向前、向后和双向延长。
• 分辨率 — Kling 3.0:官方指南中支持 720p 和 1080p,而 Kuaishou 自家文档声称支持原生 4K,价格为 $0.42/秒。Wan 3.0:480p、720p 和 1080p;不支持 4K。
• 帧率 — Kling 3.0:标准 30fps,高性能模式下宣称可达 60fps。Wan 3.0:30fps。
• 参考控制 — Kling 3.0:元素绑定,可在平移和变焦过程中锁定主体,支持上传的图片或角色视频。Wan 3.0:最多 10 张参考图像、5 个参考视频和 5 个音频片段,素材总数上限为 20 个,另可加一份文档或公开网页。
• 接地 — Wan 3.0 接受 DOC、XLS、PPT、PDF、TXT、MD 和公开 URL 作为输入,并将其转化为视频。Kling 3.0 没有对应功能。
分辨率这一行是需要对照你自己的交付规格来核查的,因为它确实存在争议。快手自己的文档声称 Video 3.0 支持原生 4K;其用户指南只列出了 720p 和 1080p。第三方针对 4K 的积分费率在不同来源之间相差超过两倍。如果 4K 是硬性要求,请在你的账户中取得书面确认,而不是通过对比页面——包括本页——来确认。
你实际上可以在哪里给他们打电话
这是本系列赛中唯一一组可用性答案并不对称的对阵,这一点值得直说。
Kling 3.0 已收录在 OrcaRouter 目录中,型号为kling/kling-v3,每次请求定价 0.08 美元,供应商目录价按 0% 加价率透传。这与上文的汇总情况存在实打实的差异:不必再持有一个快手账号,也无需为流水线所需的其他任何模型单独做集成,Kling 3.0 与 200+ 其他模型共用同一个密钥和同一个 OpenAI 兼容端点。由于我们不在供应商价格上增加任何费用,快手的费率调整或促销降价当天就会在我们这边生效,而不必等一个合同周期之后——并且,如果上游供应商服务质量下降或触发限流,自动故障转移会在响应开始之前就改派请求,而不是向你的应用返回错误。
Wan 3.0 不在我们的产品目录中,也不在任何通用路由平台上。它可通过 Alibaba 自有平台——Alibaba Cloud 上的 Model Studio 和 Qwen Cloud——以及 8 月 24 日发布后接入它的第三方创意工具访问,Alibaba 自有渠道还提供限时 30% 折扣,持续至 9 月 23 日。Kuaishou 自家的消费者套餐和 Kling AI 网页应用是另一条路径,按积分计费,没有无限量套餐。
对于一个两者都想要的团队来说,这种不对称正是该决策的实际形态:其中一项只是配置变更,另一项则意味着建立第二段供应商关系。
谁应该选择哪个
• 选择 Wan 3.0:用于超过 15 秒的连续镜头,用于以文档或网页为依据的简报,用于短于三秒的片段,用于以最低公开价格获得最宽裕的参考额度,以及用于原本需要拼接的 30 秒单次生成任务。
• 若想用一条提示词生成多镜头叙事序列,请选择 Kling 3.0;若要做图生视频,且其在无音频榜单中确实跻身前十,也选它;若需在五种支持的语言中进行多语言对话,并为每个角色绑定语音,同样选它;若要在镜头运动间保持元素一致性,以及在你确认了相应档位的前提下使用 4K,也都选它。
老实说,这两者与其说是竞争对手,不如说是按项目类型来选的替代方案;而本可一锤定音的价格对比,目前并不可信——Kuaishou 公布的按秒费率和独立排行榜上的每分钟数字不可能同时正确,而且差距大到足以让决策反转。在这一点解决之前,决定性的证据应该是用你自己的素材做同提示词测试:在 Kling 3.0 上做一个六镜头、15 秒的序列,对比 Wan 3.0 上一条连续 15 秒的一镜到底,均为 1080p,并按你实际会交付的片段来评分。

值得关注的不是两家实验室中任何一家的新模型,而是快手的价格表。如果厂商费率是对的,那么 Kling 3.0 就是这一系列中最便宜且可信的视频模型,而竞技场的每分钟一列衡量的是一种大多数人不会购买的配置。如果排行榜上的数字是对的,那么 Kling 3.0 就是这里最贵的模型,它处于中游的位置就是个问题。这两种说法里有一种是真的,但没人说过是哪一种。

