
Tavus Griffin 与 Kling 3:实时对话对决十秒短片
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
这场对比的诚实形态是一种路由不对称。Kling 3是一个可调用的模型,有价格、参数面和在我们自己目录中的条目;Tavus Griffin是一个研究预览,面向选定的受信任测试者,需通过请求表单申请,于2026年10月1日宣布,没有标识符、没有端点、也没有公布费率。Kling 3.0在OrcaRouter目录中为kling/kling-v3,定价为每次请求$0.084,提供商标价透传,不添加任何费用。Griffin不可路由,并不是因为没人来得及做——一个实时全双工会话,其中模型在收听的同时以320毫秒的块生成720p,不是请求-响应调用,即使Tavus明天打开大门,它也不符合相同的形态。所以这不是买家通过价格来解决的比较。它是对“生成的人用来做什么”这一问题的两种答案的比较。
Kling 3.0 究竟是什么
Kling 3.0 于 2026 年 2 月 5 日发布,是一个包含四款模型的系列——Video 3.0、Video 3.0 Omni、Image 3.0 和 Image 3.0 Omni。其标志性功能是自动多镜头编排:模型会自行规划镜头切换,而自定义模式可让你设定镜头数量以及每个镜头的时长;评测者反馈,仅凭单条提示词就能生成最多约六个不同镜头的可用序列,并且可以逐镜头指定景别、运镜方式和叙事节拍。单次生成的上限为 15 秒,下限为 3 秒。在 OrcaRouter 一侧,它以旗舰级文生视频和图生视频模型的形态出现,具备多镜头、主体与运动控制能力,可生成 3–15 秒的片段,并宣称最高支持原生 4K,通过 POST /v1/video/generations。
音频是在同一轮中原生生成的。Kuaishou的版本支持中文、英语、日语、韩语和西班牙语,能处理片段内的多语言对话,在多角色场景中为每个角色绑定不同的音色,并提供地区口音——美式英语、英式英语和印度英语;东北话、北京话、台湾国语、粤语和四川话。唇形同步一致性是独立上手评测中最常被指出的短板,其中一项测试报告称,大约五分之二的对话片段需要重录,并且报告的瑕疵集中在嘈杂环境中的对话部分,在这些场景中,水声和风声背景使得语音变得模糊。
Griffin 到底是什么,用一段话说明
Griffin 不是一款带对话模式的视频生成器。它是两个并发运行的引擎。连续对话建模引擎会摄取某人的音频和视频,以亚秒级间隔重新评估交流,并在每个间隔决定是保持沉默、发出信号、给予反馈性回应,还是接过话轮——它输出的是承载时机、立场、面部表情和手势的表达性控制信号,而不仅仅是词语。音视频生成引擎则将这些控制信号同时转化为声音和像素:一个自回归扩散变换器,从编码后的说话人前缀出发,一次生成一个潜在块的语音;以及一个少步自回归视频生成器,从单张参考照片出发,以 320 毫秒为块、25 帧/秒生成 720p 视频。没有提示词,没有片段长度,也没有文件。在音频方面,它报告称,在 H100 上,相较于四个已发布的流式扩散基线,其真实的音频到视频延迟为 0.43 秒,Tavus 称其为次快方法的一半。
价格,以及单面表
Kling 3.0 的定价是本文中唯一一处对比双方都有明确数字、而其中一方却为空的地方。
• OrcaRouter 上的 Kling 3.0 — 每次请求 $0.084,按 0% 加价率透传供应商标价,因此 Kuaishou 的费率调整或促销降价当天即在此生效,而无需等一个合同周期。
• 独立竞技场上的 Kling 3.0——2026 年 10 月 2 日读取的带音频文生视频榜单显示,1080p Pro 档为每分钟 10.08 美元,Omni 1080p Pro 档为每分钟 8.40 美元。同一榜单对 Kling 3.0 的四个档位给出了四种不同价格,因此“Kling 3.0 的价格”并不是一个单一数字。
• Griffin — 没有价格。Griffin-Lite 仅作为研究预览版向部分受信任的测试者开放,不在 Tavus 平台上,并且其自身的公告称目前不会面向客户使用。没有可按请求计费的价格、没有按秒计费的价格,也没有可报价的免费层级,该模型只有在 Tavus 找到安全发布方式之后才会推出。
这就是价格部分的全部内容,与其根据计算足迹编造一个每秒估算,就此打住才是诚实的做法。
这些记分板衡量的内容不同,并不一致。
两个模型都是由各自供应商以外的第三方评分的,但所用评测工具彼此无法比较。
Kling 3.0 位于 Artificial Analysis 的视频竞技场中,其 Elo 分数来自人类对短片的盲测成对偏好。同一天的两个读数讲述了不同的情况,而这正是值得指出的陷阱:在带音频的文生视频榜单上,Kling 各档位处于中游,而在带音频的图生视频榜单上,它们的位置明显更高——但 Kling 的各档位并非都同时出现在这两个榜单上。只有 Pro 和 Omni Pro 1080p 版本出现在文生视频榜单上;720p Standard 档位仅在图生视频上被评分,别处没有。
• Kling 3.0 在文生视频(带音频)中——1080p Pro 位列第 16 名,在 4,844 票下 Elo 为 1,000,$10.08/分钟;Omni 1080p Pro 位列第 16 名,在 2,741 票下 Elo 为 987,$6.90/分钟。两者中价格更高的档位反而得分更低,这与该榜单上其他各处按档位分布所显示的情况一样,同样算不上什么结果。
• Kling 3.0 在图生视频(含音频)中 — 1080p Pro 位列第 18–20 名,Elo 1,055(±6),共 14,896 票,$20.16/分钟;720p Standard 位列第 18–20 名,Elo 1,051(±6),共 14,692 票,$15.60/分钟;Omni 1080p Pro 位列第 21–22 名,Elo 1,044(±8),共 2,945 票,$16.80/分钟;Omni 720p Standard 位列第 21–24 名,Elo 1,036,$13.44/分钟。
解读是,Kling 3.0 从给定图像出发时比从文本出发时更强,而图生视频榜单的票数是文本生视频那边的三倍,所以把它放在那个榜单上是更合理的安排。那也是大多数商业作品采用的模式。注意这四个档位能换来什么:在图生视频范围内,它们跨越十六个 Elo 分,价格区间为每分钟 13.44 美元到 20.16 美元,而四者中最便宜的那个并非排名最低。为 Kling 3.0 花更多钱,并不会让它在这个榜单上往上走。

Griffin 的评分来自 NVIDIA 的 VideoFDB,它从两个维度对全双工视听对话进行评分,由 NVIDIA 构建和运行,使用自己的评判器并依据公开的评分标准。Griffin-Lite 在生成方面得分为 5 分制下的 3.83,人类参考为 3.92,次高的已发表系统为 2.80;在感知方面得分为 3.73,人类参考为 4.20,接管率对齐分别为 62.8% 和 73.8%。这些数字无法说明一段视频在 1080p 下看起来是否正确,而 Kling 的 Elo 也无法说明一个模型能否在句子中途被打断。对两者唯一诚实的用法,就是用在它们各自所回答的问题之内。
无人衡量的空白:延迟与长度
这里存在着一种真正的工程层面的对比,而两边的排行榜都没有捕捉到它,对于任何正在规划产品的人来说,这才是这次比较中最有用的东西。
Kling 3.0 在有界生成范围内针对时长与结构进行优化:最长十五秒、最多约六个预先规划的镜头、逐镜头控制。它的成本随输出时长而变化,其质量则随提示词的具体程度而提升。当用户还在说话时,它的任何部分都不会运行,而这并非缺陷——这正是这一品类的固有形态。
Griffin 针对无界会话内的延迟进行优化:320 毫秒的片段、25 fps、每隔不到一秒就做一次决策,无需规划任何剪辑片段,因为对话没有终点。它的成本,无论最终是多少,都会随对话时长而非渲染秒数增长;它的质量则随另一端那个人有多自然而变化,而非随简报变化。之所以要做三阶段蒸馏,将其提炼成一个以自身历史训练的自回归生成器,正是因为这一架构的失效模式是长时间展开过程中的漂移,而不是某一次糟糕的镜头。
把两者放在一起比较,实际后果就是它们会朝着相反的方向失败。Kling 3.0 的失败是可见且早发生的——一条勉强可用的镜头,你可以花几分钱删掉再重新生成,重拍预算已内置于工作流中。而 Griffin,如果它真如报道所说那样运作,就会以不可见且滞后的方式失败,因为它并非表面看起来的那样,这正是 Tavus 把它压着不放的原因。
路由器在哪些情况下真正有帮助,在哪些情况下则没有
Kling 3.0 已在 OrcaRouter 目录中,名称为 kling/kling-v3,每次请求 $0.084,与 200+ 其他模型使用同一个密钥和同一个 OpenAI 兼容端点。与持有一个快手账户并为你的流水线所需的任意文本模型单独集成相比,这是一个真正的区别:因为我们不在提供商价格上加价,快手的价格变动当天就会在我们这边生效;如果上游提供商服务降级或限流,自动故障转移会在响应开始前转移请求,而不是向你的应用返回错误。对于一次调用可能比一千次文本调用还贵的视频流水线来说,让请求挺过上游糟糕的一分钟,比你不用支付的加价更值得。
Griffin 不在我们的目录中,也不在任何人的目录中,而且不可能在——全双工会话模型不是路由请求。只有提交访问申请才能访问它。Tavus 自己把潜在构建者引向其较旧的模型而非 Griffin,这就是线索:那三款前代模型为 15 万开发者和企业已经在使用的 PALs 提供支持,而 Griffin 不在其中。

哪个,为什么
• 当需要从一个提示词生成有规划的多镜头序列时,选择 Kling 3.0;用于图生视频任务时,它在无音频赛道排名靠前且投票量很大;用于多语言对白时,它支持五种语言中按角色绑定音色;用于镜头运动间的元素一致性;以及用于 4K——前提是你以书面形式确认该档位:快手自家的文档声称原生 4K,而其用户指南只列出 720p 和 1080p,且第三方给出的 4K 积分费率在不同来源之间相差超过两倍。
• 如果重点是对话,就先用 Kling 3.0 测试口型同步,因为独立上手评测称这正是它出问题的地方,而这也是最耗重拍成本的失败。
• 不要围绕 Griffin 做规划。如果你需要得到解答的问题是,在一分钟的通话中,人能否分辨出生成的人与真人,或者了解交互层的走向是否应影响你当下在剪辑层上构建的东西,那就申请访问权限。
• 关注两件事,而不是一件。在 Kling 方面,层级差异是否开始与价格挂钩,因为目前四个层级在图生视频上的 Elo 分彼此相差不到 19 分,而价格却高出五成,并且最便宜的层级并不是排名最差的。在 Griffin 方面,是否会出现披露机制和模型卡;如果出现,那么比较就不再是一篇设计文章,而开始成为一项采购决策,这篇文章将需要重写。

