一张“Tavus Griffin vs Alibaba Wan 2.7”的主视觉卡片,带有两个标签,分别写着“Tavus Griffin — 未公布价格”和“Alibaba Wan 2.7 — 1080p 下每分钟 $9.00”,上方是六行内容:制作:实时对话;对比:2 至 15 秒短片;Griffin 价格:未公布;Wan 2.7 价格:每分钟 $9.00;Griffin 状态:研究预览;Wan 2.7 状态:正式可用。页脚:“Wan 2.7 的费率为阿里云目录价;Griffin 是研究预览版,没有价目表。”
Guides & Insights

Tavus Griffin 与 Alibaba Wan 2.7:对话模型对决生成模型

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

按视频秒数来比较Tavus Griffin和Alibaba Wan 2.7很诱人,但这种比较根本无法成立。Wan 2.7 有一份公开的价目表——在阿里云国际新加坡节点上,1080p 为每分钟 $9.00,北京和东京节点则有更便宜的一档——而 Tavus Griffin 压根没有价目表,因为 Griffin-Lite 于 2026 年 10 月 1 日作为研究预览版发布,仅面向通过申请表筛选出的部分受信任测试者。两者真正共有的只是一个词:视频。除此之外,它们回答的是不同的问题。一个被问的是对话中接下来应该发生什么;另一个被问的是所描述的场景长什么样。有意思的比较不在于质量,而在于它们在产出任何东西之前各自需要你提供什么,以及你会得到什么。

区别在于循环,而不是分辨率

Wan 2.7 根据提示词逐个片段地生成视频。你写一段描述,得到一段素材,看一看,再写下一段。Wan 2.7 是一套包含四个模型的套件——文生视频、图生视频、参考生视频和视频编辑——其交互本质上是交易式的:一次输入、一个渲染输出,以及一个是否保留它的决定。在你还在思考要提出什么请求时,它不会运行任何东西。

Griffin 的构建方式截然相反。它是一个全双工系统:一个持续对话建模引擎,接收音频和视频,并以亚秒级间隔重新评估对话,决定是保持沉默、发出信号、随声附和还是接过话轮,同时输出富有表现力的控制信号,驱动流式语音生成器和流式视频生成器并行工作。它能从单张参考照片生成 720p、以 320 毫秒为单位的视频块,而真正重要的主张是:在句子中途做出的决定,会在同一个迷你话轮内体现在声音和面容上。衡量它的基准不是剪辑片段的排行榜,而是你是否能打断它。

简单来说:Wan 2.7 回答的是"这个场景动起来是什么样子?"这一问题,而 Griffin 回答的是"鉴于这个人刚刚停顿了一下,这张脸和这个声音在接下来两百毫秒内该做什么?"

价格,在有的那一侧

Wan 2.7 公布的费率是按生成视频的每秒计算的,而整个套件中各档位并不统一,这正是大多数对比页面所忽略的细节。

• wan2.7-t2v 和 wan2.7-i2v — 仅按输出时长计费。国际(新加坡):720p 为 $0.10/秒,1080p 为 $0.15/秒,也就是排行榜上显示的 $9.00/分钟这一数字。北京和东京对相同工作列出 $0.086/秒和 $0.143/秒。

• wan2.7-r2v(参考生视频)——按输入视频时长计费,上限为五秒,另加输出时长。把一段五秒的参考视频用于一段十五秒的生成,你将被计费二十秒。

• wan2.7-videoedit — 仅按输出计费,输入素材免费。

那些数字旁边,还应该附上两个生命周期方面的事实。阿里巴巴为自家的百炼和Qwen Cloud平台推出了限时30%的发布折扣,有效期截至2026年9月23日,如今已经过期。而阿里云Model Studio的退役通知(ID 118434)将于2026年10月10日让若干较旧的模型下线,其中包括wan2.7-r2v和wan2.7-image。这是变体层面的退役,而不是整个代际的退役——wan2.7-t2v和wan2.7-i2v仍在列,拥有实时价格,页面最近一次更新是在9月11日——但如果你看2.7正是因为参考生视频,那这条路径已经标上了日期。

与 Griffin 的对比中有一句实话:没有价格可以放在 Wan 2.7 的价格旁边,因为 Tavus 没有公布任何价格。Griffin-Lite 不在 Tavus 平台上,公告称它目前不会开放给客户使用,而公司自己的结语是,Griffin 要等到它想清楚如何安全发布之后才会推出。没有按秒费率,没有按请求费率,没有免费套餐,没有企业套餐。任何给 Griffin 报价的人都是在凭空编造。

质量评分:两块不达标的板

这两个模型是用完全不同的评测工具打分的,因此它们之间不存在 Elo 比较。

Wan 2.7 在 Artificial Analysis 的视频竞技场上有两个条目,而它们并不处于同一位置——这正是为其引用单一数字时的陷阱所在。那里的 Elo 源自盲测成对人工偏好投票,这套方法论是为短生成片段而构建的,下面两项读数均来自 2026 年 10 月 2 日读取的榜单。

• Wan2.7-260612(6 月版本)在文生视频(带音频)中 — 第 13–14 名,Elo 1,032(±10),共 4,645 票,$9.00/分钟。

• Wan 2.7(4 月版)在图生视频(含音频)类别中——34 项中位列第 12,Elo 1,077,共 4,571 票,$9.00/分钟,该榜单的票数大致相同,却将其排在明显更高的位置。

• Wan 3.0——更新的同门版本——在文生视频以 Elo 1,157 位列第 1,在图生视频以 1,164 位列第 6,两者均为 $12.00/分钟。在你把 Wan 2.7 与任何东西比较之前,这个数字值得知道:阿里巴巴自家的下一代是榜首之作,而 2.7 只是中游之作。

A screenshot of the top of Artificial Analysis's "AA-Video-T2V v2.0" leaderboard, text-to-video with audio, captured 2 October 2026: Wan 3.0 first at Elo 1,157 with 7,575 votes and $12.00/min; Utopai X (based on MiniMax H3) second at 1,150; Dreamina Seedance 2.5 third at 1,144; MiniMax H3 (768p) fourth at 1,139 and $4.80/min; MiniMax H3 Max fifth at 1,134; FLUX 3 sixth at 1,127; Gemini Omni Flash eighth at 1,117 and $9.12/min; Wan2.7-260612 thirteenth at 1,032 with 4,645 votes and $9.00/min; and the two Kling 3.0 1080p tiers sixteenth, at Elo 1,018 and Elo 1,000.

Griffin 基于 NVIDIA 的 VideoFDB,这是一个用于全双工音视频对话的基准测试,由 NVIDIA 构建,并于 2026 年 9 月使用语言模型评审依据 0 到 5 分评分标准独立评分。Griffin-Lite 在生成赛道上得分 3.83,人类参考为 3.92,而次高的已发布系统为 2.80;在感知赛道上得分 3.73,人类参考为 4.20。Tavus 还报告,该生成器在 H100 上相对于四个已发布的流式扩散基线实现了 0.43 秒的真正音频到视频延迟。

两组数字都站得住脚,而且两者都不可直接套用。竞技场上的 Elo 是关于片段偏好的投票计数;VideoFDB 是评委针对对话行为的评分量表得分。两者之间没有桥梁,而低样本陷阱也会反向出现:竞技场在 Wan 2.7 上的 ±10 区间足够宽,以至于它相对邻近模型的排位并未被紧密确定,而 NVIDIA 与人类之间 0.09 分的生成差距,在五分制评分量表上小到足以让“接近人类参考”成为诚实的解读,而不是“达到人类水平”。感知比较也不是同类相比——Griffin 被排在其前面的若干系统,包括 OpenAI 的 gpt-realtime 和 MiniCPM-o 4.5,是在仅音频配置下评分的,而 Griffin 还能感知视频。这 0.29 分领先优势中,有一部分衡量的不过是拥有视觉能力。

每个对你的需求

这正是比较变得有用的地方,因为输入就是产品。

• 输入——Wan 2.7 接受文本、图像、视频和音频。Griffin 则通过摄像头和麦克风获取真人,根本不会根据请求生成视频片段。

• 输出——Wan 2.7 生成视频文件,每次生成时长 2 至 15 秒,最高 1080p,并带原生音频。Griffin 生成的是持续进行的对话:720p 视频,25 fps,以 320 毫秒为一块,实时生成并在解码的同时播放。

• 什么在控制它——Wan 2.7 由提示词以及最多五张主体图片和五段参考片段控制,每次请求最多可使用十个参考资源。Griffin 则由人的行为控制:停顿、移开视线、手势、打断。

• 时间范围——Wan 2.7 的工作单位是一个最长十五秒的片段,然后由你自行拼接。Griffin 的工作单位则是一段对话,这正是该架构必须解决漂移问题的原因——通过三阶段蒸馏得到一个自回归生成器,并在其自身生成的历史上进行训练,从而使长程展开保持稳定——而不是一味争取更长的单次生成。

• 输出容器 —— Wan 2.7 交回的是一个归你所有、可供你编辑、调色和分发的文件。Griffin 交回的则是一个渲染后的会话。这里没有文件可编辑,因为像素是根据一张参考照片和模型自身的历史记录逐块生成的,而背景、阴影以及人物所坐的椅子都属于生成内容的一部分。

有一个值得指出的结构性差异:Wan 2.7 的成本随输出时长而变化,其质量则随你的提示词有多具体而变化。Griffin 的成本尚未被测量,其质量则随另一端的人有多自然而变化。你可以通过撰写更好的简报来改善前者,而后者只有通过与真实的人一起使用才能改善。

A screenshot of the top of Artificial Analysis's "AA-Video-I2V v1.0" leaderboard, image-to-video with audio, captured 2 October 2026: MiniMax H3 Max first at Elo 1,195; MiniMax H3 second at 1,181; Gemini Omni Flash third at 1,178; Dreamina Seedance 2.0 720p fourth at 1,176; HiDream-O1-Video-1.0 fifth at 1,175; Wan 3.0 sixth at 1,164 with 9,302 votes and $12.00/min; Veo 3.1 eleventh at 1,082; and Wan 2.7 twelfth at Elo 1,077 with 4,571 votes and $9.00/min. A note above the table says "AA-Video-I2V v2.0 is coming soon".

参考与一致性,两种设计在此碰撞

Wan 2.7 通过提供的参考内容控制主体一致性:五张主体图像、五段参考片段,共十项素材。这是一种摄影式的方法——你向它展示主体的外观,它便在整个生成过程中保持这一外观。

Griffin 则以相反的方式控制同一件事。它基于一张参考图像实时生成每一帧中的每一个像素,并且其公告明确表示,它控制的是整个场景,而不只是面部:手臂和手指、椅子的移动、投下的阴影以及背后的背景。在这里,一致性是通过将环境本身作为生成目标、而非合成用的底板来实现的。

两种方法都没有绝对优劣,它们的失败方式不同。参考条件生成会在长片段中偏离所提供的对象。带自回归历史的分块生成若漂移处理不当,会在长会话中发生游移,而这正是第三蒸馏阶段旨在防止的失败。当交付目标是特定造型下的特定人物时,Wan 2.7 是更稳妥的选择。Griffin 并不是在争夺这一需求。

安全性、溯源与发布态势

Wan 2.7 未搭载任何已发布的溯源系统,无法媲美能经受压缩的水印——公告将音频质量和屏幕文字准确性列为仍需改进的领域,这属于保真度层面的说明,而非安全层面的警示。

格里芬的安全叙事是反过来的:Tavus 给出的将其保持在预览状态的理由是,那些让它成为更好界面的特性,同样也让它更擅长让人相信自己正在与真人对话,而数据也印证了这一担忧。在该公司自己的实况研究中,54 名参与者里有 26 人相信自己的对话对象是真人,而在此前 Phoenix-4.5 / Raven-1 / Sparrow-2 技术栈上,41 人中只有 1 人这样认为。那些确实产生怀疑的参与者,往往在最初二十秒内就开始怀疑。Tavus 表示,在发布之前还需要开展进一步的对齐与披露工作,公司正在构建披露功能,并正与各机构合作开展安全评估。这是目前关于该模型所发表的最有实质内容的信息,也正因如此,还没有产品可供购买。

对于任何把这两者作为工具来比较的人而言,实际的后果很简单:一个可以按需生成、今天就能交付上线,另一个则是评估对象,其发布受制于厂商尚未解决的一个问题。

哪个,为什么

• 如果交付物是视频素材,就选 Wan 2.7。基于指令对现有素材进行编辑,正是它表现格外强劲、成本格外低廉的工作负载,因为编辑版仅按输出计费,并把输入素材视为免费。其参考图生视频(reference-to-video)版本值得在 10 月 10 日停用之前核对清楚,再决定是否采用。

• 本季度不要将 Griffin 用于任何事情,因为你无法这样做。如果你需要知道一个人是否能分辨,或者你的路线图依赖的是交互层而不是影像层,请申请访问权限。

• 要盯住差距,而不是任何一个模型。Griffin 的到来让更值得做的比较成为一个面向未来的比较:一个生成整段对话的系统,对比一个生成整个场景的套件。第一个两者都能做到的产品,才是值得拿这篇文章来重新对照的那个。

路由器适合用在哪里,又不适合用在哪里

这两个模型都不在 OrcaRouter 目录中,而在本节其他内容之前,这一点值得先说明。Wan 2.7 可通过阿里巴巴自有平台——阿里云上的 Model Studio 和 Qwen Cloud——以及在上线后集成它的第三方创意工具访问;Tavus Griffin 则只能通过申请表获取。如果其中任何一个变得可路由,它们将按提供商标价显示。

视频流水线中属于路由问题的部分,是围绕它的文本。镜头清单、提示词扩展、字幕生成、质量审核摘要,以及为参考生视频环节提供输入的转录或对白工作,全都是文本调用,而这些调用在 OrcaRouter 上运行在同一个 OpenAI 兼容端点,与 200 多个其他模型一样按提供商标价,加价 0%,因此供应商降价当天就会生效,而不是要等一个合同周期之后。把便宜模型分配给批量环节、把前沿模型分配给最终环节,在那里只是改一项配置,而不是建立第二个供应商关系——一旦生成层成为你可以调用的东西,同样的论点也适用于生成层。

需要关注的是:Wan 2.7 套件中的参考变体和编辑变体能否在 10 月 10 日 Model Studio 退役后原样保留,以及 Griffin 的安全门是否会产出一张已发布的模型卡并在其上附有端点。正是这两件事会让这份比较从一篇设计论述变成一项采购决策。

A two-column scoreboard titled "Tavus Griffin vs Alibaba Wan 2.7 — the scoreboard". Left column "Tavus Griffin": Makes: a live conversation; Price: none published; Output: 720p in 320 ms chunks; Input: a person on camera; Clip length: none - a session; Score: VideoFDB 3.83 of 5. Right column "Alibaba Wan 2.7": Makes: 2 to 15 second clips; Price: $9.00 per minute; Output: up to 1080p; Input: text, image, video; Clip length: 2 to 15 seconds; Score: arena Elo 1,032. Footer: "Wan rates per Alibaba Cloud; Elo per Artificial Analysis, 2 October 2026. Griffin figures Tavus-reported."