
Tavus Griffin 与 Google Veo 3.1 对比:一个给每一帧都加水印,另一个骗过了房间里 48% 的人
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
把Tavus Griffin和Google Veo 3.1并排放在一起,传统的对比维度——每秒价格、Elo 评分、片段时长——立刻就不成立了,因为这两者中只有一个有定价,也只有一个在买家能查到的任何指标上有评分。但它底下藏着一条真正的轴线,而且它无关质量。谷歌对合成媒体的回应是让它可被检测:每一段 Veo 3.1 的输出都带有 SynthID——一种逐帧写入像素、并写入音频频谱的隐形水印——外加记录文件来源的 C2PA Content Credentials;谷歌还把一个检测器装进了 Gemini 应用,用户可以直接询问某段视频是否由 Google AI 生成。Tavus Griffin 声称自己之所以以预览版而非产品的形式存在,其理由恰恰构成它的镜像:在 Tavus 自己的实况研究中,54 名参与者里有 26 人在结束一分钟视频通话时相信对方是真人,而该公司上一代技术栈的这一数字是 41 人中的 1 人;Tavus 表示,在它想清楚该如何披露自己的真实身份之前,会一直压着这个模型不发。这两家厂商中,一家卖的是检测。另一家眼下正是检测之所以重要的原因,而且它自己心知肚明。
两款建立在相反假设之上的产品
Veo 3.1 是一款适用范围被刻意设定得很窄的片段生成器。在 Google 的 Gemini API 上,它每次生成 4、6 或 8 秒的片段,帧率为 24 fps,原生分辨率为 720p;而 1080p 和 4K 则通过 2026 年 1 月更新中加入的超分处理环节实现。扩展功能每次增加七秒,最多可重复二十次,理论最高约为 148 秒,但输入必须是 Veo 生成的片段,时长不超过 141 秒,分辨率为 720p,宽高比为 16:9 或 9:16;并且,对于扩展、参考图像输入以及任何高于 720p 的内容,八秒时长都是强制要求。你无法制作四秒的 1080p 片段。输出是一个归你所有的文件,带有水印,并附有一份已签名的溯源记录。
Griffin 不生成文件。它运行一场对话。一个连续对话建模(Continuous Conversational Modeling)引擎接收音频和视频,以亚秒级间隔重新评估交流,决定是保持沉默、发出信号、附和还是接话,并输出富有表现力的控制指令,共同驱动流式语音生成器和流式视频生成器。视频生成器以 320 毫秒为块、一次一个潜变量、以 25 帧/秒,从单张参考照片生成 720p 视频,并在解码每个块时播放它。没有片段长度,因为没有片段;存在的是一场持续到有人停止说话的会话。
这一区别几乎决定了本次对比中的其他每一项。Veo 3.1 的边界是一组制作流程可以据以规划的约束——八秒的镜头清单、用于更长镜头的延长阶梯、固定的 24 fps、已知的分辨率阶梯。Griffin 的输出则完全无法事先做成故事板,因为它渲染出什么取决于这个人接下来做什么。
Veo 3.1 各档位的费用是多少
谷歌公布的 Gemini API 价格已包含音频,按输出时长每秒计费,并且任何 Veo 3.1 层级都没有免费额度。在该 API 上无法关闭音频——每次请求都会生成音频——这一点很重要,因为第三方来源描述了一份 Vertex AI 价目表,其中无声视频的费用大约只有含音频价格的一半。谷歌自己的文档并未提供这一开关。如果无声费率对你的账单有影响,请以你自己的 Vertex 账单为准进行核实,而不是参考对比页面,包括本页面。
• Veo 3.1 Standard — 720p 和 1080p 下每秒 $0.40,4K 下每秒 $0.60。
• Veo 3.1 Fast — 720p 为 $0.10/秒,1080p 为 $0.12/秒,4K 为 $0.30/秒。
• Veo 3.1 Lite — 720p 下每秒 $0.05,1080p 下每秒 $0.08,且不提供 4K 档位。
套用八秒规则来算这些费率,单次尝试成本才是创意团队实际做预算时真正依据的数字:在 Standard 上生成一条八秒的 1080p 镜头是 32 美分,同样分辨率下生成一条四秒的镜头是 80 美分,因为八秒下限在低于 720p 时不适用;而生成单条八秒的 4K 镜头是 4.80 美元。最后这个数字值得好好琢磨,因为为了一条可用的 4K 镜头进行四次尝试,花费略低于二十美元,而八秒的时长要求意味着你无法用一半长度、一半价格来测试这个创意。
Griffin 没有价格、没有免费套餐,也没有任何形式的费率表。Griffin-Lite 以研究预览形式通过申请表提供给部分受信任的测试者,不在 Tavus 平台上,而且公告明确表示,此时它不会供客户使用。Tavus 在该页面上的结束语是,一旦公司弄清楚如何安全地发布 Griffin,Griffin 就会到来。本文中每一条在类似购买决策的方面对两者进行比较的说法,在 Griffin 的那一半都存在漏洞,而且再多的研究也填补不了。
两个记分牌究竟衡量的是什么
这两个模型之所以由不同的工具进行评估,原因与它们难以相互定价的原因相同。
Veo 3.1 现已在 Artificial Analysis 的视频竞技场中登场,其 Elo 分数来自人类对短片的盲测两两偏好。于 2026 年 10 月 2 日读取自带音频的文生视频排行榜:
• Veo 3.1 — 第18–21名,基于2,857票的Elo 968(±11),每分钟$24.00。
• Veo 3.1 Fast——18–21日,3,595 票中 Elo 961(±10),每分钟 $7.20。
• Veo 3.1 Lite — 第21–24名,Elo 949(±11),基于2,762票,每分钟4.80美元。• Veo 3.1 在图像转视频(含音频)中 — 在34个中排名第11,Elo 1,082,基于7,049票,每分钟24.00美元。这是它在任何榜单上的最佳名次,也是其背后票数最多的一个。
由此可以得出两点。三个档位彼此相差都在十九个 Elo 积分以内,且置信区间相互重叠,因此标准档每秒四倍的价格并未换来可测量的盲测偏好。而谷歌自家更新的 Gemini Omni Flash 系列在同一榜单上排名高于所有 Veo 3.1 档位——以 Elo 1,117、7,801 票、每分钟 9.12 美元位列第 7–8 名,领先所有三个档位,而每分钟成本只有后者的四分之一到五分之一——这是每个 Veo 3.1 买家都应该问的问题,而本文并不适合回答这个问题。
Griffin 的数字来自 NVIDIA 的 VideoFDB,这是 NVIDIA 构建并在 2026 年 9 月独立评分的一个全双工音视频对话基准。Griffin-Lite 在生成赛道上得分 3.83(满分 5 分),人类参考为 3.92,而下一个最高已发布系统为 2.80;在感知赛道上得分为 3.73,人类参考为 4.20。Tavus 还报告称,在 H100s 上,其生成器相对于四个已发布的流式扩散基线实现了 0.43 秒的真实音频到视频延迟,并将其描述为次快者的一半。
这两组评估结果都不能迁移。来自短视频偏好投票的 Elo 分数,说明不了模型能否被中断;评审在对话上的评分标准得分,也说明不了一段视频在 4K 下画面是否正常。而且这些限定条件双向都成立:在由语言模型评判的五分制评分标准上,Griffin 与人类参考之间 0.09 分的差距已小到足以让“接近人类”成为诚实的解读;而它在感知方面的一部分领先优势,还是相对于完全未使用视频输入运行的系统测得的。

溯源,才是真正的产品差异
对于任何负有披露义务的企业来说,这是唯一重要的部分,而且其他部分根本不能与之相提并论。
Veo 3.1 的输出在像素和音频频谱中逐帧携带 SynthID,其设计可承受压缩、调整大小、裁剪和屏幕录制,并且 C2PA Content Credentials 记录文件来源和编辑历史,可与 Adobe 和 Microsoft 的实现互操作。Google 已将检测功能集成到 Gemini 应用中,因此用户可以上传视频并询问是否是 Google AI 制作的,检测功能会报告音频或视频轨道的哪个部分带有标记。这一限制是真实存在的,值得说明:该检测器仅识别 Google 的模型。阿里巴巴或快手的产品中没有任何可比的东西,Tavus 的也没有。

Tavus 尚未为 Griffin 发布水印、检测器或内容凭证流水线。它已经发布的,恰恰是它为什么需要这些东西的原因。这项面对面研究对失效模式的描述异常直白:超过半数的参与者表示,通话期间自己从未想过对方可能是 AI;该群体中几乎所有人都断定自己的交谈对象是真人;而确实起疑的人,往往会在最初二十秒内就想明白。相信者的平均确信度为 79%,怀疑者为 81%。这说明,这个模型的欺骗性并不是生成质量带来的副作用——它就是生成质量本身。
Tavus 的回应是在公告中,而不是在脚注里:让 Human Interaction Models 成为强大自然交流接口的那些特性,也会让它们能够欺骗人类,使其相信它不是 AI,因此安全发布还需要进一步的对齐与安全程序,而该公司正在开发安全披露功能,并与致力于 AI 安全的组织合作。这就是这道关卡存在的原因。Griffin-Lite 目前不会提供给客户使用。
Google 带来而 Tavus 不具备的企业条款
Veo 3.1 通过 Vertex AI 提供服务,随之而来的是区域性基础设施、IAM 以及这所意味着的企业合同层面,而 Google 按司法管辖区限制模型的行为:通过人物生成参数,欧盟、英国、瑞士和中东及北非地区仅允许成人主体,而其他地区则可允许所有主体。这是一个有文档记录、能感知区域的策略面,对于受监管的买家而言,它可能比排行榜上的名次更重要。
这种格局是有代价的。Veo 3.1 在 Gemini API 上的模型 ID 仍是预览版 ID——veo-3.1-generate-preview及其同类——而在 Vertex 上,该 SKU 采用的是正式可用(GA)命名,第三方报告称,预览版配额大约只有生产配额的 1/5。Google 已于 2026 年 6 月 30 日停用较旧的 Veo 3.0 SKU,这说明了代际更替是如何处理的,也值得在为任何基于预览版 ID 构建的产品定价时纳入考量。面向消费者的入口也确实受到严格限制:Flow 需要 Google AI Pro 或 Ultra 订阅,并且在欧盟、英国、印度、印度尼西亚、中国大陆和俄罗斯被屏蔽,且不提供 VPN 绕过方案。
Griffin 没有服务条款可读,因为根本不存在服务。获取访问权限的方式是一份申请表格和一个研究预览版。Tavus 表示正在与安全组织合作开展评估,并希望人们参与其中,这是一种研究姿态,而非商业姿态。
得到其中任何一个
Veo 3.1 可通过 Gemini API、Vertex AI、Google AI Studio 和 Flow 访问,并且只能通过 Gemini 应用以 720p 使用。在中国以外,它获取密钥的难度远低于两者中的另一个,这与上述质量方面的论点相悖,也是尽管数据如此、这一比较依然有趣的主要原因。
Griffin 只能通过提交访问申请并被选为可信测试员来获取。这就是完整的采购路径。
在 Veo 流水线中,路由器真正能帮上忙的地方,是在视频模型旁边,而不是在它内部。Google 的文本模型——Gemini 3.5 Flash、Gemini 3.1 Pro Preview、Gemini 3.6 Flash 以及该系列其余模型——都在 OrcaRouter 目录中,并且可以和 200+ 其他模型一样,通过同一个 OpenAI 兼容端点调用,按提供商标价、0% 加价。分镜清单、提示词扩展、字幕生成、八秒片段之间的连续性备注,以及审阅摘要,全都是文本工作,而这正是这样一个层面:能把便宜模型用于批量处理、把前沿模型用于最后一遍,代价只是改一下配置,而不是做一次迁移。Veo 3.1 本身我们不做路由,Griffin 也不做;这一点值得明确说明,而不是让像上面这样的段落暗示并非如此。
说真的,哪一个
• 当交付物需要来源溯源记录、买方属于受监管行业、分发必须采用附带凭证的文件形式,或者 4K 不可妥协时,请选择 Veo 3.1。在每个成本模型中为八秒下限预留预算,并在基于 preview-ID 构建面向客户的路径之前,检查其生命周期。
• 不要选择 Griffin,因为你无法选择。如果你的问题是在一分钟通话中,一个人能否分辨出 AI 与人类,或者你需要在把路线图投入到剪辑层之前了解交互层将走向何方,那就申请访问权限。
• 关注检测器,而不是演示。如果 Tavus 发布一种能在随意对话中依然奏效的披露机制,那么这两家供应商之间的差距将大幅缩小。如果它没有,Griffin 就是一个值得引用的结果,而 Veo 3.1 仍是这两者中唯一能摆到合规团队面前的那个。

