Tavus Griffin 的主视觉标题卡,副标题为“首个人类交互模型——于 2026 年 10 月 1 日发布”,上方有三枚标签,分别写着“48% 的人认为它是真人”“VideoFDB 生成得分:3.83,人类参照为 3.92”以及“音频到视频延迟 0.43 秒”。页脚:“所有数据均由厂商和 NVIDIA 提供;Griffin-Lite 为研究预览版,尚未全面开放。”OrcaRouter 标识合成于右下角。
Guides & Insights

Tavus Griffin:首个人类交互模型,以及通过视频图灵测试的48%

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

五十四人中有二十六人完成了一分钟视频通话,并说对方是真人。这就是 Tavus 为Tavus Griffin主打的数字;该产品于 2026 年 10 月 1 日发布,而且这确实是一个惊人的结果:在同一套协议下,该公司先前的技术栈——Phoenix-4.5 渲染面部,Raven-1 负责感知,Sparrow-2 管理对话轮次动态——只让四十一人中的一人相信,即 2.4%。对这个跃升的两种显而易见解读都是错的,而区分二者,正是接下来大部分内容要做的。Griffin 并不是更好的虚拟化身引擎,也不是一款你能买到的产品。它是一个名为 Griffin-Lite 的研究预览版,仅面向部分受信任的测试者开放,没有定价、没有公开 API,也没有进入任何独立视频排行榜。这两件事同时为真,才是真正的故事。

48%衡量的是什么,以及它不衡量什么

这项研究是一场面对面的图灵测试,而非偏好调查;该实验方案之所以值得被准确陈述,是因为它是整个主张的承重所在。54名参与者通过一个独立研究平台招募,并被告知他们将与另一位参与者配对,进行一分钟的视频通话,谈论自己今年期待的事情。他们的搭档是一个运行 Griffin-Lite 的 PAL,实时生成面部、声音和回应。只有在调查结束时,他们才被问到是否曾想过搭档可能不是真人;随后,每位参与者都被告知对方是 AI。对照运行在较旧的技术栈上使用了相同的实验方案,共有41名参与者。

支撑性数据与标题同样重要。相信者很有信心——平均79%——怀疑者也是如此,达到81%,而这正是研究想要的结果:没有人在猜。超过一半的参与者表示,通话期间这种可能性压根没有在他们脑海中闪过,而这一群体中几乎所有人随后都表示,对方是真实的。确实起了疑心的参与者,往往是在最初二十秒内就产生了怀疑。这是报告中最令人不安的一句话,也应当决定你之后如何解读安全部分。

在七分制量表上,该模型的平均得分分别为:在“显得自然”方面为5.4,在“显得值得信赖”方面为5.6,在“参与者是否愿意再次与它交谈”方面为5.8——即便在正确识别出它是AI的参与者中,这一分数也保持在5.4——以及在“他们是否觉得自己的对话伙伴真的在倾听”方面为5.5。最低分为4.9,对应“对话是否自然流畅”。作为一组来看,这是一个特定的画像:Griffin-Lite在一个个瞬间里令人信服,而作为一段完整的弧线则略逊一筹。

独立基准测试,以及如何解读其两条轨道

质量数字来自NVIDIA的VideoFDB,这是一个全双工音视频对话基准测试,它从两个独立的赛道给模型打分——生成,指模型是否做出正确的行为;感知,指模型是否理解当下的情境——每个赛道都有自己的评分标准和自己的排行榜。NVIDIA构建了该基准,用自己的评判器依据已公布的指标进行评估,并以零到五分的量表对回复打分。Tavus没有运行它,而这正是引用它的原因。

• 生成 — Griffin-Lite 得分为 3.83,已发布系统中次高者得分为 2.80(Gemini 2.5 搭配 Anam),而人类真值参考为 3.92。这比最佳可比系统高出 1.03,比人类低 0.09。

• 感知 — 相对于 4.20 的人类参考值,得分为 3.73;而所报告的最强基线为 3.44,即纯音频配置下的 MiniCPM-o 4.5。Gemini 2.5 Flash Native 得分为 3.17,OpenAI 的 gpt-realtime 得分为 2.97。

• 接管率对齐度——生成任务上为 62.8%,感知任务上为 73.8%。这衡量的是模型关于何时发言的决策与参考对话中时机的匹配程度,而 Tavus 称这两项均为榜单上所有系统中最高的。

在这些数字被任何人复述之前,它们需要附带两点说明。与人类的生成差距为 0.09,基于语言模型评判的五分制,这更应被解读为“在该评分标准上接近人类”,而非“达到人类水平”。而且,感知比较并非同类对比:MiniCPM-o 4.5 和 gpt-realtime 是在仅音频配置下评分的,而 Griffin 还能读取视频。相较仅音频基线领先 0.29 点是真实的,但它衡量的部分内容是拥有眼睛的价值。

厂商自家的那句总结——在 NVIDIA 针对面对面 AI 的独立测试中位列第一,在即时反应上比排名第二的 AI 领先 37%——只是对同一组数据的包装描述,而非一项单独的发现。应保留底层的赛道得分,而不是这种表述框架。

A screenshot of NVIDIA's VideoFDB project page, captured 2 October 2026: the heading "VideoFDB — Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents", the note that it is the first benchmark for full-duplex audio-visual-to-audio-visual conversation, the author list (Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello) credited to NVIDIA, links to leaderboard, paper and Hugging Face dataset, and an abstract arguing that natural conversation is full-duplex.

两个引擎,同时运行

这个架构层面的说法比围绕它的营销宣传更容易评估,因为它说的是什么东西在并发运行。Griffin 被描述为两个并行工作的系统,而不是一条在各阶段之间交接的流水线。

第一个是连续对话建模引擎。它接收人物的音频和视频,并以每不到一秒的间隔重新评估这段交流——Tavus 称之为迷你轮次——在每个间隔中决定是保持沉默、发出信号、做背景回应,还是接过话轮。其输出不仅是词语,还有一组表达性控制,承载着时机、姿态、面部表情和手势。这一设计的要点在于,句子中途做出的决定会在同一个迷你轮次内体现在声音和面部上,而不是在一次交接之后,这正是让模型能够在被打断时停下、在倾听时点头,并把思考时的停顿当作并非话轮结束的东西来对待的原因。

第二个是视听生成引擎,将那些控制同时转化为声音与像素:一个流式语音生成器和一个流式视频生成器由同一组信号驱动,因此语调的变化与表情的变化落在同一个节拍上。

关于 Tavus 随此发布的一份材料,需要诚实说明一点,因为它很容易被误认为是测量结果。页面自身文字中已给一段九秒交流的交互式图表加注,说明其仅作示意,并明确表示并非从真实会话中测量。同样的告诫也适用于“轮次式与全双工”的时序图。真正经过测量的是更下方给出的延迟数字。

流媒体技术栈内部

音频部分围绕一个名为 Tavec 的编解码器构建,这是一种卷积自编码器,可将 48 kHz 音频映射为每帧 40 个值的连续潜变量,帧率为每秒 100 帧,且不使用码本。其解码器完全因果,因此可以跨块携带状态,并以小至 10 毫秒的音频包输出,无需前瞻。一分钟的语音是 6,000 个潜变量帧,而不是 288 万个原始样本,这正是使序列足够廉价,让语音 transformer 能以快于实时的速度进行预测的原因。语音生成器本身是一个自回归扩散 transformer,它以编码后的说话人前缀为条件——只需大约十秒的音频即可克隆一个声音——并在控制信号到达时一次生成一个潜变量块,因此播放会在话语结束之前就开始。

视频侧同样基于这一前提:强时间压缩才能让扩散模型快到足以进行对话。一个少步自回归生成器接收一张参考照片、流式音频和流式控制信号,并每一步生成一个潜在表示,每个潜在表示进行三次扩散步骤。VAE 将时间压缩八倍,因此在 25 fps 下,一个潜在表示是八帧,即 720p 视频的 320 毫秒。较旧的潜在表示以逐渐降低的分辨率保留,从而使长时间推演保持成本可控。结果是一个生成器,能以 320 毫秒为块实时输出 720p。

达到这一点需要从大型双向多步扩散教师模型进行三阶段蒸馏:先用分布匹配蒸馏(Distribution Matching Distillation)得到少步学生模型,再通过教师强制将该学生模型转换为一次生成一个潜变量的自回归模型,最后在模型自身生成的历史上进行自强制训练,并加入一个作用于历史帧的机制,使长时推演不会漂移。第三阶段正是用来解决这类模型通常存在的失效模式——在持续数分钟的对话中,人脸逐渐退化,或背景缓慢漂移。

延迟数字,这才是真正的产品卖点

在音频到视频场景下,与四款已发表的流式扩散模型相比,每个模型接收语音和参考图像,并且必须生成说话人脸,Griffin-Lite 的生成器在 H100s 上平均实现了 0.43 秒的真实音频到视频延迟——即从一段音频到达,到视频显示出其效果所需的时间。Tavus 称这仅为次快方法的一半。它还报告在 DOVER 和 FID 感知质量以及 THEval(一个说话头评估框架)上排名第一,并在 LSE-C 唇同步置信度上以 7.27 排名第二,落后于一个基线——供应商指出,LSE-C 会奖励明显的嘴部运动,包括超出看起来自然程度的运动。

所有这些都是 Tavus 对照其自行选定的基线所做的自身测量。它们之所以有用,是因为它们很具体,而且 0.43 秒这个数字属于那种在实时测试中要么经得起检验、要么经不起检验的数字。它们并不独立,本文中唯一独立的分数就是上面的两条 VideoFDB 赛道。

A screenshot of Tavus's own Griffin announcement page at tavus.io/griffin, captured 2 October 2026: the heading "INTRODUCING GRIFFIN", the strapline "The First Human Interaction Model", the description of Griffin as the world's first Human Interaction Model that listens while watching expressions and pauses, and the byline "By: Hassaan Raza, Ioannis Patras, Head of Tavus Research Team".

为什么没有可供比较的价格

Griffin-Lite 今天以研究预览的形式面向一小部分精选早期测试者开放,后续将更广泛地发布一款能力更强的模型。此时它不会面向客户使用。访问需通过申请表单。它不在 Tavus 平台上,公司在公告中的结束语也明确说明了这一点:Griffin 尚未登陆 Tavus 平台,要等 Tavus 找到安全发布它的方法后才会推出。买家通常会比较的一切——按秒或按请求计费、模型标识符、速率限制、SLA、区域列表——目前都还不存在。对于今天就想构建的人,Tavus 指向的是已有 150,000 名开发者和企业正在使用的模型,也就是那三个前代模型,而不是 Griffin。

这不是一个可以放在脚注里的技术细节。它改变了这个模型眼下的用途。对于产品成败取决于人能否分辨出来的团队来说,它是一个评估目标;它也释放出供应商路线图走向的信号。它不是本季度可以拿来搭建面向客户路径的东西。

安全门禁就是发布计划

Tavus 关于 Griffin 所写的最有趣的内容并不是关于这个模型本身。而是它承认:那些让人类交互模型成为更好界面的特性,同样也让它更擅长欺骗某人,使其相信它不是 AI;在安全发布之前还需要进一步开展对齐与安全工作;以及该公司正在开发披露功能,并与相关组织合作进行 AI 安全评估。鉴于近一半的实时样本无法分辨,而那些能分辨的人大多在二十秒内就识破了,一个能在随意交谈中依然有效的披露机制绝非可有可无。

有两件事会实质性改变这篇文章。一份已发布的、带有端点和价格的模型卡,会把 Griffin 从研究成果变成采购问题。而独立视频排行榜上的一个条目——但需说明,这些排行榜按成对偏好为短视频片段评分,并非为给实时对话评分而构建,因此这种不匹配可能是永久性的,而非暂时性的——将为延迟和质量方面的说法提供外部检验。在其中一项落地之前,VideoFDB 的赛道是现有最强的证据,而它们与人类水平之间的差距分别为 0.09 分和 0.47 分。

值得权衡的反方论点是,一次基准测试运行并不等同于一次部署。NVIDIA 的协议给每个系统相同的轮次交替任务和相同的评判器;它完全没有说明通话进行到第九个小时时会如何表现,当两个人同时抢话整整一分钟时会发生什么,或者当参考照片把一张脸渲染得很差时,表达性控制是否会退化。Tavus 将针对漂移的训练——自强迫阶段和历史机制——报告为正是针对这一问题的解决方法,而在 Tavus 之外有人进行长时间会话并发表结果之前,读者所能拥有的只有这些报告。应把该基准视为可用的最佳证据,而不是部署结果。

在此期间该围绕它构建什么

对于一个今天就想拥有类似方案的团队来说,实际的问题是:这套技术栈里哪些部分已经可以直接买到。对话式视频界面是一条链路——语音识别、语言模型、语音合成,而在 Tavus 的案例中还有渲染模型——其中前三项已是商品化能力。它们都位于 OrcaRouter 上一个兼容 OpenAI 的端点之后,200 多个模型共用同一把密钥,供应商目录价按 0% 加价率原样透传,因此供应商一降价,这里当天就能生效,而不必等一个合同周期。如果你正在搭建一条交互流水线,并希望让生成层保持开放,直到 Griffin 或类似的东西成为真正的产品,那么在这个环节,替换的代价只是一次配置变更,而不是一次迁移。Tavus Griffin 本身在这里并不是一个被路由的模型,只要它仍是需要通过申请表单才能获取的预览版,它就不会被路由。

值得关注的不是又一段演示视频,而是 Tavus 正在打造的披露工具是否会对外发布,以及是否有第二个研究团队复现这一面对面协议。如此大规模地通过图灵测试,恰恰属于那种需要第二家实验室来独立运行的结果。

An explainer scoreboard for Tavus Griffin with six rows: Status: research preview; Pricing: none published; Model type: human interaction model; VideoFDB generation: 3.83 of 5; VideoFDB perception: 3.73 of 5; Open issue: disclosure. Footer: "NVIDIA VideoFDB per Tavus and NVIDIA, September 2026." The OrcaRouter logo is composited bottom-right.