“Tavus Griffin vs Muse Realtime Avatar”的主视觉标题卡,副标题为“两张 2026 年的面孔,两个不同的问题”,位于四个标签上方:Griffin 48% 认为它是真人;Griffin 音频到视频 0.43 秒;Muse Realtime Avatar 首字节 870 毫秒;Muse Realtime Avatar 448x768,25 fps。
Engineering & Research

Tavus Griffin 与 Muse Realtime Avatar:2026 年的两张面孔,两个不同的问题

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Tavus Griffin 和 Muse Realtime Avatar 的存在,都是为了解决同一个令人尴尬的问题——一个能说会道却没有面孔的语言模型——而它们从相反的两端入手。Griffin 是一个视频到视频的 Human Interaction Model,它通过摄像头观察参与者,并实时生成对话的另一方,由 Tavus 于 2026 年 10 月发布,作为面向特定测试者的研究预览版。Muse Realtime Avatar 是 Meta 为其 Muse 智能体打造的具身层,于 2026 年 9 月 23 日在 Meta Connect 上发布,它接收音频并将其转化为同步的口型肖像。两者都无法购买。区别在于各自想要做对的是什么,而当你问起每个模型实际接收的输入是什么时,这一点立刻就会显现出来。

简短版本

• Griffin 的输入是另一端的那个人——即实时参与者的视频与音频,Griffin 必须读取、回应,并会被其打断。

• Muse Realtime Avatar 的输入是智能体自身的语音——来自 Muse Realtime Voice 的一串令牌流,它会将其转换为与之匹配的面部。

• Tavus 衡量 Griffin 的标准是人们是否相信它,并公布了一段一分钟视频通话中得出的 48% 这一数字。

• Meta 衡量 Muse 实时虚拟形象的标准在于它能否跟上节奏,并公布从轮到轮结束到首字节为 870 毫秒。

• 两者都没有公开的API、公布的价格或正式发布日期。

把这几行放在一起看,分歧的形态就显而易见了。Tavus 优化的是对方的信念。Meta 优化的是时钟。

Board titled 'Two Faces, Two Measurements'. Tavus Griffin column: input the live participant, video and audio; optimises for whether the other person believes it; headline figure 48% of 54 participants in a one-minute video call; output 720p duplex video at 25 fps; latency 0.43 s average audio to video on H100s; access research preview, selected testers only. Muse Realtime Avatar column: input Muse Realtime Voice's own speech tokens; optimises for the clock, end of turn to first frame; headline figure 870 ms from end of turn to first byte; output 448x768 portrait at 25 fps; capacity 12 concurrent sessions on one NVIDIA GB200; access research post only, no API.

Griffin:必须被相信的模型

Tavus 的说法是,Griffin 是首个 Human Interaction Model(人类交互模型),而这一主张背后的架构是一个由两部分组成的系统,将持续对话建模与音视频生成结合在一起。第一部分关乎行为:它借助自己能看到和听到的信息,决定人设下一刻应该做什么。第二部分是渲染,Tavus 又将其拆分为流式语音生成与流式视频生成。

Tavus 主推的数字并不是吞吐量数字。在该公司与伦敦玛丽女王大学联合开展的一项研究中,54 名参与者中有 26 人——48%——在一分钟视频通话后认为 Griffin 是真人,相比之下,其此前由 Phoenix-4.5 面部生成、Sparrow-2 话轮转换和 Raven-1 视觉组成的方案为 41 人中的 1 人(2.4%)。未被骗过的参与者通常会在最初 20 秒内产生怀疑。在 2026 年 9 月评分的 NVIDIA VideoFDB 基准测试中,Tavus 报告称,Griffin 在面对面 AI 方面排名第一:生成得分为 3.83,而已报告的最强基线为 2.80,人类参考分为 3.92;感知得分为 3.73,而已报告的最佳基线为 3.44,人类参考分为 4.20。这些数字由厂商报告,且仅针对特定基准测试,但其中的人类对比数据才是值得关注的地方。

这些数字背后的工程技术是一个名为 Tavec 的编解码器和一个自回归扩散 Transformer。Tavec 以 48 kHz 运行,每帧 40 个值,每秒 100 帧,不使用码本,采用完全因果的解码器,数据包小至 10 毫秒——这样的设计是为了让一张脸在句子还没说完时就能开始动起来。视频通路以 320 毫秒为单位推送 720p 内容,其中一个潜变量相当于 25 fps 下的八帧,每个潜变量进行三步扩散,VAE 中实现 8 倍的时间压缩。三阶段蒸馏流程(先分布匹配,再教师强制自回归,最后自强制)正是让它能够实时跑完这三步的关键。其主打的延迟指标是:在 H100 上从音频到视频平均 0.43 秒,Tavus 称这大约是其测量到的第二快方法的一半。声音克隆大约需要 10 秒的样本。

这一切的代价是,Tavus 无法将其发布。作为研究预览版的 Griffin-Lite 仅面向一小群精选的早期测试者开放;在关于此次发布的说明中,公司直言,Griffin-Lite 目前不会供客户使用,并预计在若干安全问题得到解决后很快就会发布 Griffin。Griffin 尚未上线 Tavus 平台,等到“我们弄清楚如何安全地发布它”之后才会登陆该平台。一个在一分钟通话中有 48% 的时间能让人信以为真的模型,从部署角度看,就是一个在一分钟通话中有 48% 的时间能让人信以为真的模型。

Screenshot of the Tavus website's Griffin announcement, captured 2 October 2026: the headline 'The First Human Interaction Model' under 'Introducing Griffin', a paragraph describing a video-to-video system that listens while the other person talks, and three statistic tiles reading 48% of people believed Griffin was a real person after a one-minute video call, #1 on NVIDIA's independent test of face-to-face AI, and 37% ahead of the next best AI at reacting in the moment, dated October 1st, 2026.

Muse Realtime Avatar:必须跟上节奏的模型

Muse Realtime Avatar 于 2026 年 9 月 23 日在 Meta Connect 上发布,Meta Superintelligence Labs 当天便以《赋予你的 Muse 生命》为题撰文介绍。与 Tavus 相比,Meta 的表述更狭窄,也更机械:得益于 Muse Realtime Voice,Muse 智能体本就拥有声音,而虚拟形象则是为这声音赋予躯体的一层。

公布的数据是,从回合结束到首字节为 870 毫秒——也就是说,从用户停止说话的那一刻,到虚拟形象的首个视频字节准备就绪的那一刻。该虚拟形象以每秒 25 帧渲染 448×768 的人像。Meta 表示,该系统每个分块执行的评估次数约为其基线的 1/60,并且单台 NVIDIA GB200 可承载 12 个并发实时会话,相比两步式 BF16 实现有 8 倍的容量提升。

与 Griffin 的架构差异在于信息的来源。Muse Realtime Avatar 扩展了 Muse Realtime Voice,并共享其语音 token 流——驱动面部的是语音模型所生成的同一个 VQ 表征,而不是对参与者的单独视觉理解。这使它成为一个音频驱动的 DiT 具身层:高效、与自身语音模型紧密耦合,并且完全不尝试解读通话另一端的人。它是智能体的嘴和脸,而不是一个注视着你的对话伙伴。

Meta 尚未发布 Muse Realtime Avatar 的 API、价格和发布日期。那篇研究文章就是全部公开记录。

这两种设计真正产生分歧的地方

看清这种分歧最清楚的办法,是问一句:当用户打断时会发生什么。

Griffin 是全双工的,并被设计为可在说话中途被打断——它能在说话的同时观看和倾听,这正是 Tavus 的营销所强调的:Griffin 学习的是对话行为,而非视频。这也是为什么它的基准测试套件围绕感知与反应构建,以及为什么该公司会特意宣称,它在即时反应上比次优系统领先 37%。

Muse Realtime Avatar 的 870 毫秒轮次结束数字讲述的却是相反的故事:它是一条流水线——轮次结束,音频 token 解析完成,然后面部才跟上。它确实很快——对肖像渲染器而言,870 毫秒是个不错的数字——但这一测量本身预设了轮次边界的存在,而这恰恰是双工模型生来就要抛弃的假设。

这并不是对两种设计的批评。Meta 正在为一种存在于 Meta 自家助手界面中的代理打造一张脸,在这种场景下,清晰的轮次边界是一种合理的交互模型。Tavus 正在打造的东西,则必须经受住一个陌生人在二十秒内判断屏幕上的人是否真实。

两者都不在价目表上——而且 Muse 只有一部分可调用

目前,Tavus Griffin 和 Muse Realtime Avatar 都无法投入生产。Griffin 仅限部分测试人员使用;Muse Realtime Avatar 没有 API、没有价格,也没有发布日期。如果你正在规划构建,这两个事实都应纳入计划。

值得指出的是,Muse 技术栈中是可触及的那一部分。Meta 的 Muse 家族包括 Muse Spark,而它的一个检查点——meta/muse-spark-1.2——已在我们目录上线,每百万输入 token 1.25 美元、每百万输出 token 4.25 美元,零加价,即在 Meta 的标价基础上。它不是那个虚拟形象:它接受文本、图像、视频、音频和 PDF 输入并返回文本,具有 100 万 token 的上下文窗口和可配置的推理强度。但它是 Muse 系列中你真正可以调用的部分,而如果你正在构建有朝一日将坐在虚拟形象背后的智能体,语言这一半就是你可以先入手的那一半。OrcaRouter 以 0% 加价透传提供商的标价,因此 Meta 的价格变动会在当天反映在我们的价目卡上,而不是等到下一个计费周期;并且,在一个提供商上失败的请求会改用健康的提供商重试,而不是以超时告终。

Screenshot of the OrcaRouter model page for Muse Spark 1.2, showing the model id meta/muse-spark-1.2, a 1M-token context window, text, image, video, file and audio inputs producing text output, a p50 time to first token of 10.00 s, input pricing of $1.25 per million tokens and output pricing of $4.25 per million tokens, and 6.2M tokens of traffic over seven days.

同样的逻辑也适用于视频领域。我们不路由 Muse Realtime Avatar,也不路由 Tavus Griffin,我们不会声称并非如此。我们路由的是两百多个模型的目录,涵盖相同的模态,因此,一个在文本智能体、语音模型和视频生成器之间来回切换的原型,可以始终使用同一个密钥,而本文提到的这两个模型仍未发布。

哪一个离发货更远?

根据公开记录,Muse Realtime Avatar 距离更远。它有一篇研究文章,但没有 API、没有价格,也没有日期。Griffin 同样没有 API,也没有价格,但它有明确的发布意向——“在这些安全问题得到解决后很快”——一个如今已向选定测试者开放的具名预览层级,以及来自独立测试框架的一系列已发布基准测试结果。这是一个更进阶的位置,尽管它伴随着一项承认:该模型还不够安全,不能交给客户。

比较它们的陷阱在于将870毫秒的数字视为与0.43秒的数字直接可比。它们测量的是不同的东西:Meta测量的是从一轮结束到人像第一个字节的时间,而Tavus测量的是连续双工流中的音频到视频延迟,其中轮次并非清晰的事件。这些数字都是真实的,但它们不是同一种测量,任何将它们放在一栏中呈现的人都是在损害读者的利益。

最重要的一点

Muse Realtime Avatar 是一个具身层:音频输入,肖像输出,从话轮结束到首字节 870 毫秒,448×768、25 fps,没有 API,也没有发布日期。Tavus Griffin 是一个双工的人类交互模型:参与者输入,一张实时做出反应的脸输出,在 H100 上平均音视频延迟 0.43 秒,而且这家厂商既愿意公布 48% 的人认为它是真人,又同时声明客户无法使用它。Meta 在打造能跟得上的东西。Tavus 在打造能蒙混过关的东西。两者都无法购买,这意味着如今唯一可做的决定是先解决这个问题的哪一半——而对大多数团队来说,那一半就是底下那个语言模型。