为文章《Muse Realtime Avatar vs Gemini 3.8 Live》生成的主视觉卡片,标题两侧各有一张圆角卡片。左侧卡片在视频帧图标上方显示“Muse Realtime Avatar”,并包含几行文字:“视频 + 语音输出”、“448×768 竖屏,25 fps”和“9月23日发布,无 API”;右侧卡片在麦克风与对话气泡图标上方显示“Gemini 3.8 Live”,并包含几行文字:“音频 + 文本输出”、“$0.005/分钟 音频输入”和“9月15日正式发布,Live API”。副标题写着:“一个渲染面孔。另一个运行电话线路。” OrcaRouter 标志合成在右下角。
Guides & Insights

Muse Realtime Avatar 与 Gemini 3.8 Live:一张脸对一条语音

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

这两者不能互相替代,而看清这一点最快的方法,就是问它们各自输出什么。Muse Realtime Avatar,由 Meta 于 2026 年 9 月 23 日发布,返回一个角色说话时的同步视频——你提供一张参考图像,它就会以 448×768 的竖屏画幅渲染出那个东西说话和做手势的样子。Gemini 3.8 Live,由 Goog​le 于 2026 年 9 月 15 日发布,并于同日面向开发者全面开放,返回音频和文本。它完全没有视频输出。把两者放进同一个比较并非错误——它们争夺的是同一个对话界面,买家已经在问该基于哪一个来构建——但决策并不是“哪一个更好”。而是“我需要的是两种不同产品中的哪一种”,而几乎所有已发表的二者对比都搞错了这一点,因为它们并列的是衡量不同东西的基准测试。

下面的一切都应以这种不对称性为框架。你今天就可以从终端、用密钥调用 Gemini 3.8 Live。你完全无法调用 Muse Realtime Avatar——没有 API,没有价格,没有日期。Meta 在 Connect 上演示了它,并发布了一篇研究文章;Google 则推出了价目表和模型 ID。这是在一个产品与一则公告之间做比较,这意味着有用的问题不是哪一个会赢,而是各自会让你承诺什么。

每一个实际产生的内容

整个对比就这六行,而这六行没有一行接近。

输出 — Muse Realtime Avatar 返回同步的语音和肖像视频,两者由同一股语音 token 流一并生成;Gemini 3.8 Live 返回音频和文本,模型中没有任何环节生成视频。

开发者访问权限——Muse Realtime Avatar 没有:它于 2026 年 9 月 23 日作为 Meta 的 Muse 智能体的一项能力被宣布,但没有 API、没有端点,也没有公布日期。截至 2026 年 9 月 15 日,Gemini 3.8 Live 已在 Gemini API 和 Google AI Studio 中提供,共有两个模型 ID:gemini-3.8-livegemini-3.8-live-extended-thinking

价格 — Muse Realtime Avatar 没有公布价格,因为没有任何可供购买的产品。Gemini 3.8 Live 通过 Live API 公布了音频输入每分钟 0.005 美元、音频输出每分钟 0.018 美元的价格。

独立评分——Muse Realtime Avatar 完全没有;它的数字是 Meta 自家的,且是对照 Meta 自行选定的基线测得的。Gemini 3.8 Live 在 Artificial Analysis Speech to Speech Index 上取得 76.0 分,其扩展思考变体为 82.6——这是第三方数字,属于另一类别的证据。

延迟——这两个已公布的数字并非在衡量同一项指标,而大多数报道正是在这里出错。Meta 报告的是从你的发言结束到同步语音视频回复首字节的 870 毫秒。根据 Artificial Analysis 的测量,谷歌的数字是标准模型首段音频 1.18 秒,推理版本为 1.35 秒。

帧率与语言 — Muse Realtime Avatar 以每秒 25 帧的速率渲染 448×768 的竖屏视频。Gemini 3.8 Live 可在 97 种受支持的语言之间自动进行对话中途切换,并近乎实时地处理视觉输入

最后一行包含了人们总是混淆的那个区别。Gemini 3.8 Live 能看见,却不能展示。Muse Realtime Avatar 能展示。至于它能否看见,并不是 Meta 那篇发布内容要谈的——它是一个音频驱动的生成器,以语音 token 和参考图像为条件,它的工作是生成一张脸,而不是解读一张脸。

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Gemini 3.8 Live — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Gemini 3.8 Live'. Rows read: Output — video + voice vs audio + text; Developer access — none, announced only vs Live API and AI Studio; Price — none published vs $0.005/min in, $0.018/min out; Independent score — none vs AA Speech to Speech 76.0; Latency — 870 ms to first byte of voice + video vs 1.18 s to first audio; Frame — 448x768 portrait at 25 fps vs audio only, 97 languages. A footer line reads 'Meta figures company-reported; Google and index figures per Artificial Analysis.'

延迟数字之间不具可比性,而且差距比表面看起来要小

870 毫秒对 1.18 秒,读起来像是 Meta 快了 26%。细看测量方式,这个比较就不成立了。Meta 的数字是从用户发言结束到包含视频的回复的首字节时间——而 Meta 的帖文明确表示这是首字节指标,不是完整回复的时间,也不是通话其余部分的持续传输延迟。一个系统可以做到首字节 870 毫秒,但在第 12 秒时仍然感觉卡顿。Google 的数字是首个音频的时间,所需生成的内容严格更少,而且它是由外部评估者测量的,而非厂商自测。

两者都属于那种能说明系统是对话式而非轮次式的数字,而它们都无法告诉你通话进行到第五分钟时是什么感受。如果你要在两者之间就响应速度做选择,诚实的立场是:目前没有任何人发表过同类可比测量结果,而获得这种数据的唯一办法,就是去跑那个可以调用的一方。

今天你可以依赖什么,以及你将等待什么

Gemini 3.8 Live 具备做出生产决策所需的信息:两个可固定使用的模型 ID、已公布的每分钟费率、第三方指数评分,以及明确公布的一般可用日期。它同时也带有语音产品通常具有的限制——音频输入,音频和文本输出,且不支持视频生成。

Muse Realtime Avatar 具备一篇研究文章该有的东西:一套架构、四个由公司报告的数字,以及一组公开披露的偏好测试——Meta 用这些测试将它与两套商业虚拟形象系统进行对比,其中一套 Meta 自己称其在行为举止上与持平状态在统计上无法区分。它没有的,是购买它的途径。Meta 的帖子还指出,所展示的演示并不全都对应 Muse 应用中可用的虚拟形象,而这句话应当成为你围绕此事制定任何计划时的准绳。

还有第三种值得点名的方案,因为它是大多数团队实际采用的那一种。这两种模型都不是完整的智能体。Gemini 3.8 Live 一边持续对话,一边把后台工作交给工具和 API;GPT-Live-1 则把推理完全委托给一个独立的后端模型。对话层是前端,而思考则是对另一个模型的另一次调用。这第二次调用就是普通的文本推理,而且它是可路由的。

在 OrcaRouter 上,这一层就是一个端点:一把密钥背后,是来自 15 家提供商的 196 个模型,按提供商标价原价透传、零加价,并且当你选定的模型报错或超时时自动故障转移。我们不托管 Gemini 3.8 Live——Live API 是 Google 独有的——我们也不托管 Muse Realtime Avatar,因为根本没人托管它。我们承载的,是语音智能体中随来电者思考强度而弹性伸缩的那一半,以及你无需重新协商任何东西就能替换的那一半。

A screenshot of Google's blog post 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated September 15, 2026, showing the announcement headline and the opening of the post introducing the two speech-to-speech models.

两者可能真正交汇之处

将它们并列比较的理由不在于基准测试。而在于两者都试图占据产品中的同一个位置:用户与之对话的那个东西。Google的赌注是,这个位置是一场对话,而交付物就是一场好的对话——97种语言、后台工具执行、一个推理变体,在τ-Voice客服场景中解决了68.6%,而标准模型为30.1%。Meta的赌注是,这个位置是一种在场感,而一个能看到智能体的用户,就是一个会留在对话中的用户。

这些押注并不互斥。一个产品完全可能用 Gemini 3.8 Live 来处理语音循环,并用类似 Muse Realtime Avatar 的东西来负责视觉层,前提是虚拟形象层有一天变得可调用。它不能做的是把它们视为可互换,因为其中一个永远不会给你一张脸,而另一个可能永远不会给你一个端点。

如何决定

如果你本季度要发布一款语音产品,那这个决定已经替你做好了:Gemini 3.8 Live 可以调用,而 Muse Realtime Avatar 不可以。就这次发布真正争论的维度来选择你的变体——扩展思考模型以略高于四倍的每小时音频成本,换来 38 个百分点的智能体任务完成率,而标准模型是公开榜单上最便宜的合格语音模型。然后,把委派的推理单独路由,因为账单和延迟都出在那里。

如果你正在评估一个 avatar 层,诚实的答案是:目前还没有什么可评估的。现有的只是一篇研究文章,里面包含四个由公司自行报告的数字和一个演示。值得关注的不是指数——Muse Realtime Avatar 不会出现在任何指数上——而是 Meta 是否会公布价目表、端点和日期,以及当 avatar 运行在蜂窝网络连接下的手机上、而不是在 Connect 演示中时,它的 870 ms 是否还站得住脚。

在那之前,这个对比比大多数文章所给出的形式更简短。其中之一是有价格、型号 ID 和外部评分的产品。另一个则极好地展示了某种尚不具备其中任何一项的事物。

A screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the Speech to Speech Index ranking with Gemini 3.8 Live Extended Thinking at 82.6 and Gemini 3.8 Live at 76.0 among the listed rows, alongside panels for time to first audio and cost per hour of input audio.