
Muse Realtime Avatar 与 Gemini 3.8 Live:一张脸对一条语音
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 180 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
这两者不能互相替代,而看清这一点最快的方法,就是问它们各自输出什么。Muse Realtime Avatar,由 Meta 于 2026 年 9 月 23 日发布,返回一个角色说话时的同步视频——你提供一张参考图像,它就会以 448×768 的竖屏画幅渲染出那个东西说话和做手势的样子。Gemini 3.8 Live,由 Google 于 2026 年 9 月 15 日发布,并于同日面向开发者全面开放,返回音频和文本。它完全没有视频输出。把两者放进同一个比较并非错误——它们争夺的是同一个对话界面,买家已经在问该基于哪一个来构建——但决策并不是“哪一个更好”。而是“我需要的是两种不同产品中的哪一种”,而几乎所有已发表的二者对比都搞错了这一点,因为它们并列的是衡量不同东西的基准测试。
下面的一切都应以这种不对称性为框架。你今天就可以从终端、用密钥调用 Gemini 3.8 Live。你完全无法调用 Muse Realtime Avatar——没有 API,没有价格,没有日期。Meta 在 Connect 上演示了它,并发布了一篇研究文章;Google 则推出了价目表和模型 ID。这是在一个产品与一则公告之间做比较,这意味着有用的问题不是哪一个会赢,而是各自会让你承诺什么。
每一个实际产生的内容
整个对比就这六行,而这六行没有一行接近。
• 输出 — Muse Realtime Avatar 返回同步的语音和肖像视频,两者由同一股语音 token 流一并生成;Gemini 3.8 Live 返回音频和文本,模型中没有任何环节生成视频。
• 开发者访问权限——Muse Realtime Avatar 没有:它于 2026 年 9 月 23 日作为 Meta 的 Muse 智能体的一项能力被宣布,但没有 API、没有端点,也没有公布日期。截至 2026 年 9 月 15 日,Gemini 3.8 Live 已在 Gemini API 和 Google AI Studio 中提供,共有两个模型 ID:gemini-3.8-live 和 gemini-3.8-live-extended-thinking。
• 价格 — Muse Realtime Avatar 没有公布价格,因为没有任何可供购买的产品。Gemini 3.8 Live 通过 Live API 公布了音频输入每分钟 0.005 美元、音频输出每分钟 0.018 美元的价格。
• 独立评分——Muse Realtime Avatar 完全没有;它的数字是 Meta 自家的,且是对照 Meta 自行选定的基线测得的。Gemini 3.8 Live 在 Artificial Analysis Speech to Speech Index 上取得 76.0 分,其扩展思考变体为 82.6——这是第三方数字,属于另一类别的证据。
• 延迟——这两个已公布的数字并非在衡量同一项指标,而大多数报道正是在这里出错。Meta 报告的是从你的发言结束到同步语音视频回复首字节的 870 毫秒。根据 Artificial Analysis 的测量,谷歌的数字是标准模型首段音频 1.18 秒,推理版本为 1.35 秒。
• 帧率与语言 — Muse Realtime Avatar 以每秒 25 帧的速率渲染 448×768 的竖屏视频。Gemini 3.8 Live 可在 97 种受支持的语言之间自动进行对话中途切换,并近乎实时地处理视觉输入。
最后一行包含了人们总是混淆的那个区别。Gemini 3.8 Live 能看见,却不能展示。Muse Realtime Avatar 能展示。至于它能否看见,并不是 Meta 那篇发布内容要谈的——它是一个音频驱动的生成器,以语音 token 和参考图像为条件,它的工作是生成一张脸,而不是解读一张脸。

延迟数字之间不具可比性,而且差距比表面看起来要小
870 毫秒对 1.18 秒,读起来像是 Meta 快了 26%。细看测量方式,这个比较就不成立了。Meta 的数字是从用户发言结束到包含视频的回复的首字节时间——而 Meta 的帖文明确表示这是首字节指标,不是完整回复的时间,也不是通话其余部分的持续传输延迟。一个系统可以做到首字节 870 毫秒,但在第 12 秒时仍然感觉卡顿。Google 的数字是首个音频的时间,所需生成的内容严格更少,而且它是由外部评估者测量的,而非厂商自测。
两者都属于那种能说明系统是对话式而非轮次式的数字,而它们都无法告诉你通话进行到第五分钟时是什么感受。如果你要在两者之间就响应速度做选择,诚实的立场是:目前没有任何人发表过同类可比测量结果,而获得这种数据的唯一办法,就是去跑那个可以调用的一方。
今天你可以依赖什么,以及你将等待什么
Gemini 3.8 Live 具备做出生产决策所需的信息:两个可固定使用的模型 ID、已公布的每分钟费率、第三方指数评分,以及明确公布的一般可用日期。它同时也带有语音产品通常具有的限制——音频输入,音频和文本输出,且不支持视频生成。
Muse Realtime Avatar 具备一篇研究文章该有的东西:一套架构、四个由公司报告的数字,以及一组公开披露的偏好测试——Meta 用这些测试将它与两套商业虚拟形象系统进行对比,其中一套 Meta 自己称其在行为举止上与持平状态在统计上无法区分。它没有的,是购买它的途径。Meta 的帖子还指出,所展示的演示并不全都对应 Muse 应用中可用的虚拟形象,而这句话应当成为你围绕此事制定任何计划时的准绳。
还有第三种值得点名的方案,因为它是大多数团队实际采用的那一种。这两种模型都不是完整的智能体。Gemini 3.8 Live 一边持续对话,一边把后台工作交给工具和 API;GPT-Live-1 则把推理完全委托给一个独立的后端模型。对话层是前端,而思考则是对另一个模型的另一次调用。这第二次调用就是普通的文本推理,而且它是可路由的。
在 OrcaRouter 上,这一层就是一个端点:一把密钥背后,是来自 15 家提供商的 196 个模型,按提供商标价原价透传、零加价,并且当你选定的模型报错或超时时自动故障转移。我们不托管 Gemini 3.8 Live——Live API 是 Google 独有的——我们也不托管 Muse Realtime Avatar,因为根本没人托管它。我们承载的,是语音智能体中随来电者思考强度而弹性伸缩的那一半,以及你无需重新协商任何东西就能替换的那一半。

两者可能真正交汇之处
将它们并列比较的理由不在于基准测试。而在于两者都试图占据产品中的同一个位置:用户与之对话的那个东西。Google的赌注是,这个位置是一场对话,而交付物就是一场好的对话——97种语言、后台工具执行、一个推理变体,在τ-Voice客服场景中解决了68.6%,而标准模型为30.1%。Meta的赌注是,这个位置是一种在场感,而一个能看到智能体的用户,就是一个会留在对话中的用户。
这些押注并不互斥。一个产品完全可能用 Gemini 3.8 Live 来处理语音循环,并用类似 Muse Realtime Avatar 的东西来负责视觉层,前提是虚拟形象层有一天变得可调用。它不能做的是把它们视为可互换,因为其中一个永远不会给你一张脸,而另一个可能永远不会给你一个端点。
如何决定
如果你本季度要发布一款语音产品,那这个决定已经替你做好了:Gemini 3.8 Live 可以调用,而 Muse Realtime Avatar 不可以。就这次发布真正争论的维度来选择你的变体——扩展思考模型以略高于四倍的每小时音频成本,换来 38 个百分点的智能体任务完成率,而标准模型是公开榜单上最便宜的合格语音模型。然后,把委派的推理单独路由,因为账单和延迟都出在那里。
如果你正在评估一个 avatar 层,诚实的答案是:目前还没有什么可评估的。现有的只是一篇研究文章,里面包含四个由公司自行报告的数字和一个演示。值得关注的不是指数——Muse Realtime Avatar 不会出现在任何指数上——而是 Meta 是否会公布价目表、端点和日期,以及当 avatar 运行在蜂窝网络连接下的手机上、而不是在 Connect 演示中时,它的 870 ms 是否还站得住脚。
在那之前,这个对比比大多数文章所给出的形式更简短。其中之一是有价格、型号 ID 和外部评分的产品。另一个则极好地展示了某种尚不具备其中任何一项的事物。

