为文章《Muse Realtime Avatar vs GPT-Live-1》生成的主视觉卡片,标题两侧各有一张圆角卡片。左侧卡片在人物头像图标上方写着“Muse Realtime Avatar”,以及“视频 + 语音,单路流”和“没有 API,没有价格,没有日期”两行文字;右侧卡片在对话气泡图标上方写着“GPT-Live-1”,以及“每分钟 0.05 美元,按秒计费”和“并发会话,WebRTC”两行文字。副标题写着“一种卖的是分钟数。另一种卖的是存在感。”OrcaRouter 标志合成在右下角。
Guides & Insights

Muse Realtime Avatar 与 GPT-Live-1:临场感与对话

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

计费单位告诉你,每家公司认为自己卖的究竟是什么。GPT-Live-1OpenAI 的全双工语音模型,按每分钟固定 0.05 美元计费,并按秒计收,而其速率限制以并发会话数为单位——Tier 1 为 25,到 Tier 5 升至 500。这是电话线的计量单位。Muse Realtime Avatar,由 Meta 于 2026 年 9 月 23 日发布,却没有计费单位,因为根本没有什么可计费的:没有 API,没有端点,没有价格,没有日期。它公布的计量单位反而是硬件指标——单台 NVIDIA GB200 上可承载 12 路并发实时会话。一家公司在按分钟出售对话。另一家则在向你展示渲染一张脸需要多少成本,而且还没决定要不要把它卖出去。

这两个模型都还算新,但按“发布”一词通常承载的含义来说,两者都算不上一次发布。GPT-Live-1 于 2026 年 7 月 8 日在 ChatGPT 内上线,直到 9 月 10 日才登陆开发者 API——在这两个月里,它是一款消费级产品的默认语音,却对任何开发者都不可用。Muse Realtime Avatar 于 2026 年 9 月 23 日在 Meta Connect 上发布,在 Meta 自己的研究文章中进行了演示,至今仍是 Muse 智能体的一项能力,而非一款产品。将两者对比,就是在对比同一理念的两个不同阶段:当一个对话模型足够出色时会发生什么——接下来的问题变成了用户在它说话时正在看什么。

OpenAI 打造了什么:一场永不卡顿的对话

GPT-Live-1 是运营意义上真正的全双工——它不会等你把话说完才开始工作。它通过且仅通过一个端点接入开发者 API,即 Live Sessions 端点,并且只对应一个模型 ID,gpt-live-1,没有可固定的带日期快照,也没有启用任何同级端点。没有 Chat Completions,没有 Responses,没有 Realtime,没有微调,没有音频转写或语音端点。明确不支持图像和视频输入。

塑造下游一切的设计决策是委托。GPT-Live-1 并不自己完成那些高难度的思考。Open​AI 的文档把语音层与一个独立的推理后端配对,而在公开的 WebRTC 示例中,该后端就是 GPT-5.6 Terra。因此,一次 GPT-Live-1 会话相当于两台计价器同时运转:语音每分钟 0.05 美元,再加上后端模型对每一次工具调用、搜索和推理步骤按其常规 token 费率计费——这些都是由它转交出去的。在 Speech to Speech Index 上,这种人格分裂体现为同一个模型两次打分——由 GPT-6 Astra 以中等强度承担思考时得 81.5 分,由 GPT-5.6 Sol 以低强度承担时得 80.1 分。这两种配置之间 1.4 分的差距,比让 GPT-Live-1 最佳配置登上榜首的那 0.2 分优势还要大。

这就是这个模型真实的形态。语音前端是固定的;智能是你设置的一个参数,而它对得分的影响比任何竞争模型都更大。

Meta 打造了什么:一张随声音而动的脸

Muse Realtime Avatar 要解决的是 GPT-Live-1 所没有的问题——让生成的视频与生成的语音保持严格同步。Meta 的答案是让二者成为同一条流:Muse Realtime Voice 输出的语音 token 同时承载内容与韵律,而虚拟人则是一个音频驱动的 Diffusion Transformer,消费同一批 token,并以一张参考图像和近期视频 latent 的滚动窗口为条件。事后不需要做任何唇形同步,因为根本不存在“事后”——声音、口型和表情都出自同一个过程。

这些公开数据均出自 Meta 自身,且是与其自行选定的基线相比测得的,公司之外尚无任何一方复现过。从你的话轮结束到同步语音视频回复的首字节,耗时 870 毫秒。448×768 竖屏视频,每秒 25 帧,带有透明水印叠加,让观看者能分辨出这并非摄像头拍摄。在单块 GB200 上可同时运行十二路会话,相比 Meta 自家的两步式 BF16 基线实现 8 倍容量提升,这得益于四位量化感知训练、持久化 KV 缓存以及延迟感知的动态批处理。Meta 还报告了一项偏好结果,相对该基线从 45% 提升至 55%,并披露了对商业虚拟人系统的两次胜出——同时还披露:在举止神态方面,与其中一方的结果在统计上与持平无法区分。

那个列表里没有任何一项是费率、端点或日期。

A generated comparison scoreboard titled 'Muse Realtime Avatar vs GPT-Live-1 — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'GPT-Live-1'. Rows read: What it returns — video + voice vs audio + text; Where it runs — Muse app only vs Live Sessions API, WebRTC; Billing unit — none published vs $0.05 per minute, by the second; Scale limit — 12 sessions per GB200 vs 25 to 500 concurrent sessions by tier; Independent score — none vs AA Speech to Speech 81.5 with Astra; Reasoning — inside Muse vs delegated to a separate backend model. A footer line reads 'Meta figures company-reported; GPT-Live-1 index figure per Artificial Analysis and configuration-specific.'

两米账单,以及路由在何处赢得一席之地

GPT-Live-1 的成本结构并不是一个单一数字,而把它当成一个数字来看待,正是一个听起来很便宜的语音模型却能让你在某个月收到高昂账单的原因。语音费用为每分钟 0.05 美元,按秒计费且不向上取整,会话的前 15 秒会预先计费,但会抵扣后续时长的费用,而不是叠加在其上。会话所委托的一切——推理、工具调用、任何搜索——都会按照后端模型自身的费率单独计费。把委托指向一个前沿推理模型,并让它每一轮都进行搜索,你就等于搭建了一条每小时 3 美元的开放线路,而背后还配着一个高端模型。

第二个计量表是可路由的那一半。在 OrcaRouter 上,GPT-Live-1 会话的后端不过是又一次模型调用:一个密钥背后汇聚了来自 15 家提供商的 196 个模型,按提供商标价原样透传,零加价,且当你选择的模型出错或超时时自动故障转移。你无法对语音层进行路由——Live Sessions 是 OpenAI 独有的端点——但语音层所委派的一切都落在同一个密钥上,这意味着账单中随你的来电者思考强度而增长的那一部分,也正是你无需签订合同就能改变的那一部分。

相比之下,Muse Realtime Avatar 没有需要路由的仪表。它是某款应用的一项功能。

A screenshot of the Artificial Analysis Speech to Speech leaderboard showing the Speech to Speech Index ranking, with GPT-Live-1 listed at 81.5 in its Astra configuration alongside the other ranked speech-to-speech models.

关于语音代理用途的两个赌注

抛开规格参数不谈,两家公司对这款产品的看法并不一致。OpenAI 押注的是,对话就是产品——语音代理就是一条电话线,而要做的工作就是让它感觉像一条电话线:永不停顿,把需要艰难思考的事情交给它背后的模型,按分钟计费,按并发通话数扩容。GPT-Live-1 的 API 表面上的每一个选择都源于此。基于并发的速率限制、仅使用 WebRTC 的传输、刻意收窄的单一端点、不输入也不输出视频。

Meta 的赌注是:临场感本身就是产品——能看见智能体的用户,才会留在对话里;而真正有意思的工程挑战不在于轮流发言,而在于让一个渲染出的角色在一整通通话中始终保持连贯。这些选择造就了一个针对 GPU 上的帧率和会话密度进行优化的系统,却完全没有商业接口。

两者都成立、并且二者会被组合起来,这是很现实的可能。一个产品可以让它的对话运行在全双工语音模型上,让它的视觉层运行在虚拟形象渲染器上,而如今唯一阻碍这一点的,是虚拟形象渲染器没有端点。站不住脚的是,把它们当作同一次采购的两个版本来对待。

谁该行动,谁该等待

如果你现在正在构建语音产品,GPT-Live-1 可以调用,而 Muse Realtime Avatar 不行,这就让决定失去了悬念。GPT-Live-1 内部真正有意思的选择是你委托给哪个后端,因为评分和账单实际发生变化的地方正在于此——而且它是整个技术栈中唯一一个你能在不改动语音集成的情况下进行路由、替换和故障转移的部分。

如果你想要的是一个虚拟化身,那么等待并非消极被动。值得关注的事情很具体:Meta 是否会发布价目表和端点,是否会出现一个明确日期,以及 870 毫秒能否在蜂窝网络连接下的手机上经受住考验,而不是仅存在于 Connect 演示中。Meta 自己的帖子指出,其演示并不都反映 Muse 应用中可用的化身,这句话才是要牢牢记住的。

在这些情况中的任何一项发生改变之前,这个比较用一句话就能回答。GPT-Live-1 是一条电话线,配着一个由你来选的大脑。Muse Realtime Avatar 是一张没有电话号码的脸。

A screenshot of the OrcaRouter models catalogue page, showing the subtitle '196 models · 15 providers · one API key, one bill', a 'How to call any model' panel with a POST example against the OpenAI-compatible endpoint, and a grid of model cards including DeepSeek V4.1 Flash, GPT-6 Astra, Gemini 3.8 Flash, Qwen3.8 Max and Claude Fable 5.1.