
GPT-Live-1 与 ElevenLabs:一个会倾听的模型,一家什么都卖的公司
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
这个对比中最有用的数字是 90.5%。这是 Artificial Analysis 在其 Speech Agent Arena 中为 ElevenLabs Agents 测得的任务成功率——在该榜单前六名中位居最高,而取得这一成绩的系统根本不是一个单一模型,而是由语音识别、语言模型和合成器组成的级联系统,通过 ElevenLabs 自家的轮次转换逻辑串联起来。GPT-Live-1 是 OpenAI 的端到端全双工模型,它并未出现在该榜单上,因为它参与的是另一个榜单:Speech to Speech Index,在那里它以 70.3% 的成绩在十四个模型中并列第六。与此同时,ElevenLabs Eleven v3 仍是业内部署最广泛的生产级语音,其库中拥有超过 10,000 种声音和 70 多种语言。
这个简化说法是:一方卖给你的是一场对话,另一方卖给你的是一整家公司。这种说法大体上没错,但它掩盖了底下那个更有意思的发现:在完成任务这件事上,一套精心设计的级联方案依然胜过原生的全双工模型。
两种架构,区别在于接缝在哪里
GPT-Live-1 是一个单一模型,可接收音频和文本输入,并输出音频和文本。它原生支持打断——OpenAI 自己的测试(随 9 月的 API 发布一同公布,且未在公司外部复现)报告称,在 Full Duplex Bench v1.5 上其交互性达到 80.1%,而 GPT-Realtime-2.1 为 45.4%;轮次转换延迟为 0.798 秒,后者为 1.41 秒。这里没有任何接缝,因为根本不存在需要拼接的东西。
ElevenLabs Agents 则是刻意押下的相反方向。ElevenLabs 的文档描述的是一条流水线:经过调优的语音识别、一个由你选择或自带的语言模型、一个低延迟的合成器——通常来自 Flash 系列——再加上一层专有的轮次交替模型。打断(barge-in)是每个智能体各自的配置,暴露的是轮次积极程度和超时设置,而非模型本身的属性。在 Artificial Analysis 的基准测试默认配置中,这套技术栈的构成是:语音识别采用 Scribe v2 Realtime,推理采用 Gemini 模型,合成采用 Eleven Flash v2。
那种设计有一个巨大的优势和一个结构性成本。优势在于每个阶段都可替换:简单轮次用廉价模型,困难轮次用前沿模型,不同地区用不同的合成器。代价在于延迟会在每个接缝处累积,而且话轮转换决策必须从外部做出。
逐个维度
• 架构 — GPT-Live-1:单一端到端模型,音频输入、音频输出,而 ElevenLabs Agents:级联式语音识别、语言模型与合成,外加专有话轮转换层
• 独立证据 — GPT-Live-1:在 Artificial Analysis Speech to Speech Index 上达到 70.3%,在十四家中并列第六,对比 ElevenLabs Agents:在 Speech Agent Arena 上 Elo 937,在 676 个样本中任务成功率为 90.5%,是该榜单前六名中的最佳成功率
• 质量榜 — GPT-Live-1:未在文本转语音竞技场中排名,因为与 ElevenLabs 属于不同类型的模型:Eleven v3 Conversational 以 1,194 Elo、Eleven v3 以 1,166 Elo 位列 Provider Voice 榜,定价分别为每百万字符 50 美元和 100 美元
• 价格 — GPT-Live-1:每语音分钟 0.05 美元,按秒计费,后端推理单独计量;对比 ElevenLabs:Eleven v3 Conversational 约为每百万字符 50 美元,Eleven v3 约为 100 美元,据报告智能体约为每分钟 0.08 美元,超过并发上限后会上涨,且语言模型和电话通信费用另行计费
• 延迟 — GPT-Live-1:未公布模型层面的首个音频时间;供应商测试中的轮次切换延迟为 0.798 秒,相比之下 ElevenLabs:Flash v2.5 约为 75 毫秒,Eleven v3 Conversational 约为 280 毫秒,供应商建议在智能体层面首个音频低于 800 毫秒
• 声音与克隆 — GPT-Live-1:十二个 API 预设,按设计不提供克隆;对比 ElevenLabs:库中有超过 10,000 种声音,可通过短样本即时克隆,使用 30 到 180 分钟的音频进行专业克隆并带自我验证
• 语言 — GPT-Live-1:主要语言表现良好,但在发布覆盖范围之外的语言上流畅度参差不齐;相比之下,ElevenLabs Eleven v3:支持 70 多种语言,而 Flash 系列为 32 种,其语音识别则支持 90 多种
• 广度 — GPT-Live-1:一个端点、一个模型 ID,并发档位从 25 到 500 个会话,且没有免费套餐;相比之下,ElevenLabs:语音合成、语音识别、配音、音效、音乐、语音市场以及智能体平台全都纳入同一份合同,其免费套餐不附带商业许可


ElevenLabs 不仅领先,而且无人能敌之处
那份名单中有三处差距并不接近,任何把它们写进同一句话里的比较,对现任者都不公平。
语音克隆是第一个方面。GPT-Live-1 提供十二种预设,并且在设计上完全不支持克隆——这是一种刻意的安全姿态,而非功能缺失。ElevenLabs 提供基于简短参考样本的即时克隆,以及基于 30 到 180 分钟音频训练的专业克隆,两者均受套餐层级和自助验证步骤的限制。如果你的产品语音是其身份标识的一部分,那么这并非 GPT-Live-1 参与竞争的维度。
语音库是第二项。超过 10,000 种声音,外加一个获得授权的标志性声音市场,汇集了来自艺人遗产管理机构和表演者的声音,这是任何模型发布都无法复制的资产。它也是买家最常低估的东西:挑选声音是语音产品的最后一公里,而有 10,000 种可供选择,会把一项品牌塑造工作压缩进一个下午。
第三个是广度。语音识别、配音、音效、音乐、智能体平台——一个需要其中四样的团队只需签一份合同,而不是四份。这是战略层面的优势,而非质量层面的优势,而且即便对手在某个基准测试中胜出,它依然成立。
两家公司都背负着一些治理层面的问题,这些问题应当纳入采购审查,而不是被当作脚注一带而过。ElevenLabs 的专业语音克隆要求自我验证,其条款禁止克隆他人的声音,即便获得对方同意也不行;该公司还面临 2026 年 5 月就训练数据同意问题提起的一系列集体诉讼,而这些指控尚未得到证实。OpenAI 的处境则更为简单,因为它已经移除了产生这一风险的功能。

级联税,以及在何处值得缴纳
级联架构的成本体现在延迟和编排两方面。ElevenLabs 的厂商指南指出,智能体的首次音频时间在中位数上低于 800 毫秒,在第 95 百分位上低于 1.5 秒——这些数字描述的是整个流水线,而非合成器那 75 毫秒。在此之上还叠加了语言模型的生成时间和网络传输耗时。其中一部分可以通过审慎选择各个阶段来挽回;但没有哪一部分是免费的。
编排的代价没那么显眼,却真实存在。每多一个环节,就多一处可能调用失败的地方,多一个要调的超时,多一家要对账的供应商。而这正是原生端到端模型彻底消除的部分:只有一样东西可能出故障,而它要么给出回答,要么不给。
级联真正回本的地方是中间阶段。语音代理背后的语言模型,是质量提升最快、成本波动也最大的组件,而能够在不触动语音层的前提下将其替换,在产品整个生命周期内能带来实实在在的价值。大约 来自十一家上游供应商的 190 个模型通过单个 OrcaRouter 密钥、按供应商标价、零加价接入,因此供应商一调价,当天就能传导到这一层,而自动故障转移可避免后端超时中断正在进行的通话。无论是 ElevenLabs 的 agents 技术栈,还是 GPT-Live-1 的 Live Sessions 端点,都无法以这种方式接入——语音层归各自的供应商所有,而这只是它们下面的一层。
该选哪一个
如果对话机制本身就是产品,并且你希望只有一份契约、一种故障模式,就选择 GPT-Live-1。适用于来电者会打断智能体的电话线路——自然转接比完美音色更重要,十二种好音色就足够。你接受封闭式托管模型、不支持克隆、独立质量处于中游,以及没有免费套餐可供原型开发。
如果约束条件是语音质量、克隆能力或覆盖广度,就选择 ElevenLabs。旁白、配音、多语言产品,任何语音即品牌的应用,任何需要在同一份合约中实现语音识别的场景。你接受需要运行级联系统、每单位语音的价格约为 GPT-Live-1 的十到二十倍,以及打断逻辑由你配置、也由你搞砸这一事实。
90.5% 这个数字才是值得带走的部分。它说明,一家把三个模型加一个轮次切换层拼装起来的公司,在一项最接近“通话是否真正管用”的指标上,击败了一家训练单个模型包办一切的公司。全双工是一项真正的架构进步,但就目前的证据来看,它并不是决定来电者能否得到自己想要的东西的那个因素。
