'GPT-Live-1 vs ElevenLabs' 的主视觉标题卡,副标题为“以单一端到端模型对比级联式技术栈,在二者真正交汇之处加以衡量”,并配有三张卡片,分别写着“GPT-Live-1:每语音分钟 0.05 美元,全双工,不支持克隆”“ElevenLabs Agents:Speech Agent Arena 上 Elo 937,任务成功率 90.5%”“ElevenLabs Eleven v3:70 多种语言,10,000 多种音色库音色”,其下方是一条页脚横条,写着“Arena 数据来自 Artificial Analysis;定价依据厂商文档,2026 年 9 月。”OrcaRouter 标志合成于右下角。
Guides & Insights

GPT-Live-1 与 ElevenLabs:一个会倾听的模型,一家什么都卖的公司

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

这个对比中最有用的数字是 90.5%。这是 Artificial Analysis 在其 Speech Agent Arena 中为 ElevenLabs Agents 测得的任务成功率——在该榜单前六名中位居最高,而取得这一成绩的系统根本不是一个单一模型,而是由语音识别、语言模型和合成器组成的级联系统,通过 ElevenLabs 自家的轮次转换逻辑串联起来。GPT-Live-1 是 Open​AI 的端到端全双工模型,它并未出现在该榜单上,因为它参与的是另一个榜单:Speech to Speech Index,在那里它以 70.3% 的成绩在十四个模型中并列第六。与此同时,ElevenLabs Eleven v3 仍是业内部署最广泛的生产级语音,其库中拥有超过 10,000 种声音和 70 多种语言。

这个简化说法是:一方卖给你的是一场对话,另一方卖给你的是一整家公司。这种说法大体上没错,但它掩盖了底下那个更有意思的发现:在完成任务这件事上,一套精心设计的级联方案依然胜过原生的全双工模型。

两种架构,区别在于接缝在哪里

GPT-Live-1 是一个单一模型,可接收音频和文本输入,并输出音频和文本。它原生支持打断——Open​AI 自己的测试(随 9 月的 API 发布一同公布,且未在公司外部复现)报告称,在 Full Duplex Bench v1.5 上其交互性达到 80.1%,而 GPT-Realtime-2.1 为 45.4%;轮次转换延迟为 0.798 秒,后者为 1.41 秒。这里没有任何接缝,因为根本不存在需要拼接的东西。

ElevenLabs Agents 则是刻意押下的相反方向。ElevenLabs 的文档描述的是一条流水线:经过调优的语音识别、一个由你选择或自带的语言模型、一个低延迟的合成器——通常来自 Flash 系列——再加上一层专有的轮次交替模型。打断(barge-in)是每个智能体各自的配置,暴露的是轮次积极程度和超时设置,而非模型本身的属性。在 Artificial Analysis 的基准测试默认配置中,这套技术栈的构成是:语音识别采用 Scribe v2 Realtime,推理采用 Gem​ini 模型,合成采用 Eleven Flash v2。

那种设计有一个巨大的优势和一个结构性成本。优势在于每个阶段都可替换:简单轮次用廉价模型,困难轮次用前沿模型,不同地区用不同的合成器。代价在于延迟会在每个接缝处累积,而且话轮转换决策必须从外部做出。

逐个维度

• 架构 — GPT-Live-1:单一端到端模型,音频输入、音频输出,而 ElevenLabs Agents:级联式语音识别、语言模型与合成,外加专有话轮转换层

• 独立证据 — GPT-Live-1:在 Artificial Analysis Speech to Speech Index 上达到 70.3%,在十四家中并列第六,对比 ElevenLabs Agents:在 Speech Agent Arena 上 Elo 937,在 676 个样本中任务成功率为 90.5%,是该榜单前六名中的最佳成功率

• 质量榜 — GPT-Live-1:未在文本转语音竞技场中排名,因为与 ElevenLabs 属于不同类型的模型:Eleven v3 Conversational 以 1,194 Elo、Eleven v3 以 1,166 Elo 位列 Provider Voice 榜,定价分别为每百万字符 50 美元和 100 美元

• 价格 — GPT-Live-1:每语音分钟 0.05 美元,按秒计费,后端推理单独计量;对比 ElevenLabs:Eleven v3 Conversational 约为每百万字符 50 美元,Eleven v3 约为 100 美元,据报告智能体约为每分钟 0.08 美元,超过并发上限后会上涨,且语言模型和电话通信费用另行计费

• 延迟 — GPT-Live-1:未公布模型层面的首个音频时间;供应商测试中的轮次切换延迟为 0.798 秒,相比之下 ElevenLabs:Flash v2.5 约为 75 毫秒,Eleven v3 Conversational 约为 280 毫秒,供应商建议在智能体层面首个音频低于 800 毫秒

• 声音与克隆 — GPT-Live-1:十二个 API 预设,按设计不提供克隆;对比 ElevenLabs:库中有超过 10,000 种声音,可通过短样本即时克隆,使用 30 到 180 分钟的音频进行专业克隆并带自我验证

• 语言 — GPT-Live-1:主要语言表现良好,但在发布覆盖范围之外的语言上流畅度参差不齐;相比之下,ElevenLabs Eleven v3:支持 70 多种语言,而 Flash 系列为 32 种,其语音识别则支持 90 多种

• 广度 — GPT-Live-1:一个端点、一个模型 ID,并发档位从 25 到 500 个会话,且没有免费套餐;相比之下,ElevenLabs:语音合成、语音识别、配音、音效、音乐、语音市场以及智能体平台全都纳入同一份合同,其免费套餐不附带商业许可

A two-column comparison scoreboard titled 'GPT-Live-1 vs ElevenLabs — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Architecture: one end-to-end full-duplex model', 'Price: $0.05 per voice minute plus backend', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Interactivity: 80.1% (vendor, unreproduced)', 'Voices: 12 presets, no cloning', 'Best at: interruption handling'. The right column, labelled ElevenLabs, reads 'Architecture: cascaded STT + LLM + TTS', 'Price: ~$50 to $100 per 1M characters; agents ~$0.08 per minute', 'Independent score: Elo 937 on the AA Speech Agent Arena, 90.5% task success', 'Latency: ~75 ms Flash v2.5, ~280 ms v3 Conversational (vendor)', 'Voices: 10,000+ library voices, cloning with verification', 'Best at: platform breadth and voice quality'. The footer reads 'ElevenLabs agent pricing is third-party reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Artificial Analysis Speech Agent Arena leaderboard, ranking cascaded voice-agent systems by Elo and task success rate. The top rows read Gemini 3.1 Flash Live Minimal at 1,046 Elo over 768 samples with a 74.6% task success rate, Gemini 3.1 Flash Live High at 1,014 with 71.8%, GPT-Realtime-1.5 at 1,000 with 85.1%, GPT Realtime (Aug '25) at 944 with 89.4%, and ElevenLabs Agents, labelled 'Default Cascaded System', at Elo 937 over 676 samples with a task success rate of 90.5% — the highest in the top six. The board continues with Amazon Bedrock Nova 2.0 Sonic at 917 and Grok Voice Think Fast 2.0 High at 908 with a 94.7% success rate.

ElevenLabs 不仅领先,而且无人能敌之处

那份名单中有三处差距并不接近,任何把它们写进同一句话里的比较,对现任者都不公平。

语音克隆是第一个方面。GPT-Live-1 提供十二种预设,并且在设计上完全不支持克隆——这是一种刻意的安全姿态,而非功能缺失。ElevenLabs 提供基于简短参考样本的即时克隆,以及基于 30 到 180 分钟音频训练的专业克隆,两者均受套餐层级和自助验证步骤的限制。如果你的产品语音是其身份标识的一部分,那么这并非 GPT-Live-1 参与竞争的维度。

语音库是第二项。超过 10,000 种声音,外加一个获得授权的标志性声音市场,汇集了来自艺人遗产管理机构和表演者的声音,这是任何模型发布都无法复制的资产。它也是买家最常低估的东西:挑选声音是语音产品的最后一公里,而有 10,000 种可供选择,会把一项品牌塑造工作压缩进一个下午。

第三个是广度。语音识别、配音、音效、音乐、智能体平台——一个需要其中四样的团队只需签一份合同,而不是四份。这是战略层面的优势,而非质量层面的优势,而且即便对手在某个基准测试中胜出,它依然成立。

两家公司都背负着一些治理层面的问题,这些问题应当纳入采购审查,而不是被当作脚注一带而过。ElevenLabs 的专业语音克隆要求自我验证,其条款禁止克隆他人的声音,即便获得对方同意也不行;该公司还面临 2026 年 5 月就训练数据同意问题提起的一系列集体诉讼,而这些指控尚未得到证实。OpenAI 的处境则更为简单,因为它已经移除了产生这一风险的功能。

A screenshot of ElevenLabs' official models documentation page, describing Eleven v3 under a 'Flagship models' heading as 'Our most emotionally rich, expressive speech synthesis model', with the supporting lines 'Dramatic delivery and performance', '70+ languages supported', '5,000 character limit' and 'Support for natural multi-speaker dialogue'. The surrounding navigation lists ElevenLabs' wider product set, including text to speech, speech to text, music, text to dialogue, dubbing, sound effects, voices and voice agents.

级联税,以及在何处值得缴纳

级联架构的成本体现在延迟和编排两方面。ElevenLabs 的厂商指南指出,智能体的首次音频时间在中位数上低于 800 毫秒,在第 95 百分位上低于 1.5 秒——这些数字描述的是整个流水线,而非合成器那 75 毫秒。在此之上还叠加了语言模型的生成时间和网络传输耗时。其中一部分可以通过审慎选择各个阶段来挽回;但没有哪一部分是免费的。

编排的代价没那么显眼,却真实存在。每多一个环节,就多一处可能调用失败的地方,多一个要调的超时,多一家要对账的供应商。而这正是原生端到端模型彻底消除的部分:只有一样东西可能出故障,而它要么给出回答,要么不给。

级联真正回本的地方是中间阶段。语音代理背后的语言模型,是质量提升最快、成本波动也最大的组件,而能够在不触动语音层的前提下将其替换,在产品整个生命周期内能带来实实在在的价值。大约 来自十一家上游供应商的 190 个模型通过单个 OrcaRouter 密钥、按供应商标价、零加价接入,因此供应商一调价,当天就能传导到这一层,而自动故障转移可避免后端超时中断正在进行的通话。无论是 ElevenLabs 的 agents 技术栈,还是 GPT-Live-1 的 Live Sessions 端点,都无法以这种方式接入——语音层归各自的供应商所有,而这只是它们下面的一层。

该选哪一个

如果对话机制本身就是产品,并且你希望只有一份契约、一种故障模式,就选择 GPT-Live-1。适用于来电者会打断智能体的电话线路——自然转接比完美音色更重要,十二种好音色就足够。你接受封闭式托管模型、不支持克隆、独立质量处于中游,以及没有免费套餐可供原型开发。

如果约束条件是语音质量、克隆能力或覆盖广度,就选择 ElevenLabs。旁白、配音、多语言产品,任何语音即品牌的应用,任何需要在同一份合约中实现语音识别的场景。你接受需要运行级联系统、每单位语音的价格约为 GPT-Live-1 的十到二十倍,以及打断逻辑由你配置、也由你搞砸这一事实。

90.5% 这个数字才是值得带走的部分。它说明,一家把三个模型加一个轮次切换层拼装起来的公司,在一项最接近“通话是否真正管用”的指标上,击败了一家训练单个模型包办一切的公司。全双工是一项真正的架构进步,但就目前的证据来看,它并不是决定来电者能否得到自己想要的东西的那个因素。