《GPT-Live-1 vs Cartesia Sonic 3.6》的主视觉标题卡,副标题为“最好听的声音,并不是能听见你的那个”,并带有三张卡片,分别写着“Cartesia Sonic 3.6:1,275 Elo,在 Artificial Analysis 的两个语音竞技场中均位列第 1”“GPT-Live-1:在 Speech to Speech Index 上达到 70.3%,在 14 个中并列第 6”“评分榜各不相同,因为它们衡量的是不同的东西”,三张卡片下方是一条页脚横条,写着“竞技场数据依据 Artificial Analysis;GPT-Live-1 的交互性数据由 OpenAI 提供。”OrcaRouter 徽标合成于右下角。
Guides & Insights

GPT-Live-1 vs Cartesia Sonic 3.6:排名第一的 TTS 榜单并不衡量打断能力

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Cartesia Sonic 3.6 目前在 Artificial Analysis 的两个文本转语音竞技场中都处于领先——在 Provider Voice 榜单上获得 1,275 Elo,在 Controlled Voice 榜单上也排名第一,领先于所有拥有更大平台支撑的商业引擎。GPT-Live-1 在两个榜单上均未上榜,因为它不是文本转语音模型。它在 Artificial Analysis 的另一个榜单 Speech to Speech Index 上,以 70.3% 在十四个中并列第六。综合来看,这两个事实描述了这些产品之间的实际分野:Sonic 3.6 很可能是更好的语音,而 GPT-Live-1 是两者中唯一能听到呼叫者开始说话和停止说话的。

两者都已上线,且都已可商用——自其稳定快照于 2026 年 8 月 27 日发布以来,Sonic 3.6 已在 Cartesia 自家 API 上提供;自 2026 年 9 月 10 日起,GPT-Live-1 已在 OpenAI 的开发者 API 上提供,价格为每语音分钟 0.05 美元。在两者之间做选择,并不是一个关乎质量的决策,而是一个关于你正在购买语音智能体哪一半的决策。

两个竞技场,两个问题,以及为什么这种分裂真实存在

Artificial Analysis 运营其语音榜单的方式,值得在有人向你引用任一 Elo 之前先了解一下。Provider Voice 竞技场使用各厂商自己的原生语音来对引擎进行排名——它衡量的是你开箱即用实际得到的语音,而这正是买家关心的数字。Controlled Voice 竞技场则将每个模型都克隆到相同的八个参考语音上,让听众比较的是合成引擎,而不是语音人才。Sonic 3.6 在两个榜单上都领先,这比听起来更罕见:在 2026 年的大部分时间里,这两个榜单的冠军一直不同。

这两个榜单都不包含哪怕一个模型被中断的样本。它们衡量的是语音在孤立状态下、对听者来说听起来如何。Speech to Speech Index 的构建方式不同——它把语音推理、智能体表现、竞技场偏好和任务成功率综合成一个数字,而且只接纳原生语音到语音的模型。Cartesia 在其中没有条目。不是因为 Sonic 3.6 不好,而是因为一个文本转语音引擎没有什么可提交的。

所以,1,275 和 70.3% 并不是相互竞争的数字,任何把它们放在同一行上进行比较的做法,都在悄悄对你说谎。它们共同确立的是:质量已不再是这个决策所围绕的轴心。

A screenshot of the Artificial Analysis Speech to Speech Index chart, ranking fourteen natively speech-to-speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7% and Gemini 2.5 Flash at 52.8%. A companion panel charts cost per hour of input audio across the same field.

逐个维度

• 类型 — GPT-Live-1:全双工语音到语音,整个闭环由一个模型完成;对比 Cartesia Sonic 3.6:流式文本转语音,搭配用于智能体的 Ink-2 语音识别

• 独立质量 — GPT-Live-1:在 Speech to Speech Index 上达到 70.3%,在十四个中并列第六;对比 Cartesia Sonic 3.6:在 Provider Voice 榜单上获得 1,275 Elo(来自 1,755 个样本),并且在 Controlled Voice 榜单上也排名第一

• 中断处理 — GPT-Live-1:模型的一种特性,每秒多次决定是否让出轮次,而 Cartesia Sonic 3.6:一种集成模式,客户端取消合成上下文,并依赖词级时间戳在恰当时刻截断

• 价格 — GPT-Live-1:每语音分钟 $0.05,按秒计费,推理后端单独计量;对比 Cartesia Sonic 3.6:在积分套餐下约每百万字符 $49,另加每分钟 $0.06 的智能体通话时长费用,以及 Cartesia 电话号码每分钟 $0.014 的费用

• 延迟 — GPT-Live-1:未公布模型层面的数字;回合转换延迟在 OpenAI 自家测试中为 0.798 秒,而 Cartesia Sonic 3.6 则为:首音频时间低于 90 毫秒,系厂商声明,未经端到端独立测量

• 吞吐量 — GPT-Live-1:并发会话在第 1 层级上限为 25,在第 5 层级上限为 500,且没有免费层级;而 Cartesia Sonic 3.6:约每秒 132 个字符,在同一对比中大致是 ElevenLabs v3 速率的两倍,并提供每月 20,000 积分的免费层级

• 语言 — GPT-Live-1:在发布覆盖范围中,主要语言之外的流畅度参差不齐,而 Cartesia Sonic 3.6 则覆盖 61 个地区的 44 种语言,本次发布新增了奥里亚语和乌尔都语

• 语音控制 — GPT-Live-1:十二种预设,通过提示词控制语调和语速,不支持克隆;对比 Cartesia Sonic 3.6:超过 500 种预设语音、即时克隆、更高层级套餐支持专业克隆、词级和音素级时间戳,且不支持 SSML——模型会根据文本本身调整语速

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Cartesia Sonic 3.6 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Voices: 12 presets, no cloning'. The right column, labelled Cartesia Sonic 3.6, reads 'Kind: streaming text-to-speech', 'Price: ~$49 per 1M characters, plus $0.06 per agent minute', 'Time to first audio: under 90 ms, vendor-stated', 'Throughput: ~132 characters per second', 'Independent score: 1,275 Elo, #1 on the AA Provider Voice arena', 'Voices: 500+ presets, cloning, word timestamps'. The footer reads 'Sonic 3.6 latency vendor-stated; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

打断是架构的特性,而不是一个复选框

买家在这项对比中最常搞错的一点,就是把打断支持当成一个布尔值。Cartesia 的文档坦诚说明了其方案的工作方式:当来电者在智能体说话时插话,客户端会针对当前合成上下文发送取消请求,而正是 WebSocket 连接上返回的词级时间戳,让你能在正确的音节处停止播放。这是一种合格的设计,也是当今大多数生产级语音智能体处理打断的方式。

这仍然是一种设计:停止说话的决定由你的应用借助语音活动信号做出,延迟取决于往返传输所允许的程度。GPT-Live-1 将这一决定移入模型内部。它持续判断是继续聆听、暂停、接过话轮,还是将话轮交给对方,正因如此,Open​AI 自己公布的数据显示,在 Full Duplex Bench v1.5 上,其交互度为 80.1%,而 GPT-Realtime-2.1 为 45.4%;话轮转换延迟为 0.798 秒,而后者为 1.41 秒。这些数字来自 Open​AI,随发布一同公布,公司外部无人复现——但其背后的架构差异并无争议,而这正是级联系统无法通过调优来逼近的一点。

级联方案真正的优势在于句子之后的所有环节。Cartesia 宣称的低于90毫秒首音频延迟只是供应商提供的数据,它衡量的是模型本身,而非整段对话:用户实际体验到的数字还包括语音识别、轮次检测、语言模型的生成时间、网络传输和音频缓冲。正因如此,当你需要掌控每一个环节时,级联方案就值得搭建——简单轮次用快速的小模型,困难轮次用前沿模型,再配上一个从不让等待的语音合成器。

那个中间阶段是两种技术栈中唯一真正可移植的部分,也正是它同时决定着通话的质量与成本。大致来自十一家上游提供商的 190 个模型只需一个 OrcaRouter 密钥,即可按提供商标价、零加价调用,而路由 DSL 让单个端点就能把简单的轮次交给廉价模型,把复杂的轮次升级到前沿模型——这正是语音智能体真正想要的模式,被用在了变化最大的那个阶段上。无论是 Sonic 3.6 还是 GPT-Live-1,都无法通过路由层访问;语音层属于各自的厂商。

A screenshot of Cartesia's official Sonic 3.6 product page, showing the post title 'Introducing Sonic-3.6' dated Aug 27, 2026, the claim that listeners preferred it in up to 93% of blind head-to-head tests across fifteen locales, and the statement that Sonic-3.6 'takes #1 on the Artificial Analysis leaderboard across both the controlled and provider voice boards'. Below it, an embedded Controlled Voice leaderboard lists Sonic 3.6 first ahead of Sonic 3.5, Eleven v3, StepAudio 2.5 and Realtime TTS 1.5.

管理资金

这两种定价模式对不上,所以值得认真做好换算。语音语速约为每分钟 150 个单词,而英语平均每个单词约 5.5 个字符,因此一分钟的语音输出约为 800 到 900 个字符。按照每百万字符 49 美元计算,Cartesia 的语音合成成本约为每分钟音频 4 美分。

接着,级联的其余部分就来了。Cartesia 按语音代理通话时长每分钟收取 0.06 美元,如果使用其电话号码,则每分钟再收 0.014 美元,此外还要按字符计费。再加上语音识别和用于处理文本的语言模型,在任何人说出任何难处理的话之前,你每分钟就已经超过十美分了。GPT-Live-1 每分钟语音 0.05 美元的费用涵盖了听、话轮转换和说,而委派出去的推理则按后端模型的正常费率单独计费——对于附有一两次搜索的预订通话来说,这是一笔实实在在的金额,而不是可以忽略不计的舍入误差。

分界点取决于通话量和难度。简短、重复、高频的通话——确认、通知、简单查询——更适合级联方案,因为让廉价模型回答脚本化问题,是这一比较中最便宜的做法。当来电者脱稿、打断座席,或在句子说到一半改变主意时,这类通话更适合端到端模型,因为级联方案在这类情况下的失败模式不是给出错误答案,而是给出一个尴尬的答案。

该选哪一个

如果你想要目前可用的得分最高的语音,并且愿意自行掌控对话逻辑,就选择 Cartesia Sonic 3.6。它非常适合旁白、面向大批量脚本化智能体的场景、已有语音识别流水线的团队,以及任何需要词级时间戳来实现精准打断处理的人。你可以获得免费层级、500 多种语音、克隆、44 种语言以及两个质量榜单的榜首,并且还能掌控每一个环节。

如果打断本身就是产品,就选 GPT-Live-1。凡是被人抢话是常态而非边缘情况,并且在没人把话问完的句子上,0.8 秒的轮次交接胜过 90 毫秒的启动,都适用。你接受一个闭源、托管、按分钟计费的模型,带有十二种语音且不支持克隆,并且接受它的独立质量评分处于中游。

人们忍不住想拿 1,275 与 70.3% 一比,就宣称此事已成定论。但事实并非如此,而这两个数字之间的差别,正是整场争论的所在:一个衡量的是声音听起来如何,另一个衡量的是它是否值得与之交谈。