
GPT-Live-1 vs Cartesia Sonic 3.6:排名第一的 TTS 榜单并不衡量打断能力
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Cartesia Sonic 3.6 目前在 Artificial Analysis 的两个文本转语音竞技场中都处于领先——在 Provider Voice 榜单上获得 1,275 Elo,在 Controlled Voice 榜单上也排名第一,领先于所有拥有更大平台支撑的商业引擎。GPT-Live-1 在两个榜单上均未上榜,因为它不是文本转语音模型。它在 Artificial Analysis 的另一个榜单 Speech to Speech Index 上,以 70.3% 在十四个中并列第六。综合来看,这两个事实描述了这些产品之间的实际分野:Sonic 3.6 很可能是更好的语音,而 GPT-Live-1 是两者中唯一能听到呼叫者开始说话和停止说话的。
两者都已上线,且都已可商用——自其稳定快照于 2026 年 8 月 27 日发布以来,Sonic 3.6 已在 Cartesia 自家 API 上提供;自 2026 年 9 月 10 日起,GPT-Live-1 已在 OpenAI 的开发者 API 上提供,价格为每语音分钟 0.05 美元。在两者之间做选择,并不是一个关乎质量的决策,而是一个关于你正在购买语音智能体哪一半的决策。
两个竞技场,两个问题,以及为什么这种分裂真实存在
Artificial Analysis 运营其语音榜单的方式,值得在有人向你引用任一 Elo 之前先了解一下。Provider Voice 竞技场使用各厂商自己的原生语音来对引擎进行排名——它衡量的是你开箱即用实际得到的语音,而这正是买家关心的数字。Controlled Voice 竞技场则将每个模型都克隆到相同的八个参考语音上,让听众比较的是合成引擎,而不是语音人才。Sonic 3.6 在两个榜单上都领先,这比听起来更罕见:在 2026 年的大部分时间里,这两个榜单的冠军一直不同。
这两个榜单都不包含哪怕一个模型被中断的样本。它们衡量的是语音在孤立状态下、对听者来说听起来如何。Speech to Speech Index 的构建方式不同——它把语音推理、智能体表现、竞技场偏好和任务成功率综合成一个数字,而且只接纳原生语音到语音的模型。Cartesia 在其中没有条目。不是因为 Sonic 3.6 不好,而是因为一个文本转语音引擎没有什么可提交的。
所以,1,275 和 70.3% 并不是相互竞争的数字,任何把它们放在同一行上进行比较的做法,都在悄悄对你说谎。它们共同确立的是:质量已不再是这个决策所围绕的轴心。

逐个维度
• 类型 — GPT-Live-1:全双工语音到语音,整个闭环由一个模型完成;对比 Cartesia Sonic 3.6:流式文本转语音,搭配用于智能体的 Ink-2 语音识别
• 独立质量 — GPT-Live-1:在 Speech to Speech Index 上达到 70.3%,在十四个中并列第六;对比 Cartesia Sonic 3.6:在 Provider Voice 榜单上获得 1,275 Elo(来自 1,755 个样本),并且在 Controlled Voice 榜单上也排名第一
• 中断处理 — GPT-Live-1:模型的一种特性,每秒多次决定是否让出轮次,而 Cartesia Sonic 3.6:一种集成模式,客户端取消合成上下文,并依赖词级时间戳在恰当时刻截断
• 价格 — GPT-Live-1:每语音分钟 $0.05,按秒计费,推理后端单独计量;对比 Cartesia Sonic 3.6:在积分套餐下约每百万字符 $49,另加每分钟 $0.06 的智能体通话时长费用,以及 Cartesia 电话号码每分钟 $0.014 的费用
• 延迟 — GPT-Live-1:未公布模型层面的数字;回合转换延迟在 OpenAI 自家测试中为 0.798 秒,而 Cartesia Sonic 3.6 则为:首音频时间低于 90 毫秒,系厂商声明,未经端到端独立测量
• 吞吐量 — GPT-Live-1:并发会话在第 1 层级上限为 25,在第 5 层级上限为 500,且没有免费层级;而 Cartesia Sonic 3.6:约每秒 132 个字符,在同一对比中大致是 ElevenLabs v3 速率的两倍,并提供每月 20,000 积分的免费层级
• 语言 — GPT-Live-1:在发布覆盖范围中,主要语言之外的流畅度参差不齐,而 Cartesia Sonic 3.6 则覆盖 61 个地区的 44 种语言,本次发布新增了奥里亚语和乌尔都语
• 语音控制 — GPT-Live-1:十二种预设,通过提示词控制语调和语速,不支持克隆;对比 Cartesia Sonic 3.6:超过 500 种预设语音、即时克隆、更高层级套餐支持专业克隆、词级和音素级时间戳,且不支持 SSML——模型会根据文本本身调整语速

打断是架构的特性,而不是一个复选框
买家在这项对比中最常搞错的一点,就是把打断支持当成一个布尔值。Cartesia 的文档坦诚说明了其方案的工作方式:当来电者在智能体说话时插话,客户端会针对当前合成上下文发送取消请求,而正是 WebSocket 连接上返回的词级时间戳,让你能在正确的音节处停止播放。这是一种合格的设计,也是当今大多数生产级语音智能体处理打断的方式。
这仍然是一种设计:停止说话的决定由你的应用借助语音活动信号做出,延迟取决于往返传输所允许的程度。GPT-Live-1 将这一决定移入模型内部。它持续判断是继续聆听、暂停、接过话轮,还是将话轮交给对方,正因如此,OpenAI 自己公布的数据显示,在 Full Duplex Bench v1.5 上,其交互度为 80.1%,而 GPT-Realtime-2.1 为 45.4%;话轮转换延迟为 0.798 秒,而后者为 1.41 秒。这些数字来自 OpenAI,随发布一同公布,公司外部无人复现——但其背后的架构差异并无争议,而这正是级联系统无法通过调优来逼近的一点。
级联方案真正的优势在于句子之后的所有环节。Cartesia 宣称的低于90毫秒首音频延迟只是供应商提供的数据,它衡量的是模型本身,而非整段对话:用户实际体验到的数字还包括语音识别、轮次检测、语言模型的生成时间、网络传输和音频缓冲。正因如此,当你需要掌控每一个环节时,级联方案就值得搭建——简单轮次用快速的小模型,困难轮次用前沿模型,再配上一个从不让等待的语音合成器。
那个中间阶段是两种技术栈中唯一真正可移植的部分,也正是它同时决定着通话的质量与成本。大致来自十一家上游提供商的 190 个模型只需一个 OrcaRouter 密钥,即可按提供商标价、零加价调用,而路由 DSL 让单个端点就能把简单的轮次交给廉价模型,把复杂的轮次升级到前沿模型——这正是语音智能体真正想要的模式,被用在了变化最大的那个阶段上。无论是 Sonic 3.6 还是 GPT-Live-1,都无法通过路由层访问;语音层属于各自的厂商。

管理资金
这两种定价模式对不上,所以值得认真做好换算。语音语速约为每分钟 150 个单词,而英语平均每个单词约 5.5 个字符,因此一分钟的语音输出约为 800 到 900 个字符。按照每百万字符 49 美元计算,Cartesia 的语音合成成本约为每分钟音频 4 美分。
接着,级联的其余部分就来了。Cartesia 按语音代理通话时长每分钟收取 0.06 美元,如果使用其电话号码,则每分钟再收 0.014 美元,此外还要按字符计费。再加上语音识别和用于处理文本的语言模型,在任何人说出任何难处理的话之前,你每分钟就已经超过十美分了。GPT-Live-1 每分钟语音 0.05 美元的费用涵盖了听、话轮转换和说,而委派出去的推理则按后端模型的正常费率单独计费——对于附有一两次搜索的预订通话来说,这是一笔实实在在的金额,而不是可以忽略不计的舍入误差。
分界点取决于通话量和难度。简短、重复、高频的通话——确认、通知、简单查询——更适合级联方案,因为让廉价模型回答脚本化问题,是这一比较中最便宜的做法。当来电者脱稿、打断座席,或在句子说到一半改变主意时,这类通话更适合端到端模型,因为级联方案在这类情况下的失败模式不是给出错误答案,而是给出一个尴尬的答案。
该选哪一个
如果你想要目前可用的得分最高的语音,并且愿意自行掌控对话逻辑,就选择 Cartesia Sonic 3.6。它非常适合旁白、面向大批量脚本化智能体的场景、已有语音识别流水线的团队,以及任何需要词级时间戳来实现精准打断处理的人。你可以获得免费层级、500 多种语音、克隆、44 种语言以及两个质量榜单的榜首,并且还能掌控每一个环节。
如果打断本身就是产品,就选 GPT-Live-1。凡是被人抢话是常态而非边缘情况,并且在没人把话问完的句子上,0.8 秒的轮次交接胜过 90 毫秒的启动,都适用。你接受一个闭源、托管、按分钟计费的模型,带有十二种语音且不支持克隆,并且接受它的独立质量评分处于中游。
人们忍不住想拿 1,275 与 70.3% 一比,就宣称此事已成定论。但事实并非如此,而这两个数字之间的差别,正是整场争论的所在:一个衡量的是声音听起来如何,另一个衡量的是它是否值得与之交谈。
