
Eleven v4 对决 Cartesia Sonic 3.6:以 43 分的 Elo 差距,对抗便宜 39% 的语音
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 982 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 195 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1189 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
ElevenLabs Eleven v4在 Artificial Analysis 的 Provider Voice Arena 上比Cartesia Sonic 3.6高出 43 个 Elo 分——1319 对 1276——而且它同样赢下了 Controlled Voice 榜单,位列第二,而 Sonic 3.6 排名第四。但在价格上,它以相反的差距大幅落败:每百万字符 80.00 美元对 49.00 美元,而在发布窗口期内,按厂商自家价目表计算,其每字符费率约为后者的九倍。这是一场罕见的对决:记分板清清楚楚,决定却依旧难做,因为这两个模型实际上并不是在争夺同一份工作。

每个模型分别是什么,各用一段话说明
ElevenLabs Eleven v4 于 9 月 28 日发布,是该公司的旗舰语音合成模型,与 Eleven v4 Turbo 一同推出。文档显示,它支持 90 多种语言,每次请求的输入上限为 10,000 个字符,具备说话人身份稳定的多说话人对话功能,改进了 IPA 音素支持,并提供内联指令,让你可以把表达方式直接写进脚本。语音克隆只需十秒音频即可实现即时克隆,在此之上还提供专业级方案。
Cartesia Sonic 3.6 是 Cartesia 旗下一个以速度和自然度为核心卖点的模型系列的最新版本。其自家产品页面称其为最快、最自然的文本转语音模型,声称延迟低于 90 毫秒,原生支持 44 种语言,可从十秒音频克隆声音,提供自定义发音词典,并具备涵盖 HIPAA、SOC 2 Type 2、GDPR 和 PCI 的合规认证。两家供应商都公布各自模型的延迟数据;这两组数据均未经过独立验证,且测量方式并不相同。
记分牌,逐维度拆解
• 盲选偏好,各厂商自有语音——Eleven v4 排名第 1,Elo 1,319,对比 Sonic 3.6 排名第 2,Elo 1,276。相差 43 分。
• 盲测偏好,匹配的克隆语音——Eleven v4 排名第 2,Elo 1,157,对比 Sonic 3.6 排名第 4,Elo 1,138。19 分的差距,比第一次更窄。
• Arena 价格标准化,按每百万字符计 — Eleven v4 $80.00 对比 Sonic 3.6 $49.00。在榜单的统一基准下,Sonic 便宜 39%。
• 供应商费率表,按每千字符计——Eleven v4 促销价 $0.022,10月12日后为 $0.08,对比 Sonic 3.6 的 $0.049。促销结束后,Sonic 便宜 39%。
• 语言覆盖范围,以厂商文档为准 — Eleven v4 支持 90 多种,Sonic 3.6 支持 44 种。大约是其两倍。
• 每次请求的输入上限 — Eleven v4 为 10,000 个字符,而 Sonic 3.6 未在其产品页面上说明。
• 延迟(厂商自述)——Eleven v4 Turbo 到首次发声的中位延迟约为 150 毫秒,而 Sonic 3.6 低于 90 毫秒。不过,两者的测试条件同样并不相同。
• 语音克隆 — 两者均只需十秒的音频,且均具备更高的专业档位。
• 枚举控制 — Eleven v4 记录了 IPA 音素输入和专业克隆层级;Sonic 3.6 记录了自定义发音词典。
• 合规状况 — Sonic 3.6 声明符合 HIPAA、SOC 2 Type 2、GDPR 和 PCI。ElevenLabs 将其合规信息与模型页面分开声明,并且没有在 v4 旁提供一份对应的清单。

其中两行才是决定真实项目的关键。在厂商音色榜上,Elo 差距为 43 分,在克隆音色榜上为 19 分——当说话人保持不变时,Sonic 的差距缩小了一半以上。这正是那种调校有竞争力、但默认音色阵容没有竞争力的模型的典型特征,也说明 Sonic 在这场对决中的问题在于呈现,而不是合成质量。
为什么价格差距比看起来更小
标题费率对比在两个方面都具有误导性。Eleven v4 的每千字符 $0.022 是促销价,到期日为 10 月 12 日;窗口期过后仍然有效的是 $0.08,这比 Sonic 3.6 的费率卡高出 60% 以上。但 arena 归一化并不关心促销:它按模型的标价来计算,得出 $80.00 对 $49.00,这一对比到 11 月仍然成立。
还有第二个问题。Cartesia 并未在其产品页面上公布按字符计费的价格,因此 $0.049 这个数字来自竞技场的归一化处理,而非来自厂商,这两个计量口径也可能并不完全吻合——归一化会对提供商的计费方式做出假设。请把排序结果视为可靠,而把具体的百分比视为近似值。
按五百万字符计算的一个工作月:Eleven v4 按促销费率收费 110 美元,10 月 12 日之后为 400 美元。Sonic 3.6 收费 245 美元。因此,在接下来的两周内,Eleven v4 的成本不到 Sonic 的一半,而在那之后则高出 63%。任何今天撰写采购对比、下个月才交付的人,如果不说明自己使用的是哪个费率,就会把这一点弄反。
Sonic 3.6 是正确答案的那个片段
有些生产环境的语音工作负载,其真正重要的指标并不在竞技场榜单的衡量范围内,而 Sonic 3.6 正是为它们打造的。
实时对话式智能体是最明显的情形。低于 90 毫秒的延迟在电话代理中不是营销数字;它决定的是一次打断让人感觉被妥善处理,还是像通话掉线。ElevenLabs 并未公布 Eleven v4 本身的同类指标——只公布了 Turbo 层级首次发声的中位延迟约为 150 毫秒。如果你的代理的套接字预算很紧张,这 43 个 Elo 分对你来说可能不如这些毫秒有价值,而你自己进行的打断测试会比任何榜单更快地解决这个问题。
受监管部署是第二项。Cartesia 在产品页面上标明了 HIPAA、SOC 2 Type 2、GDPR 和 PCI。一份合规清单并不是一个 Elo 分数,也无法被后者所替代;如果医疗或支付领域的审核方在你的发布流程中,那么记分板上的这一行比其余九行都更重要。

确定性发音是第三项,而且更为微妙。Eleven v4 文档记录的 IPA 音素输入是一项优势,但 Sonic 3.6 的自定义发音词典,才是那些拥有大量产品名称词汇的团队往往早已构建好的工作流。移植词典是实打实的工作;而能够直接使用你已有产物的模型,则已经占得先机。
当 Eleven v4 就是更好的模型时
话虽如此,榜单确实能衡量一些东西,而 Eleven v4 两项都赢了。在 Provider Voice 上,它以 43 分的优势领先 Sonic 3.6,该估算背后有 1,674 个样本;而此前的旗舰——1,169 分的 ElevenLabs Eleven v3——则落后 Sonic 3.6 107 分,这意味着 ElevenLabs 在一代产品内缩小了真实差距,而不是在守住领先优势。
语言数量是第二个毫无争议的胜出项。90 多种对 44 种,差不多是两倍,而对于一款要发行到英语和少数几种欧洲语言之外的产品来说,这是覆盖范围的问题,而不是质量的问题——Sonic 3.6 对你的一些地区语言可能根本没有语音。此外,多说话人对话处理加上内联演绎指令,是实实在在的能力差异:把笑声写进脚本,是 Sonic 3.6 并未记录在案的工作流程;而在不具备该能力的模型上复现这种效果,意味着要做后期处理或重录一遍,其代价比 Elo 差距所暗示的更高。
运行其中任何一个,以及我们帮不上忙的部分
这两个模型 OrcaRouter 都不托管。ElevenLabs 和 Cartesia 都不在我们的目录里,所以本次对比中没有任何一项能通过我们调用;对于“怎么才能把它接到 OrcaRouter 上”,诚实的回答是:接不了——你得去找厂商。我们真正处理的,是语音技术栈最终横跨多个提供商、而非只依赖一家的情形:一把 API 密钥通用于 200 多个模型,提供商标价以 0% 加价原样透传,因此厂商调价一生效,当天就会在我们这边同步生效。当一项决策的关键就在于同样一个月的字符数你要付 110 美元还是 400 美元时,这个时间差可不是小事。
在语音路径面向客户且不能中断的场景下,当某个上游链路性能下降时,自动故障转移会将流量切换到健康的上游。正是这种模式,让为期两周的促销窗口值得加以利用:你可以把生产流量指向更便宜的模型两周,而无需重写集成,等费率恢复后再切回来。
谁应该切换,谁应该等待
如果你的产品要根据声音表现来评判,如果你要用超过二十多种语言发布,或者如果你的用户只能听到供应商为他们选定的语音,那就切换到 Eleven v4——最后一类正是 Provider Voice board 所代表的群体,而这一项上的差距是所有行中最大的。
如果你在延迟预算下运行实时对话,如果你的技术栈需要合规审查员签字认可,或者如果你有一个无法承受重建成本的发音词典,那就继续使用 Sonic 3.6。在这三行上,Sonic 并不落后;它是唯一有公开答案的选项。
等等,无论哪种情况,如果你的决定取决于价格。两周后,Eleven v4 的费率表会变动近四倍,而 Sonic 3.6 的不会,今天写下的对比到十月中旬读起来就会是错的。Elo 排序仍然成立。钱则不然。
