一张“ElevenLabs Eleven v4 对比 Cartesia Sonic 3.6”的主视觉卡片,配有两张评分卡:ElevenLabs Eleven v4 的 Elo 为 1,319,排名第 1,价格為每 100 万字符 80.00 美元;Cartesia Sonic 3.6 的 Elo 为 1,276,排名第 2,价格为每 100 万字符 49.00 美元;配文为“以 39% 更低的价格换来 43 个 Elo 分的差距”。页脚:“Provider Voice Arena,数据来自 Artificial Analysis,2026 年 9 月。”OrcaRouter 徽标位于右下角。
Guides & Insights

Eleven v4 对决 Cartesia Sonic 3.6:以 43 分的 Elo 差距,对抗便宜 39% 的语音

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

ElevenLabs Eleven v4在 Artificial Analysis 的 Provider Voice Arena 上比Cartesia Sonic 3.6高出 43 个 Elo 分——1319 对 1276——而且它同样赢下了 Controlled Voice 榜单,位列第二,而 Sonic 3.6 排名第四。但在价格上,它以相反的差距大幅落败:每百万字符 80.00 美元对 49.00 美元,而在发布窗口期内,按厂商自家价目表计算,其每字符费率约为后者的九倍。这是一场罕见的对决:记分板清清楚楚,决定却依旧难做,因为这两个模型实际上并不是在争夺同一份工作。

A two-column scoreboard for ElevenLabs Eleven v4 and Cartesia Sonic 3.6. Eleven v4: Provider Voice rank 1 Elo 1,319; Controlled Voice rank 2 Elo 1,157; $80.00 per 1M chars; $0.022 per 1K until Oct 12; 90-plus languages; latency not stated for v4. Sonic 3.6: Provider Voice rank 2 Elo 1,276; Controlled Voice rank 4 Elo 1,138; $49.00 per 1M chars; $0.049 per 1K; 44 languages; sub-90 ms. Footer: 'Elo and board prices per Artificial Analysis; rate cards and specs vendor-reported.'

每个模型分别是什么,各用一段话说明

ElevenLabs Eleven v4 于 9 月 28 日发布,是该公司的旗舰语音合成模型,与 Eleven v4 Turbo 一同推出。文档显示,它支持 90 多种语言,每次请求的输入上限为 10,000 个字符,具备说话人身份稳定的多说话人对话功能,改进了 IPA 音素支持,并提供内联指令,让你可以把表达方式直接写进脚本。语音克隆只需十秒音频即可实现即时克隆,在此之上还提供专业级方案。

Cartesia Sonic 3.6 是 Cartesia 旗下一个以速度和自然度为核心卖点的模型系列的最新版本。其自家产品页面称其为最快、最自然的文本转语音模型,声称延迟低于 90 毫秒,原生支持 44 种语言,可从十秒音频克隆声音,提供自定义发音词典,并具备涵盖 HIPAA、SOC 2 Type 2、GDPR 和 PCI 的合规认证。两家供应商都公布各自模型的延迟数据;这两组数据均未经过独立验证,且测量方式并不相同。

记分牌,逐维度拆解

• 盲选偏好,各厂商自有语音——Eleven v4 排名第 1,Elo 1,319,对比 Sonic 3.6 排名第 2,Elo 1,276。相差 43 分。

• 盲测偏好,匹配的克隆语音——Eleven v4 排名第 2,Elo 1,157,对比 Sonic 3.6 排名第 4,Elo 1,138。19 分的差距,比第一次更窄。

• Arena 价格标准化,按每百万字符计 — Eleven v4 $80.00 对比 Sonic 3.6 $49.00。在榜单的统一基准下,Sonic 便宜 39%。

• 供应商费率表,按每千字符计——Eleven v4 促销价 $0.022,10月12日后为 $0.08,对比 Sonic 3.6 的 $0.049。促销结束后,Sonic 便宜 39%。

• 语言覆盖范围,以厂商文档为准 — Eleven v4 支持 90 多种,Sonic 3.6 支持 44 种。大约是其两倍。

• 每次请求的输入上限 — Eleven v4 为 10,000 个字符,而 Sonic 3.6 未在其产品页面上说明。

• 延迟(厂商自述)——Eleven v4 Turbo 到首次发声的中位延迟约为 150 毫秒,而 Sonic 3.6 低于 90 毫秒。不过,两者的测试条件同样并不相同。

• 语音克隆 — 两者均只需十秒的音频,且均具备更高的专业档位。

• 枚举控制 — Eleven v4 记录了 IPA 音素输入和专业克隆层级;Sonic 3.6 记录了自定义发音词典。

• 合规状况 — Sonic 3.6 声明符合 HIPAA、SOC 2 Type 2、GDPR 和 PCI。ElevenLabs 将其合规信息与模型页面分开声明,并且没有在 v4 旁提供一份对应的清单。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing ElevenLabs Eleven v4 first at Elo 1,319 with $80.0 per 1M chars, Cartesia Sonic 3.6 second at Elo 1,276 with $49.0, and Google Gemini 3.8 Flash TTS third at Elo 1,267 with $16.5, each with its sample count, confidence interval, arena voice count and release month.

其中两行才是决定真实项目的关键。在厂商音色榜上,Elo 差距为 43 分,在克隆音色榜上为 19 分——当说话人保持不变时,Sonic 的差距缩小了一半以上。这正是那种调校有竞争力、但默认音色阵容没有竞争力的模型的典型特征,也说明 Sonic 在这场对决中的问题在于呈现,而不是合成质量。

为什么价格差距比看起来更小

标题费率对比在两个方面都具有误导性。Eleven v4 的每千字符 $0.022 是促销价,到期日为 10 月 12 日;窗口期过后仍然有效的是 $0.08,这比 Sonic 3.6 的费率卡高出 60% 以上。但 arena 归一化并不关心促销:它按模型的标价来计算,得出 $80.00 对 $49.00,这一对比到 11 月仍然成立。

还有第二个问题。Cartesia 并未在其产品页面上公布按字符计费的价格,因此 $0.049 这个数字来自竞技场的归一化处理,而非来自厂商,这两个计量口径也可能并不完全吻合——归一化会对提供商的计费方式做出假设。请把排序结果视为可靠,而把具体的百分比视为近似值。

按五百万字符计算的一个工作月:Eleven v4 按促销费率收费 110 美元,10 月 12 日之后为 400 美元。Sonic 3.6 收费 245 美元。因此,在接下来的两周内,Eleven v4 的成本不到 Sonic 的一半,而在那之后则高出 63%。任何今天撰写采购对比、下个月才交付的人,如果不说明自己使用的是哪个费率,就会把这一点弄反。

Sonic 3.6 是正确答案的那个片段

有些生产环境的语音工作负载,其真正重要的指标并不在竞技场榜单的衡量范围内,而 Sonic 3.6 正是为它们打造的。

实时对话式智能体是最明显的情形。低于 90 毫秒的延迟在电话代理中不是营销数字;它决定的是一次打断让人感觉被妥善处理,还是像通话掉线。ElevenLabs 并未公布 Eleven v4 本身的同类指标——只公布了 Turbo 层级首次发声的中位延迟约为 150 毫秒。如果你的代理的套接字预算很紧张,这 43 个 Elo 分对你来说可能不如这些毫秒有价值,而你自己进行的打断测试会比任何榜单更快地解决这个问题。

受监管部署是第二项。Cartesia 在产品页面上标明了 HIPAA、SOC 2 Type 2、GDPR 和 PCI。一份合规清单并不是一个 Elo 分数,也无法被后者所替代;如果医疗或支付领域的审核方在你的发布流程中,那么记分板上的这一行比其余九行都更重要。

A screenshot of Cartesia's Sonic product page, captured in English, headed 'Sonic: The fastest and most natural text to speech model' with the claim 'Ranked #1 for naturalness, sub-90ms latency, and natively multilingual across 44 languages', a 'Try Sonic-3.6' button, an 'American English / Jacqueline' voice picker over a support-call sample, a 'Ranked #1 in Speech Arena leaderboard & Speech to Text leaderboard by Artificial Analysis' panel, and a 'Built for Voice Agents' tab strip spanning Naturalness, Reliability, Speed, Scalability, Multilingual, Consistency and Cost.

确定性发音是第三项,而且更为微妙。Eleven v4 文档记录的 IPA 音素输入是一项优势,但 Sonic 3.6 的自定义发音词典,才是那些拥有大量产品名称词汇的团队往往早已构建好的工作流。移植词典是实打实的工作;而能够直接使用你已有产物的模型,则已经占得先机。

当 Eleven v4 就是更好的模型时

话虽如此,榜单确实能衡量一些东西,而 Eleven v4 两项都赢了。在 Provider Voice 上,它以 43 分的优势领先 Sonic 3.6,该估算背后有 1,674 个样本;而此前的旗舰——1,169 分的 ElevenLabs Eleven v3——则落后 Sonic 3.6 107 分,这意味着 ElevenLabs 在一代产品内缩小了真实差距,而不是在守住领先优势。

语言数量是第二个毫无争议的胜出项。90 多种对 44 种,差不多是两倍,而对于一款要发行到英语和少数几种欧洲语言之外的产品来说,这是覆盖范围的问题,而不是质量的问题——Sonic 3.6 对你的一些地区语言可能根本没有语音。此外,多说话人对话处理加上内联演绎指令,是实实在在的能力差异:把笑声写进脚本,是 Sonic 3.6 并未记录在案的工作流程;而在不具备该能力的模型上复现这种效果,意味着要做后期处理或重录一遍,其代价比 Elo 差距所暗示的更高。

运行其中任何一个,以及我们帮不上忙的部分

这两个模型 OrcaRouter 都不托管。ElevenLabs 和 Cartesia 都不在我们的目录里,所以本次对比中没有任何一项能通过我们调用;对于“怎么才能把它接到 OrcaRouter 上”,诚实的回答是:接不了——你得去找厂商。我们真正处理的,是语音技术栈最终横跨多个提供商、而非只依赖一家的情形:一把 API 密钥通用于 200 多个模型,提供商标价以 0% 加价原样透传,因此厂商调价一生效,当天就会在我们这边同步生效。当一项决策的关键就在于同样一个月的字符数你要付 110 美元还是 400 美元时,这个时间差可不是小事。

在语音路径面向客户且不能中断的场景下,当某个上游链路性能下降时,自动故障转移会将流量切换到健康的上游。正是这种模式,让为期两周的促销窗口值得加以利用:你可以把生产流量指向更便宜的模型两周,而无需重写集成,等费率恢复后再切回来。

谁应该切换,谁应该等待

如果你的产品要根据声音表现来评判,如果你要用超过二十多种语言发布,或者如果你的用户只能听到供应商为他们选定的语音,那就切换到 Eleven v4——最后一类正是 Provider Voice board 所代表的群体,而这一项上的差距是所有行中最大的。

如果你在延迟预算下运行实时对话,如果你的技术栈需要合规审查员签字认可,或者如果你有一个无法承受重建成本的发音词典,那就继续使用 Sonic 3.6。在这三行上,Sonic 并不落后;它是唯一有公开答案的选项。

等等,无论哪种情况,如果你的决定取决于价格。两周后,Eleven v4 的费率表会变动近四倍,而 Sonic 3.6 的不会,今天写下的对比到十月中旬读起来就会是错的。Elo 排序仍然成立。钱则不然。