一张主视觉卡片,主题为“Eleven v4 登顶语音竞技场”:排行榜中 ElevenLabs Eleven v4 位列第 1、Elo 1,319,Cartesia Sonic 3.6 位列第 2、Elo 1,276,Google Gemini 3.8 Flash TTS 位列第 3、Elo 1,267,ElevenLabs Eleven v3 位列第 18、Elo 1,169,另有一条绶带写着“截至 10 月 12 日享 72% 折扣”。页脚:“Provider Voice Arena,数据来自 Artificial Analysis,2026 年 9 月。”OrcaRouter 标志位于右下角。
Guides & Insights

Eleven v4 登顶 Voice Arena:ElevenLabs 的新旗舰究竟赢得了什么

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

ElevenLabs Eleven v4于9月28日发布,随即以1,319的Elo评分直接登顶Artificial Analysis的Provider Voice Arena——以43分优势领先Cartesia Sonic 3.6(1,276分),并领先Google Gemini 3.8 Flash TTS(1,267分)52分。同样在那一榜单上,它以每百万字符80.00美元的价格成为前十名中最贵的模型。而在第二个竞技场——那个基于克隆声音而非各厂商自有声音集构建的榜单——它根本没有获胜:它排名第二,落后于一个价格仅为其四分之一的模型。这两点都属实,而这次发布真正有价值之处,在于弄清你的用例究竟属于哪一种情况。

9月28日到底发布了什么?

ElevenLabs 一次让两个模型进入正式可用阶段,而不是一个。ElevenLabs Eleven v4是旗舰合成模型——公司称其为最具情感表现力的模型,其文档将单次请求的输入上限设为 10,000 个字符,语言覆盖超过 90 种。ElevenLabs Eleven v4 Turbo则是低延迟的兄弟型号:同样支持 90 多种语言,10,000 字符上限,并支持内联音频标签,让你能把表达方式直接写进脚本里——一声大笑、一句耳语、电话线里的嗡嗡声。两者在发布首日便已上线于公司的智能体、创意和 API 各产品线,这比 v3 那一代的铺开速度更快。

公告页面是功能列表所在之处,值得注意的是,定价并不在其中。ElevenLabs 描述了一种新架构、对语气、节奏和角色表现的更好处理、更可靠且说话人身份稳定的多说话人对话、改进的 IPA 音素输入,以及基于十秒音频构建的即时声音克隆,与现有的专业克隆层级并存。页面上唯一的一个数字是关于听众的说法:厂商称在盲测对比中,约四分之三的情况下更偏好 v4。那是厂商提供的数据,未经复现,应将其与下方的排行榜数字并列来看,而不是取而代之。

定价的实际所在——API 定价页面——才是更有分量的文件,下文会进一步说明。简而言之:这次发布不是涨价。

两个董事会,两种不同的答案

Artificial Analysis 运营着两个语音竞技场,它们并非彼此的变体。Provider Voice 让听众比较各供应商自己的声音。Controlled Voice 则为每一位参赛者克隆同样的八个声音——四个美式、四个英式——从而让说话人保持不变,只有模型发生变化。一个拥有出色默认音色阵容的模型可以赢下前者,却输掉后者。Eleven v4 正是如此。

• Provider Voice,Eleven v4 — 排名第 1,Elo 1,319,每百万字符 80.00 美元,1,674 个样本,八个竞技场语音,2026 年 9 月

• Provider Voice,Cartesia Sonic 3.6 — 排名第 2,Elo 1,276,49.00 美元

• 提供商语音,Google Gemini 3.8 Flash TTS — 排名第 3,Elo 1,267,$16.50

• 提供商 Voice,上一代 ElevenLabs Eleven v3 — 排名第 18,Elo 1,169,100.00 美元

• 受控语音,Alibaba Qwen-Audio-3.1-TTS-Plus — 排名第 1,Elo 1,178

• Controlled Voice、Eleven v4 — 排名第 2,Elo 1,157,$80.00

• 可控语音,Cartesia Sonic 3.6 — 排名第 4,Elo 1,138

• 可控语音,ElevenLabs Eleven v3 — 第 7 名,Elo 1,073

• 可控语音,Google Gemini 3.8 Flash TTS — 第 13 名,Elo 1,048

• Provider Voice 上最佳的开放权重条目 — Breeze TTS 2,Elo 1,206,$34.00

A single-column scoreboard card for ElevenLabs Eleven v4 with six rows: 'Provider Voice rank: 1 (Elo 1,319)', 'Controlled Voice rank: 2 (Elo 1,157)', 'Board price: $80.00 per 1M characters', 'Rate card: $0.022 per 1K characters until Oct 12', 'Languages and cap: 90-plus, 10,000 characters', 'Latency: not stated for v4 itself'. Footer: 'Elo and board prices per Artificial Analysis; rate card and specs vendor-documented.'

对于已经在使用 ElevenLabs 的用户来说,代际跃升是最引人注目的消息:在同一榜单上与其前代相比,Eleven v4 在 Provider Voice 下提升了 150 Elo 分,在 Controlled Voice 下提升了 84 分。这是一次代际跨越,而非一次调参,而且在由供应商选择声音的榜单上提升更大——诚实地说,这意味着其新的默认声音阵容确实是增益中实实在在的一部分。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing ElevenLabs Eleven v4 first at Elo 1,319 with $80.0 per 1M chars, 1,674 samples and a -19/19 confidence interval, Cartesia Sonic 3.6 second at Elo 1,276 and $49.0, Google Gemini 3.8 Flash TTS third at Elo 1,267 and $16.5, and ElevenLabs Eleven v3 eighteenth at Elo 1,169 and $100.0, under columns for samples, arena voices, release month and API pricing.

我们无法用数字衡量的发音板

Artificial Analysis 确实设有一个发音稳健性板块,值得好好说明一下,因为流传的排名摘要称 Eleven v4 位居榜首。该榜单衡量的是被高亮标注的文本片段中,评审员判定发音正确的比例,每个音频片段最多由三名评审员评判,并且提示词完全按原文原样发送——不做数字扩展,也不做文本规范化。它被划分为多个子类别,而这种设计的意义在于:如果模型在开口前悄悄改写“Dr.”或“$4.50”,就会被有意打低分。

榜单没有公布、而在我们能读到的呈现中也没有的,是每个模型可引用的数字分数。所以那里没有可供引用 Eleven v4 的数字,而 1,319 的 Elo 属于竞技场偏好——即听众对声音的喜爱程度——而不是发音准确度。如果你看到这两者被混为一谈,那就是混淆所在。本次发布中站得住脚的说法,是那个附带数字的说法:在 Provider Voice 上以 1,319 排名第一,在 Controlled Voice 上以 1,157 排名第二。

真正的重头戏是上线折扣,能帮你省下账单。

ElevenLabs在新模型发布的同时进行了重新定价,而折扣力度之大,足以单独改变购买决策。在API定价页面上,Eleven v4标价为每千字符{{1}}0.022{{/1}}美元,而标明的原价为{{2}}0.08{{/2}}美元——降幅达{{3}}72%{{/3}}——Eleven v4 Turbo标价为{{4}}0.011{{/4}}美元,原价为{{5}}0.04{{/5}}美元。两者适用同一时间窗口:促销持续至{{6}}10月12日{{/6}}。此后价格将恢复,而恢复后的v4价格是ElevenLabs自家v3当前{{7}}0.08{{/7}}美元价格的两倍。请按促销后的价格做规划,而不是促销价。

此次重新定价还按字符计算改变了 v4 相对于同行的定位,而 arena 标准化已经显示为每百万 80.00 美元。Sonic 3.6 在那里是 49.00 美元,Breeze TTS 2 是 34.00 美元,Qwen-Audio-3.0-TTS-Plus 是 19.30 美元,Gemini 3.8 Flash TTS 是 16.50 美元。按促销价,Eleven v4 每百万 22 美元,直接低于 Sonic 3.6。按标价,它是榜单上价格最高的语音,且高出其他一大截。任何为 Q1 编制预算的人都应该看第二个数字。

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v4 row at $0.022 per 1K characters with a struck-through $0.08 and a '72% off until Oct 12' badge, and the Eleven v4 Turbo row at $0.011 with a struck-through $0.04, alongside the v3 row at $0.08 and the Eleven v3 Conversational row at $0.04.

用一个实打实的月度算例,这个差距就变得具体了。以五百万字符为例——相当于一个中型产品大约一百小时的语音朗读量——窗口期内的 Eleven v4 花费 110 美元。按回调后的 0.08 美元价位,费用是 400 美元。Sonic 3.6 是 245 美元。Gemini 3.8 Flash TTS 是 82.50 美元。同样这一个月,用 ElevenLabs 自家的 v3 也是 400 美元;这正是这次发布背后那个古怪的事实:接下来两周,新旗舰比它取代的模型更便宜,而窗口关闭那天,它不再更便宜,只是变得更好。

延迟声明由厂商提供,并因层级而异。

ElevenLabs 公布的是按档位划分的延迟数据,而不是按模型系列划分的;而且这些数据是公司自己测量的,并非任何独立测量。Eleven v4 Turbo 标称推理时间中位数约为 100 毫秒,首次语音输出时间中位数约为 150 毫秒,测量于 2026 年 9 月。Eleven v3 Conversational 标称约为 280 毫秒,较旧的 Flash 和 Turbo 档位约为 75 毫秒。文档没有为 Eleven v4 本身公布同等数据,而如果你正在构建实时智能体,并且是在看规格表而不是进行测试,那么你想要的正是这个档位。

Cartesia 声称 Sonic 的延迟低于 90 毫秒,并将其描述为自然度排名第一,支持从十秒音频进行语音克隆、自定义发音词典,以及涵盖 HIPAA、SOC 2 Type 2、GDPR 和 PCI 的合规套件。这些都是供应商在自家产品页面上的自述——与 ElevenLabs 的延迟档位数字属于同一类证据,不能与竞技场 Elo 相提并论。两家供应商真正可直接比较的地方,仅在于榜单上。

这意味着什么,以及如何尝试

如果你在为某个产品挑选声音,而该产品的默认声音阵容就是用户会听到的内容,那么 Provider Voice 结果才是关键,而 Eleven v4 刚刚拿下它,并附带两周折扣。如果你在克隆某个特定人物的声音,并且每个候选模型都被要求复现同样的八位说话人,那么 Controlled Voice 榜单才是关键,而 Eleven v4 排名第二——落后领先者 21 Elo,且按标价计算,每字符成本是领先者的四倍多。这两种结果都没有错;它们回答的是不同的问题,而第二个才是大多数生产级语音克隆工作实际在问的问题。

OrcaRouter 并不托管 ElevenLabs、Cartesia 或这些榜单上的其他任何供应商,所以这里没有任何东西需要经由我们来调用,我们也不会暗示并非如此。我们提供的是周边的管道设施,以防你的语音技术栈最终横跨多家供应商:一个 API 密钥即可调用 200 多个模型,供应商标价以 0% 加价原样透传,因此供应商一旦降价——包括像这样的促销窗口——在我们这边当天就会生效,而不必等到下一个账单周期。当某条语音链路对生产至关重要时,自动故障转移会在某个上游降级时切换到健康的上游,这是在不拿一次发布去冒险的前提下测试全新端点的实用方式。

需要记入日程的日期是10月12日。到那时,Eleven v4 将不再是榜单上最便宜的优质语音,而会成为最贵的那个;本周写下的任何比较,只要引用了每百万22美元却没有说明这一点,都是你应该在三周后重新跑一遍的比较。