
Eleven v4 登顶 Voice Arena:ElevenLabs 的新旗舰究竟赢得了什么
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 983 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 196 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
ElevenLabs Eleven v4于9月28日发布,随即以1,319的Elo评分直接登顶Artificial Analysis的Provider Voice Arena——以43分优势领先Cartesia Sonic 3.6(1,276分),并领先Google Gemini 3.8 Flash TTS(1,267分)52分。同样在那一榜单上,它以每百万字符80.00美元的价格成为前十名中最贵的模型。而在第二个竞技场——那个基于克隆声音而非各厂商自有声音集构建的榜单——它根本没有获胜:它排名第二,落后于一个价格仅为其四分之一的模型。这两点都属实,而这次发布真正有价值之处,在于弄清你的用例究竟属于哪一种情况。
9月28日到底发布了什么?
ElevenLabs 一次让两个模型进入正式可用阶段,而不是一个。ElevenLabs Eleven v4是旗舰合成模型——公司称其为最具情感表现力的模型,其文档将单次请求的输入上限设为 10,000 个字符,语言覆盖超过 90 种。ElevenLabs Eleven v4 Turbo则是低延迟的兄弟型号:同样支持 90 多种语言,10,000 字符上限,并支持内联音频标签,让你能把表达方式直接写进脚本里——一声大笑、一句耳语、电话线里的嗡嗡声。两者在发布首日便已上线于公司的智能体、创意和 API 各产品线,这比 v3 那一代的铺开速度更快。
公告页面是功能列表所在之处,值得注意的是,定价并不在其中。ElevenLabs 描述了一种新架构、对语气、节奏和角色表现的更好处理、更可靠且说话人身份稳定的多说话人对话、改进的 IPA 音素输入,以及基于十秒音频构建的即时声音克隆,与现有的专业克隆层级并存。页面上唯一的一个数字是关于听众的说法:厂商称在盲测对比中,约四分之三的情况下更偏好 v4。那是厂商提供的数据,未经复现,应将其与下方的排行榜数字并列来看,而不是取而代之。
定价的实际所在——API 定价页面——才是更有分量的文件,下文会进一步说明。简而言之:这次发布不是涨价。
两个董事会,两种不同的答案
Artificial Analysis 运营着两个语音竞技场,它们并非彼此的变体。Provider Voice 让听众比较各供应商自己的声音。Controlled Voice 则为每一位参赛者克隆同样的八个声音——四个美式、四个英式——从而让说话人保持不变,只有模型发生变化。一个拥有出色默认音色阵容的模型可以赢下前者,却输掉后者。Eleven v4 正是如此。
• Provider Voice,Eleven v4 — 排名第 1,Elo 1,319,每百万字符 80.00 美元,1,674 个样本,八个竞技场语音,2026 年 9 月
• Provider Voice,Cartesia Sonic 3.6 — 排名第 2,Elo 1,276,49.00 美元
• 提供商语音,Google Gemini 3.8 Flash TTS — 排名第 3,Elo 1,267,$16.50
• 提供商 Voice,上一代 ElevenLabs Eleven v3 — 排名第 18,Elo 1,169,100.00 美元
• 受控语音,Alibaba Qwen-Audio-3.1-TTS-Plus — 排名第 1,Elo 1,178
• Controlled Voice、Eleven v4 — 排名第 2,Elo 1,157,$80.00
• 可控语音,Cartesia Sonic 3.6 — 排名第 4,Elo 1,138
• 可控语音,ElevenLabs Eleven v3 — 第 7 名,Elo 1,073
• 可控语音,Google Gemini 3.8 Flash TTS — 第 13 名,Elo 1,048
• Provider Voice 上最佳的开放权重条目 — Breeze TTS 2,Elo 1,206,$34.00

对于已经在使用 ElevenLabs 的用户来说,代际跃升是最引人注目的消息:在同一榜单上与其前代相比,Eleven v4 在 Provider Voice 下提升了 150 Elo 分,在 Controlled Voice 下提升了 84 分。这是一次代际跨越,而非一次调参,而且在由供应商选择声音的榜单上提升更大——诚实地说,这意味着其新的默认声音阵容确实是增益中实实在在的一部分。

我们无法用数字衡量的发音板
Artificial Analysis 确实设有一个发音稳健性板块,值得好好说明一下,因为流传的排名摘要称 Eleven v4 位居榜首。该榜单衡量的是被高亮标注的文本片段中,评审员判定发音正确的比例,每个音频片段最多由三名评审员评判,并且提示词完全按原文原样发送——不做数字扩展,也不做文本规范化。它被划分为多个子类别,而这种设计的意义在于:如果模型在开口前悄悄改写“Dr.”或“$4.50”,就会被有意打低分。
榜单没有公布、而在我们能读到的呈现中也没有的,是每个模型可引用的数字分数。所以那里没有可供引用 Eleven v4 的数字,而 1,319 的 Elo 属于竞技场偏好——即听众对声音的喜爱程度——而不是发音准确度。如果你看到这两者被混为一谈,那就是混淆所在。本次发布中站得住脚的说法,是那个附带数字的说法:在 Provider Voice 上以 1,319 排名第一,在 Controlled Voice 上以 1,157 排名第二。
真正的重头戏是上线折扣,能帮你省下账单。
ElevenLabs在新模型发布的同时进行了重新定价,而折扣力度之大,足以单独改变购买决策。在API定价页面上,Eleven v4标价为每千字符{{1}}0.022{{/1}}美元,而标明的原价为{{2}}0.08{{/2}}美元——降幅达{{3}}72%{{/3}}——Eleven v4 Turbo标价为{{4}}0.011{{/4}}美元,原价为{{5}}0.04{{/5}}美元。两者适用同一时间窗口:促销持续至{{6}}10月12日{{/6}}。此后价格将恢复,而恢复后的v4价格是ElevenLabs自家v3当前{{7}}0.08{{/7}}美元价格的两倍。请按促销后的价格做规划,而不是促销价。
此次重新定价还按字符计算改变了 v4 相对于同行的定位,而 arena 标准化已经显示为每百万 80.00 美元。Sonic 3.6 在那里是 49.00 美元,Breeze TTS 2 是 34.00 美元,Qwen-Audio-3.0-TTS-Plus 是 19.30 美元,Gemini 3.8 Flash TTS 是 16.50 美元。按促销价,Eleven v4 每百万 22 美元,直接低于 Sonic 3.6。按标价,它是榜单上价格最高的语音,且高出其他一大截。任何为 Q1 编制预算的人都应该看第二个数字。

用一个实打实的月度算例,这个差距就变得具体了。以五百万字符为例——相当于一个中型产品大约一百小时的语音朗读量——窗口期内的 Eleven v4 花费 110 美元。按回调后的 0.08 美元价位,费用是 400 美元。Sonic 3.6 是 245 美元。Gemini 3.8 Flash TTS 是 82.50 美元。同样这一个月,用 ElevenLabs 自家的 v3 也是 400 美元;这正是这次发布背后那个古怪的事实:接下来两周,新旗舰比它取代的模型更便宜,而窗口关闭那天,它不再更便宜,只是变得更好。
延迟声明由厂商提供,并因层级而异。
ElevenLabs 公布的是按档位划分的延迟数据,而不是按模型系列划分的;而且这些数据是公司自己测量的,并非任何独立测量。Eleven v4 Turbo 标称推理时间中位数约为 100 毫秒,首次语音输出时间中位数约为 150 毫秒,测量于 2026 年 9 月。Eleven v3 Conversational 标称约为 280 毫秒,较旧的 Flash 和 Turbo 档位约为 75 毫秒。文档没有为 Eleven v4 本身公布同等数据,而如果你正在构建实时智能体,并且是在看规格表而不是进行测试,那么你想要的正是这个档位。
Cartesia 声称 Sonic 的延迟低于 90 毫秒,并将其描述为自然度排名第一,支持从十秒音频进行语音克隆、自定义发音词典,以及涵盖 HIPAA、SOC 2 Type 2、GDPR 和 PCI 的合规套件。这些都是供应商在自家产品页面上的自述——与 ElevenLabs 的延迟档位数字属于同一类证据,不能与竞技场 Elo 相提并论。两家供应商真正可直接比较的地方,仅在于榜单上。
这意味着什么,以及如何尝试
如果你在为某个产品挑选声音,而该产品的默认声音阵容就是用户会听到的内容,那么 Provider Voice 结果才是关键,而 Eleven v4 刚刚拿下它,并附带两周折扣。如果你在克隆某个特定人物的声音,并且每个候选模型都被要求复现同样的八位说话人,那么 Controlled Voice 榜单才是关键,而 Eleven v4 排名第二——落后领先者 21 Elo,且按标价计算,每字符成本是领先者的四倍多。这两种结果都没有错;它们回答的是不同的问题,而第二个才是大多数生产级语音克隆工作实际在问的问题。
OrcaRouter 并不托管 ElevenLabs、Cartesia 或这些榜单上的其他任何供应商,所以这里没有任何东西需要经由我们来调用,我们也不会暗示并非如此。我们提供的是周边的管道设施,以防你的语音技术栈最终横跨多家供应商:一个 API 密钥即可调用 200 多个模型,供应商标价以 0% 加价原样透传,因此供应商一旦降价——包括像这样的促销窗口——在我们这边当天就会生效,而不必等到下一个账单周期。当某条语音链路对生产至关重要时,自动故障转移会在某个上游降级时切换到健康的上游,这是在不拿一次发布去冒险的前提下测试全新端点的实用方式。
需要记入日程的日期是10月12日。到那时,Eleven v4 将不再是榜单上最便宜的优质语音,而会成为最贵的那个;本周写下的任何比较,只要引用了每百万22美元却没有说明这一点,都是你应该在三周后重新跑一遍的比较。
