一张用于“ElevenLabs Eleven v4 vs ElevenLabs Eleven v3”的主视觉卡片,包含两张堆叠卡片:ElevenLabs Eleven v4 的 Elo 为 1,319,排名第 1,价格为每 100 万字符 $80.00;ElevenLabs Eleven v3 的 Elo 为 1,169,排名第 18,价格为每 100 万字符 $100.00;配文为“相同的价目表,Elo 相差 150”。页脚:“Provider Voice Arena,依据 Artificial Analysis,2026 年 9 月。”OrcaRouter 标志位于右下角。
Guides & Insights

Eleven v4 与 ElevenLabs 其他产品的对比:你应该从 Eleven v3 迁移吗?

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

如果你已经在用ElevenLabs Eleven v3,那么答案是:凡是听众能听到的,都是肯定的;而 ElevenLabs 保持不变的这两件事,则都是否定的。ElevenLabs Eleven v4ElevenLabs Eleven v4 在 Artificial Analysis 的 Provider Voice Arena 上比前代高出 200 Elo 分——1,319 分对 1,235 分——并在 Controlled Voice 榜单上高出 84 分,该榜单上两者使用的是同样的八个声音。它的字符上限是 v3 的两倍,支持的语言数量也大约是 v3 的两倍。它不改变的是你的合同、你的声音克隆,以及你所对应计费的层级结构,因此这次迁移比大多数迁移都更省钱,但仍然值得分阶段进行,而不是一次性全部切换。

A two-column scoreboard for ElevenLabs Eleven v4 and ElevenLabs Eleven v3. Eleven v4: Provider Voice rank 1 Elo 1,319; Controlled Voice rank 2 Elo 1,157; $80.00 per 1M chars; $0.022 per 1K until Oct 12; 10,000-character cap; 90-plus languages. Eleven v3: Provider Voice rank 18 Elo 1,169; Controlled Voice rank 7 Elo 1,073; $100.00 per 1M chars; $0.08 per 1K; 5,000-character cap; 70-plus languages. Footer: 'Elo and board prices per Artificial Analysis; rate card and caps vendor-documented.'

家庭内部的记分板

这不是厂商之间的对比,因此竞技场排行榜上的价格归一化处理与通常情况不同:两个模型都按字符计费,使用同一份价目表,来自同一个账户。下面列出的优势与不足,是相对于同门模型而非竞争对手来衡量的。

• 提供商语音竞技场 — ElevenLabs Eleven v4 排名第 1,Elo 1,319,对比 ElevenLabs Eleven v3 排名第 18,Elo 1,169。相差 150 分。

Controlled Voice Arena,匹配的克隆语音——Eleven v4 排名第 2,Elo 1,157,相较 Eleven v3 排名第 7,Elo 1,073。相差 84 分。

• Arena 价格标准化 —— Eleven v4 每百万字符 $80.00,对比 Eleven v3 的 $100.00。新旗舰是榜单上两者中更便宜的那个。

• 供应商价目表 — Eleven v4 每千字符 $0.022(促销价),10月12日后 $0.08;Eleven v3 $0.08。标价相同,活动期间半价。

• 每次请求的输入上限 — Eleven v4 为 10,000 个字符,而 Eleven v3 为 5,000 个。正好是两倍。

• 语言覆盖范围 — Eleven v4 支持 90 多种,Eleven v3 支持 70 多种。

• 交付指令 — Eleven v4 在其文档中说明了内联音频标签和 IPA 音素输入;Eleven v3 的模型页面则对两者均未记录。

• 延迟,厂商声明——Eleven v3 Conversational 约为 280 毫秒;Eleven v4 Turbo 首次发声的中位数约为 150 毫秒。不同层级,不同测试。

• 声音克隆——保持不变。现有的即时克隆和专业克隆均予以保留。

• 套餐层级 — 保持不变。Free 10,000 字符,Starter $6,Creator $22,Pro $99,Scale $299,Business $990。

• 迁移路径 — Eleven v4 和 Eleven v4 Turbo 均已在 API、智能体和创意界面中上线;旧的 Turbo 标识符已被弃用。

把价格那一行读两遍。这次发布不同寻常的地方在于:新模型比它所取代的旧模型更便宜——同一张价目表、按标价、不叠加任何促销——每百万 80 美元对 100 美元。促销价只是把这一差距拉得更大,而不是造就了它。一次能提升 150 Elo 质量、同时降低每字符成本的迁移,并不是多数团队预期会做的取舍。

迁移清单,按重要程度排列

先迁移音频质量路径,因为收益就在那里,而且一旦出现回归,你的用户会比你更早察觉。

• 试听你实际交付的那些声音。Provider Voice 是对一个竞技场声音集取的平均值;你的品牌声音并不在其中。150 分的差距是进行试听的理由,而不是试听的替代品,而克隆声音排行榜上的 84 分差距,才是对基于克隆的产品会带来何种感受更接近的估计。

• 重新检查你的字符预算。10,000 字符的上限是 v3 的两倍,因此你之前拆分的脚本现在可能可以容纳在一个请求中。这会改变请求次数、重试逻辑以及拼接输出的接缝质量——而且这是最有可能破坏假定上限为 5,000 的代码的更改。

• 测试接缝。ElevenLabs 明确说明 v4 在请求拼接方面更加可靠。如果你在 v3 上曾对长文本内容进行拆分,请将相同内容通过 v4 一次性重新运行并对比,而不是想当然地认为仍然需要拆分。

• 在新的音素支持下重新测试你的发音用例。为 v3 构建的词典应当重新验证,而不是直接采信;IPA 处理的改进可能意味着,原本正确的覆盖项如今会与模型自身的猜测产生不同的交互。

• 不要动你的克隆音色库。克隆音色会保留下来;无需重新上传,而重新克隆还有可能丢失用户已经熟悉的音色。

• 暂时,请在你目前使用 v3 Conversational 的地方继续保留它。它属于对话层级,而不是合成模型;其文档仍标注约为 280 毫秒,并且没有已发布的 v4 对等版本。如果你的智能体依赖它,v4 并不是该位置的同等替代品——v4 Turbo 是 v4 中延迟更低的标签,其延迟档位的标称方式也不同。

A screenshot of ElevenLabs' model documentation, captured in English, listing the text-to-speech cards: Eleven v4 with exceptional voice cloning, 90+ languages supported, a 10,000 character limit and support for natural multi-speaker dialogue; Eleven v4 Turbo with ultra-low latency near 100 ms median inference and audio tags for fine-grained control; Eleven v3 with 70+ languages and a 5,000 character limit; and Eleven v3 Conversational, Eleven Multilingual v2 and Eleven Flash v2.5 below them.

实际上什么会变得更好,而什么不会

这些提升集中在三个方面。情感范围与节奏感是第一项——这正是 Provider Voice 榜单所衡量的内容,也是厂商自家公告所强调的重点,同时公告还声称在盲测对比中,约四分之三的案例更偏好 v4。这个数字应视为厂商自述且未经复现;竞技场榜单是同一叙事中独立的那一半,而两者在方向上是一致的。

A screenshot of the Artificial Analysis Controlled Voice Arena leaderboard, captured in English, showing Alibaba Qwen-Audio-3.1-TTS-Plus first at Elo 1,178, ElevenLabs Eleven v4 second at Elo 1,157, Cartesia Sonic 3.6 fourth at Elo 1,138 and ElevenLabs Eleven v3 seventh at Elo 1,073 on the board where the same eight cloned voices are used for every entrant.

具备稳定说话人身份的多说话人对话是第二项。如果你已经在 v3 上交付了双人内容,并花力气修复长篇脚本中的说话人串扰或漂移,那么这是一种改进属于结构性而非表面性的工作负载,而 Elo 数值只能部分反映这一点。

内联交付指令是第三种——把一声叹息或一句低语直接写进脚本里。在 v3 上,那意味着要再录一遍、额外加一段上游提示词,或者做后期处理。而在 v4 Turbo 上,它不过是你已经写好的文本里的一行字。

没有变得更好的是团队常常以为会随着新旗舰而改善的那一部分:延迟。ElevenLabs 没有公布 Eleven v4 本身的延迟数据,只公布了 v4 Turbo 的数据:2026 年 9 月测得的中位推理时间约为 100 毫秒,中位首次语音时间约为 150 毫秒。Eleven v3 的对话层级据称约为 280 毫秒,但那是承担不同任务的不同层级。如果你的架构围绕硬性延迟预算构建,那么诚实的立场是:候选方案是 v4 Turbo,而你应该自行测量,因为层级名称并不能清晰对应,厂商给出的数字也并非同一口径。

两周窗口期,以及之后会发生什么

促销定价持续至10月12日。在此之前,Eleven v4 为每千字符 $0.022,Eleven v4 Turbo 为 $0.011,而公布的标价分别为 $0.08 和 $0.04。优惠期结束后,v4 将恢复到与 v3 当前价格完全相同的水平——$0.08——而 v4 Turbo 将恢复到 v3 费率的一半。

按五百万字符计算的一个完整月度示例:v3 费用为 400 美元。v4 在优惠窗口期内费用为 110 美元,之后又恢复到 400 美元。v4 Turbo 在窗口期内费用为 55 美元,之后为 200 美元。因此,值得关注的迁移可以说是转向 Turbo,因为在这份价目表上,它是促销结束后唯一仍比 v3 便宜的选项,而 v3 所缺少的音频标签支持也正存在于它那里。

务实的做法是趁价格还算额外收益时现在就把质量工作做好,并根据10月12日之后的数字来做定价决定。任何引用 Eleven v4 每百万 22 美元却不附截止日期的比较,都是在描述一个将在两周后失效的费率。

分阶段推进切换,而不把发布押注于此

OrcaRouter 并不托管 ElevenLabs,所以这次迁移中没有什么是我们能替你搬移的——变更发生在你的 ElevenLabs 账户上。我们真正负责的,是围绕一个并非单一供应商的技术栈的那一层。如果你的语音链路只是同一个端点背后多个模型中的一个,我们提供 200 多个模型,通过单个 API 密钥调用,并按 0% 加价透传各供应商的标价,这意味着像这次这样的供应商调价,在他们那边生效的同一天就会落到我们这边,无需另签一份合同,也无需改动集成。

在语音链路直接面向客户、不能掉线的情况下,自动故障转移会绕开性能退化的上游,而不是让通话失败。这类迁移就该采取这样的形式:让 v4 与现有服务共用同一个端点,切一部分流量过去,由路由层承担回退,同时你去验证那 150 Elo 分是否真的体现在你自己的音频上。

该决定,用一段话概括。

如果监听器听到你的输出时你仍停留在 v3,那就迁移吧——这一代的质量跃升是 ElevenLabs 在这些论坛上公布过的单代最大幅度,字符上限翻倍,语言列表翻倍,而标价更低。分阶段进行迁移,从你流量最高的音色开始,而不是从最复杂的脚本开始,并且按 10 月 12 日的数据做预算,而不是本周的。只有在你的集成无法承受不同的输入上限时,或者 v3 Conversational 在某个智能体中承担关键作用、而你还未针对自己的延迟预算实测过 v4 Turbo 时,才继续留在 v3。这两种情况下,耐心等待的代价低于仓促切换。