
Eleven v4 与 ElevenLabs 其他产品的对比:你应该从 Eleven v3 迁移吗?
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 982 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 195 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1189 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
如果你已经在用ElevenLabs Eleven v3,那么答案是:凡是听众能听到的,都是肯定的;而 ElevenLabs 保持不变的这两件事,则都是否定的。ElevenLabs Eleven v4ElevenLabs Eleven v4 在 Artificial Analysis 的 Provider Voice Arena 上比前代高出 200 Elo 分——1,319 分对 1,235 分——并在 Controlled Voice 榜单上高出 84 分,该榜单上两者使用的是同样的八个声音。它的字符上限是 v3 的两倍,支持的语言数量也大约是 v3 的两倍。它不改变的是你的合同、你的声音克隆,以及你所对应计费的层级结构,因此这次迁移比大多数迁移都更省钱,但仍然值得分阶段进行,而不是一次性全部切换。

家庭内部的记分板
这不是厂商之间的对比,因此竞技场排行榜上的价格归一化处理与通常情况不同:两个模型都按字符计费,使用同一份价目表,来自同一个账户。下面列出的优势与不足,是相对于同门模型而非竞争对手来衡量的。
• 提供商语音竞技场 — ElevenLabs Eleven v4 排名第 1,Elo 1,319,对比 ElevenLabs Eleven v3 排名第 18,Elo 1,169。相差 150 分。
Controlled Voice Arena,匹配的克隆语音——Eleven v4 排名第 2,Elo 1,157,相较 Eleven v3 排名第 7,Elo 1,073。相差 84 分。
• Arena 价格标准化 —— Eleven v4 每百万字符 $80.00,对比 Eleven v3 的 $100.00。新旗舰是榜单上两者中更便宜的那个。
• 供应商价目表 — Eleven v4 每千字符 $0.022(促销价),10月12日后 $0.08;Eleven v3 $0.08。标价相同,活动期间半价。
• 每次请求的输入上限 — Eleven v4 为 10,000 个字符,而 Eleven v3 为 5,000 个。正好是两倍。
• 语言覆盖范围 — Eleven v4 支持 90 多种,Eleven v3 支持 70 多种。
• 交付指令 — Eleven v4 在其文档中说明了内联音频标签和 IPA 音素输入;Eleven v3 的模型页面则对两者均未记录。
• 延迟,厂商声明——Eleven v3 Conversational 约为 280 毫秒;Eleven v4 Turbo 首次发声的中位数约为 150 毫秒。不同层级,不同测试。
• 声音克隆——保持不变。现有的即时克隆和专业克隆均予以保留。
• 套餐层级 — 保持不变。Free 10,000 字符,Starter $6,Creator $22,Pro $99,Scale $299,Business $990。
• 迁移路径 — Eleven v4 和 Eleven v4 Turbo 均已在 API、智能体和创意界面中上线;旧的 Turbo 标识符已被弃用。
把价格那一行读两遍。这次发布不同寻常的地方在于:新模型比它所取代的旧模型更便宜——同一张价目表、按标价、不叠加任何促销——每百万 80 美元对 100 美元。促销价只是把这一差距拉得更大,而不是造就了它。一次能提升 150 Elo 质量、同时降低每字符成本的迁移,并不是多数团队预期会做的取舍。
迁移清单,按重要程度排列
先迁移音频质量路径,因为收益就在那里,而且一旦出现回归,你的用户会比你更早察觉。
• 试听你实际交付的那些声音。Provider Voice 是对一个竞技场声音集取的平均值;你的品牌声音并不在其中。150 分的差距是进行试听的理由,而不是试听的替代品,而克隆声音排行榜上的 84 分差距,才是对基于克隆的产品会带来何种感受更接近的估计。
• 重新检查你的字符预算。10,000 字符的上限是 v3 的两倍,因此你之前拆分的脚本现在可能可以容纳在一个请求中。这会改变请求次数、重试逻辑以及拼接输出的接缝质量——而且这是最有可能破坏假定上限为 5,000 的代码的更改。
• 测试接缝。ElevenLabs 明确说明 v4 在请求拼接方面更加可靠。如果你在 v3 上曾对长文本内容进行拆分,请将相同内容通过 v4 一次性重新运行并对比,而不是想当然地认为仍然需要拆分。
• 在新的音素支持下重新测试你的发音用例。为 v3 构建的词典应当重新验证,而不是直接采信;IPA 处理的改进可能意味着,原本正确的覆盖项如今会与模型自身的猜测产生不同的交互。
• 不要动你的克隆音色库。克隆音色会保留下来;无需重新上传,而重新克隆还有可能丢失用户已经熟悉的音色。
• 暂时,请在你目前使用 v3 Conversational 的地方继续保留它。它属于对话层级,而不是合成模型;其文档仍标注约为 280 毫秒,并且没有已发布的 v4 对等版本。如果你的智能体依赖它,v4 并不是该位置的同等替代品——v4 Turbo 是 v4 中延迟更低的标签,其延迟档位的标称方式也不同。

实际上什么会变得更好,而什么不会
这些提升集中在三个方面。情感范围与节奏感是第一项——这正是 Provider Voice 榜单所衡量的内容,也是厂商自家公告所强调的重点,同时公告还声称在盲测对比中,约四分之三的案例更偏好 v4。这个数字应视为厂商自述且未经复现;竞技场榜单是同一叙事中独立的那一半,而两者在方向上是一致的。

具备稳定说话人身份的多说话人对话是第二项。如果你已经在 v3 上交付了双人内容,并花力气修复长篇脚本中的说话人串扰或漂移,那么这是一种改进属于结构性而非表面性的工作负载,而 Elo 数值只能部分反映这一点。
内联交付指令是第三种——把一声叹息或一句低语直接写进脚本里。在 v3 上,那意味着要再录一遍、额外加一段上游提示词,或者做后期处理。而在 v4 Turbo 上,它不过是你已经写好的文本里的一行字。
没有变得更好的是团队常常以为会随着新旗舰而改善的那一部分:延迟。ElevenLabs 没有公布 Eleven v4 本身的延迟数据,只公布了 v4 Turbo 的数据:2026 年 9 月测得的中位推理时间约为 100 毫秒,中位首次语音时间约为 150 毫秒。Eleven v3 的对话层级据称约为 280 毫秒,但那是承担不同任务的不同层级。如果你的架构围绕硬性延迟预算构建,那么诚实的立场是:候选方案是 v4 Turbo,而你应该自行测量,因为层级名称并不能清晰对应,厂商给出的数字也并非同一口径。
两周窗口期,以及之后会发生什么
促销定价持续至10月12日。在此之前,Eleven v4 为每千字符 $0.022,Eleven v4 Turbo 为 $0.011,而公布的标价分别为 $0.08 和 $0.04。优惠期结束后,v4 将恢复到与 v3 当前价格完全相同的水平——$0.08——而 v4 Turbo 将恢复到 v3 费率的一半。
按五百万字符计算的一个完整月度示例:v3 费用为 400 美元。v4 在优惠窗口期内费用为 110 美元,之后又恢复到 400 美元。v4 Turbo 在窗口期内费用为 55 美元,之后为 200 美元。因此,值得关注的迁移可以说是转向 Turbo,因为在这份价目表上,它是促销结束后唯一仍比 v3 便宜的选项,而 v3 所缺少的音频标签支持也正存在于它那里。
务实的做法是趁价格还算额外收益时现在就把质量工作做好,并根据10月12日之后的数字来做定价决定。任何引用 Eleven v4 每百万 22 美元却不附截止日期的比较,都是在描述一个将在两周后失效的费率。
分阶段推进切换,而不把发布押注于此
OrcaRouter 并不托管 ElevenLabs,所以这次迁移中没有什么是我们能替你搬移的——变更发生在你的 ElevenLabs 账户上。我们真正负责的,是围绕一个并非单一供应商的技术栈的那一层。如果你的语音链路只是同一个端点背后多个模型中的一个,我们提供 200 多个模型,通过单个 API 密钥调用,并按 0% 加价透传各供应商的标价,这意味着像这次这样的供应商调价,在他们那边生效的同一天就会落到我们这边,无需另签一份合同,也无需改动集成。
在语音链路直接面向客户、不能掉线的情况下,自动故障转移会绕开性能退化的上游,而不是让通话失败。这类迁移就该采取这样的形式:让 v4 与现有服务共用同一个端点,切一部分流量过去,由路由层承担回退,同时你去验证那 150 Elo 分是否真的体现在你自己的音频上。
该决定,用一段话概括。
如果监听器听到你的输出时你仍停留在 v3,那就迁移吧——这一代的质量跃升是 ElevenLabs 在这些论坛上公布过的单代最大幅度,字符上限翻倍,语言列表翻倍,而标价更低。分阶段进行迁移,从你流量最高的音色开始,而不是从最复杂的脚本开始,并且按 10 月 12 日的数据做预算,而不是本周的。只有在你的集成无法承受不同的输入上限时,或者 v3 Conversational 在某个智能体中承担关键作用、而你还未针对自己的延迟预算实测过 v4 Turbo 时,才继续留在 v3。这两种情况下,耐心等待的代价低于仓促切换。
