![为 ElevenLabs Eleven v4 生成的 Hero 卡片,包含两个面板:左侧是一个脚本块,显示 [laughs]、[whispers] 和 [said angrily in French accent] 等内联音频标签;右侧面板显示排名第 1、Elo 1,319、每 100 万字符 $80.00,以及在 Artificial Analysis 的 Provider Voice Arena 中 1,674 次出现,页脚写着“Provider Voice 排名、Elo 和价格来自 Artificial Analysis,2026 年 9 月;标签语法和延迟为厂商文档所载。”OrcaRouter 标志位于右下角。](https://cms.orcarouter.ai/api/media/file/1-1462.png)
Eleven v4 的音频标签与十秒克隆:你的流水线会有什么变化
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 982 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 197 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
对于ElevenLabs Eleven v4而言,最重大的事情不是它的 Elo。而是该模型能读取写进脚本里的指示——[笑声]、[低语]、[叹息]、[愤怒地用法语口音说],甚至[小雨]——并且ElevenLabs Eleven v4 Turbo,这款同日发布的低延迟同门模型,也会遵循相同的标签,供应商称其首次发声时间中位数约为 150 毫秒。两者均于 2026 年 9 月 28 日全面可用。Artificial Analysis 的 Provider Voice Arena 已让 Eleven v4 在 1,674 次出场中以 1,319 的 Elo 排名第 1,榜单价格为每百万字符 80.00 美元。排名是头条新闻。指示语法和十秒克隆才是改变你必须构建什么的部分。
![A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.](https://cms.orcarouter.ai/api/media/file/2-1397.png)
两款模型,一次发布,各司其职
ElevenLabs 于 2026 年 9 月 28 日发布了两个端点,它们并不是同一款产品加个速度开关。ElevenLabs Eleven v4 是富有表现力的模型:支持 90 多种语言,每次请求上限为 10,000 个字符,改进了对国际音标的支持以实现自定义发音,并支持多说话人对话,该公司称其能在整个场景中保持说话人身份一致。ElevenLabs Eleven v4 Turbo 保留了 90 多种语言和 10,000 字符的上限,但针对智能体进行了调优——公告中引用的中位推理延迟约为 100 毫秒,中位首字语音时间约为 150 毫秒,由 ElevenLabs 于 2026 年 9 月测得。

那个随之而来的问题——旗舰模型对手机端 agent 来说是否够快——并没有公开的答案。ElevenLabs 给出的是 Turbo 的延迟数据,而不是 Eleven v4 本身的;这两者是各自独立的端点,而不是同一个模型的两个名字。如果你的 agent 要求 200 毫秒内返回首个音频,那么文档中标明的端点就是 Turbo,而不是旗舰模型。
标签是真正的接口,也是真正的依赖。
内联音频标签对语音合成来说并不新鲜,但这里真正有用的变化是遵循的准确性。公告指出,Eleven v4 比之前的模型更精确地遵循音频标签和自然语言指示提示词,而这正是你无需事后编辑音频,就能指示笑声、耳语或特定口音的表达方式。
由此会产生三个实际后果,它们比演示短片更重要:
• 你的脚本会变成一种模板化产物,而不是一个字符串。标签是你内容流水线中的一个令牌:如果曾经传入不受信任的文本,它就需要转义;而且它还必须能在你的 CMS、翻译层和 diff 审查中存活下来。一个漏掉[低语]的译者,已经悄无声息地改变了一场演出。
• 标签遵循度是一项附带版本信息的供应商声明。关于这一代比上一代更好地遵循标签的说法,是 ElevenLabs 自己的说法,并由 ElevenLabs 自行测试,而且它不会在所有语言中都同样成立。在你据此制定风格指南之前,请用你自己的脚本和你自己的语言环境进行验证。
• 音效标签,例如[light rain]或[phone buzzing],把音频后期制作的一部分工作转移到了文本提示词中。这是一次值得衡量的成本转移:如果一个标签替代了一次拟音(foley)录制,那它就很划算;如果它什么都替代不了,只是增加了变数,那它就是你的 QA 中出现的一种新的失效模式。
十秒,是改变新用户引导的数字
本版本中的即时语音克隆仅凭十秒音频即可高保真地复刻一个声音,其上仍提供专业克隆档位。十秒短到足以压缩掉一个工作流环节:授权采集、样本上传与首次合成都可在同一时段内完成,用一部手机,无需录音棚。
同意问题并不会随样本变小而缩小。它反而会变大,因为制作出足以乱真的克隆声音的门槛,已经降低到任何人都能录制的一段音频。如果你克隆的是并不属于你的声音,那么合规问题现在完全要由你在 API 调用之前来回答——模型会照你的要求去做。把十秒这个数字当作一个操作阈值,而不是一张许可凭证。
窗口打开时费用是多少
ElevenLabs 在发布时重新定价,如今页面上显示的就是促销价。在 API 定价表上,Eleven v4 的标价为 每 1,000 个字符 $0.022,而标示的原价为 $0.08;Eleven v4 Turbo 为 $0.011,原价 $0.04。两者都带有相同的标签:10 月 12 日前享 72% 折扣。同一页面上,上一代旗舰产品 Eleven v3 的定价为每 1,000 个字符 $0.08。
• 竞技场榜单价格,每百万字符 — Eleven v4 $80.00,为该榜单前十名中最高。
• 供应商费率表,每千字符——10月12日前为$0.022,之后为$0.08。
• 这在实践中意味着——在活动窗口期内,一个脚本密集、包含五百万字符的月份费用为{{1}}110美元{{/1}},而窗口期结束后则为{{2}}400美元{{/2}},且使用的是同一端点、同一代码。

任何按照今天页面上这个数字来编制 Q1 预算的人,都是在拿一个两周后就会失效的数字做预算。用 $0.08。
在这样的发布会上,路由器凭什么占有一席之地
OrcaRouter 并不托管 ElevenLabs,因此这次发布中没有任何东西可以通过我们来调用,我们也不会暗示并非如此——要调用 Eleven v4,该去的地方是 ElevenLabs 自己的 API。在一款产品发布后的两周里,单个密钥真正有用的地方其实是对比。如果你正在判断新的旗舰模型是否胜过你目前所用的,你会想在自己的脚本上对两者做 A/B 测试,而不是在排行榜上比,而跨两家供应商做这件事,意味着在你得到答案之前,得先有两个账号、两套结算关系和两条集成路径。
这正是我们所处理的情况:一个 API 密钥即可横跨200 多个模型,供应商目录价格以0% 加价透传,因此供应商方面的价格变动——包括带到期日的促销窗口——当天就会在我们这边生效,而不必等到下一个账单周期。在语音链路面向客户的场景中,自动故障转移会在某个端点性能下降时将流量切换到健康的上游,这样一来,你就能试用全新的模型,而无需把一次发布押注在它身上。
先测试什么,以及忽略什么
三项检查比任何排名都更能说明问题。第一,把你最长的真实脚本跑到 10,000 字符上限,看看接缝落在哪里——上限是按请求计的,而多说话人对话是最可能被它拆分的功能。第二,把你自己的五个带标签句子分别放进 v4 和 v4 Turbo,听听表达型端点和低延迟端点之间的遵循度漂移;它们是不同的模型,在一个模型上生效的标签,在另一个上未必以完全相同的方式生效。第三,按 $0.08 而不是 $0.022 来给你的实际月度字符量计价,因为你的下个季度就是靠这个数字运转的。
公告中约75%的盲测偏好数据是厂商自测结果,我们不会把它洗成其他任何东西。本次发布中的独立数据是榜单上的那个:在1,674次出场中排名第一,Elo为1,319,以及围绕它的约±19分区间。那是在真实榜单上的强劲结果。它不是规格,也不会告诉你你的标签语法能否挺过一次翻译流程。
