为 ElevenLabs Eleven v4 生成的 Hero 卡片,包含两个面板:左侧是一个脚本块,显示 [laughs]、[whispers] 和 [said angrily in French accent] 等内联音频标签;右侧面板显示排名第 1、Elo 1,319、每 100 万字符 $80.00,以及在 Artificial Analysis 的 Provider Voice Arena 中 1,674 次出现,页脚写着“Provider Voice 排名、Elo 和价格来自 Artificial Analysis,2026 年 9 月;标签语法和延迟为厂商文档所载。”OrcaRouter 标志位于右下角。
Engineering & Research

Eleven v4 的音频标签与十秒克隆:你的流水线会有什么变化

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

对于ElevenLabs Eleven v4而言,最重大的事情不是它的 Elo。而是该模型能读取写进脚本里的指示——[笑声]、[低语]、[叹息]、[愤怒地用法语口音说],甚至[小雨]——并且ElevenLabs Eleven v4 Turbo,这款同日发布的低延迟同门模型,也会遵循相同的标签,供应商称其首次发声时间中位数约为 150 毫秒。两者均于 2026 年 9 月 28 日全面可用。Artificial Analysis 的 Provider Voice Arena 已让 Eleven v4 在 1,674 次出场中以 1,319 的 Elo 排名第 1,榜单价格为每百万字符 80.00 美元。排名是头条新闻。指示语法和十秒克隆才是改变你必须构建什么的部分。

A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.

两款模型,一次发布,各司其职

ElevenLabs 于 2026 年 9 月 28 日发布了两个端点,它们并不是同一款产品加个速度开关。ElevenLabs Eleven v4 是富有表现力的模型:支持 90 多种语言,每次请求上限为 10,000 个字符,改进了对国际音标的支持以实现自定义发音,并支持多说话人对话,该公司称其能在整个场景中保持说话人身份一致。ElevenLabs Eleven v4 Turbo 保留了 90 多种语言和 10,000 字符的上限,但针对智能体进行了调优——公告中引用的中位推理延迟约为 100 毫秒,中位首字语音时间约为 150 毫秒,由 ElevenLabs 于 2026 年 9 月测得。

A screenshot of the ElevenLabs models documentation page, flagship Text to Speech section. Eleven v4 is described as the most emotive, high quality speech synthesis model, with exceptional voice cloning capabilities, 90+ languages supported, a 10,000 character limit and support for natural multi-speaker dialogue. Eleven v4 Turbo is described as the most emotive, real-time speech synthesis model, with ultra-low latency (median inference latency of ~100ms), exceptional voice cloning capabilities, 90+ languages supported and audio tags for fine-grained control. Below them the page lists Eleven v3, Eleven v3 Conversational, Eleven Multilingual v2 and Eleven Flash v2.5.

那个随之而来的问题——旗舰模型对手机端 agent 来说是否够快——并没有公开的答案。ElevenLabs 给出的是 Turbo 的延迟数据,而不是 Eleven v4 本身的;这两者是各自独立的端点,而不是同一个模型的两个名字。如果你的 agent 要求 200 毫秒内返回首个音频,那么文档中标明的端点就是 Turbo,而不是旗舰模型。

标签是真正的接口,也是真正的依赖。

内联音频标签对语音合成来说并不新鲜,但这里真正有用的变化是遵循的准确性。公告指出,Eleven v4 比之前的模型更精确地遵循音频标签和自然语言指示提示词,而这正是你无需事后编辑音频,就能指示笑声、耳语或特定口音的表达方式。

由此会产生三个实际后果,它们比演示短片更重要:

• 你的脚本会变成一种模板化产物,而不是一个字符串。标签是你内容流水线中的一个令牌:如果曾经传入不受信任的文本,它就需要转义;而且它还必须能在你的 CMS、翻译层和 diff 审查中存活下来。一个漏掉[低语]的译者,已经悄无声息地改变了一场演出。

• 标签遵循度是一项附带版本信息的供应商声明。关于这一代比上一代更好地遵循标签的说法,是 ElevenLabs 自己的说法,并由 ElevenLabs 自行测试,而且它不会在所有语言中都同样成立。在你据此制定风格指南之前,请用你自己的脚本和你自己的语言环境进行验证。

• 音效标签,例如[light rain]或[phone buzzing],把音频后期制作的一部分工作转移到了文本提示词中。这是一次值得衡量的成本转移:如果一个标签替代了一次拟音(foley)录制,那它就很划算;如果它什么都替代不了,只是增加了变数,那它就是你的 QA 中出现的一种新的失效模式。

十秒,是改变新用户引导的数字

本版本中的即时语音克隆仅凭十秒音频即可高保真地复刻一个声音,其上仍提供专业克隆档位。十秒短到足以压缩掉一个工作流环节:授权采集、样本上传与首次合成都可在同一时段内完成,用一部手机,无需录音棚。

同意问题并不会随样本变小而缩小。它反而会变大,因为制作出足以乱真的克隆声音的门槛,已经降低到任何人都能录制的一段音频。如果你克隆的是并不属于你的声音,那么合规问题现在完全要由你在 API 调用之前来回答——模型会照你的要求去做。把十秒这个数字当作一个操作阈值,而不是一张许可凭证。

窗口打开时费用是多少

ElevenLabs 在发布时重新定价,如今页面上显示的就是促销价。在 API 定价表上,Eleven v4 的标价为 每 1,000 个字符 $0.022,而标示的原价为 $0.08;Eleven v4 Turbo 为 $0.011,原价 $0.04。两者都带有相同的标签:10 月 12 日前享 72% 折扣。同一页面上,上一代旗舰产品 Eleven v3 的定价为每 1,000 个字符 $0.08。

• 竞技场榜单价格,每百万字符 — Eleven v4 $80.00,为该榜单前十名中最高。

• 供应商费率表,每千字符——10月12日前为$0.022,之后为$0.08。

• 这在实践中意味着——在活动窗口期内,一个脚本密集、包含五百万字符的月份费用为{{1}}110美元{{/1}},而窗口期结束后则为{{2}}400美元{{/2}},且使用的是同一端点、同一代码。

A screenshot of the ElevenLabs API pricing page filtered to ElevenAPI. Four Text to Speech columns are shown: v4 at $0.022 with $0.08 struck through, v4 Turbo at $0.011 with $0.04 struck through, both carrying a '72% off until Oct 12' badge, Eleven v3 at $0.08 and Eleven v3 Conversational at $0.04 per 1K characters. The v4 column lists audio tags for fine-grained control and 90+ languages supported; the Turbo column lists ultra-low latency (~100ms) and v4 expressiveness tuned for latency; the v3 column lists 70+ languages and a 5,000 character limit. The cost calculator below prices a Starter plan at $6 per month with 272.727k characters of TTS (v4) included.

任何按照今天页面上这个数字来编制 Q1 预算的人,都是在拿一个两周后就会失效的数字做预算。用 $0.08。

在这样的发布会上,路由器凭什么占有一席之地

OrcaRouter 并不托管 ElevenLabs,因此这次发布中没有任何东西可以通过我们来调用,我们也不会暗示并非如此——要调用 Eleven v4,该去的地方是 ElevenLabs 自己的 API。在一款产品发布后的两周里,单个密钥真正有用的地方其实是对比。如果你正在判断新的旗舰模型是否胜过你目前所用的,你会想在自己的脚本上对两者做 A/B 测试,而不是在排行榜上比,而跨两家供应商做这件事,意味着在你得到答案之前,得先有两个账号、两套结算关系和两条集成路径。

这正是我们所处理的情况:一个 API 密钥即可横跨200 多个模型,供应商目录价格以0% 加价透传,因此供应商方面的价格变动——包括带到期日的促销窗口——当天就会在我们这边生效,而不必等到下一个账单周期。在语音链路面向客户的场景中,自动故障转移会在某个端点性能下降时将流量切换到健康的上游,这样一来,你就能试用全新的模型,而无需把一次发布押注在它身上。

先测试什么,以及忽略什么

三项检查比任何排名都更能说明问题。第一,把你最长的真实脚本跑到 10,000 字符上限,看看接缝落在哪里——上限是按请求计的,而多说话人对话是最可能被它拆分的功能。第二,把你自己的五个带标签句子分别放进 v4 和 v4 Turbo,听听表达型端点和低延迟端点之间的遵循度漂移;它们是不同的模型,在一个模型上生效的标签,在另一个上未必以完全相同的方式生效。第三,按 $0.08 而不是 $0.022 来给你的实际月度字符量计价,因为你的下个季度就是靠这个数字运转的。

公告中约75%的盲测偏好数据是厂商自测结果,我们不会把它洗成其他任何东西。本次发布中的独立数据是榜单上的那个:在1,674次出场中排名第一,Elo为1,319,以及围绕它的约±19分区间。那是在真实榜单上的强劲结果。它不是规格,也不会告诉你你的标签语法能否挺过一次翻译流程。