
Eleven v4 对比 Qwen Audio 3.1:排行榜上最便宜的语音胜出
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 982 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 197 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
在每位参赛者都被赋予相同八个克隆声音的榜单上,Alibaba Qwen-Audio-3.1-TTS-Plus以Elo 1,178分排名第一,ElevenLabs Eleven v4以1,157分排名第二。在该榜单上,夺冠的模型每百万字符收费19.30美元,而排名第二的模型收费80.00美元。这是一个21分的质量差距和四倍的价格差距指向相反方向,这是整个发布周中最有趣的结果——比ElevenLabs在另一个竞技场中拿下的第一名更有趣,因为在那个竞技场中,排序是常规的,而赢家是前十名中最贵的语音。
这两个榜单不可互换,而这场对比之所以读起来是这种结果,完全取决于你看的是哪一个。{{1}}提供商音色{{/1}}让听众评判每个厂商自己的音色。{{2}}受控音色{{/2}}会为每个模型克隆同样的八个音色——四个美式、四个英式——所以没人能靠自己的默认音色阵容取胜。ElevenLabs 以 61 分的优势赢下第一个榜单。Alibaba 以 21 分的优势赢下第二个。两个榜单都没错,而第二个榜单才是能预测一款产品会推出克隆品牌音色的那一个。

受控语音记分牌,完整版
• 盲测偏好,匹配克隆——Qwen-Audio-3.1-TTS-Plus 排名第 1,Elo 1,178,每百万字符 19.30 美元;Eleven v4 排名第 2,Elo 1,157,80.00 美元。
• 盲测偏好,各厂商使用自家音色——Eleven v4 排名第 1,Elo 1,319,而 Qwen-Audio-3.0-TTS-Plus 排名第 4,Elo 1,258。反方向相差 61 分。
• 价格,竞技场归一化 —— Qwen $19.30 对比 Eleven v4 $80.00。Qwen 便宜 76%。
• 价格、供应商费率卡——Eleven v4 每千字符 $0.022(促销价),10月12日之后为 $0.08。Qwen Audio 3.1 自己的费率卡我们无法读取,因此 arena 归一化是我们唯一能用来比较的价格。
• 每块板卡上的版本 — Controlled Voice 为 3.1,Provider Voice 为 3.0。它们是不同的型号,板卡之间不可互换。
• Controlled Voice 中的 3.0 条目 — 排名第 5,Elo 1,124,价格同为 $19.30。3.1 版本在相同价格下比其前代多出 54 Elo。
• Qwen在Provider Voice上的早期几代——Qwen3 TTS Flash排名79,Elo 944;Qwen3 TTS排名82,Elo 930。
• ElevenLabs 自家在“受控语音”类别中的前代旗舰——Eleven v3 排名第 7,Elo 1,073。
• 分组条形图合理性检查——在 Controlled Voice 上,从第 1 名到第 10 名的八项跨度为 121 Elo。Qwen 对 Eleven v4 的 21 点领先不到整个赛场差距范围的五分之一,这正是应当采用的合适尺度。

其中的两行发挥了主要作用。第一行是 3.0 与 3.1 的对比:阿里巴巴在一次版本更新中提升了 54 Elo,而价格丝毫未变。这比 ElevenLabs 从 v3 到 v4 提升 84 点的节奏更快,也意味着本文中的具体排名顺序只是一个快照,两家厂商都在积极搅动这一排名。
第二点是 121 分的总差距。在一个有效范围约为 120 分的榜单上,21 分的差距是真实存在但幅度不大的差异——大致相当于 Qwen 自家 3.1 与 3.0 之间的差距。如果你的用例所处的语言并非两个模型各自调优所针对的语言,那么这点差距完全在几份高难度测试脚本就能推翻的范围之内。
没人指出的版本问题
正在流传的“Eleven v4 在 Controlled Voice 上排名第二”这一结果既准确又不完整,而这一遗漏对任何以此为依据做规划的人来说都很重要。在该榜单上排在 Eleven v4 之上的模型是阿里巴巴的 3.1 版本。与此同时,Provider Voice 榜单上的 Qwen 条目是 3.0 版本——就我们所见,3.1 模型并未出现在该榜单的前几行。因此,这两个标题——“Eleven v4 排名第一”和“Eleven v4 排名第二”——是关于两个不同任务上的两个不同 Qwen 模型的陈述,而在一个榜单上击败它的 Qwen 版本,并不是它在另一个榜单上击败的那个 Qwen 版本。
这不是在针对哪一家厂商设套;而是有理由让人不要相信对这样一周的任何一句话总结。如果你要在这两个系统之间做选择,你真正想要的比较,是 3.1 与 v4 在你自己克隆的声音、你自己的语言下的对比,而这两家厂商都没有公布过这样的比较。
关于 Qwen Audio 3.1,我们能说什么与不能说什么
在这里,对证据的坦诚比一张完整的规格表更有价值,所以这就是本文所依托的边界。从竞技场榜单上,我们得到 Qwen-Audio-3.1-TTS-Plus 的以下信息:受控语音 Elo 为 1,178,每百万字符 19.30 美元的价格标准化值,以及这样一个事实:它是该产品线中的当前版本,而上一版本在相同价格下得分低了 54 分。
我们没有,也不会去猜测:它的语言覆盖范围、延迟、每次请求的输入上限、是否支持内联投递指令、是否提供超出 arena 八种声音的语音克隆,以及它按自己的费率卡如何计费。这些在 Eleven v4 上都有文档记录——90 多种语言、10,000 字符上限、音频标签、十秒即时克隆、IPA 音素支持——而它们在 Qwen 这边的缺失,是公开可读信息中的空白,并不是对该模型的扣分。仅凭这篇文章做出的购买决定,会是一个建立在两个数字上的决定。

有一种对比确实不受这一限制的影响,因为双方的数据要么都是厂商声明的,要么都是榜单声明的。在价格上,榜单标准化是共同基准,它使 Qwen 以 76% 的优势胜出。在匹配说话人条件下的质量上,同一榜单使 Qwen 以 21 Elo 的优势胜出。这两行是可比的。此处其他所有内容都不可比,本文也不会假装并非如此。
为什么受控董事会应比平时更有分量
大多数语音对比最终都会默认倒向某个排行榜,而那个排行榜往往把你本来就偏爱的模型排在首位。但在这次对比中,倾向于 Controlled Voice 有一个站得住脚的理由,而且这个理由是具体的,而非泛泛而谈。
阿里巴巴和ElevenLabs正以截然不同的资产展开竞争。ElevenLabs的优势在于多年精心策划选角所建立的语音库;阿里巴巴的优势则在于一个以快节奏持续发布模型版本的研究组织。一个让每位参赛者自带语音的榜单,衡量的是语音库不亚于合成器本身,而在这样的榜单上,ElevenLabs以61分的优势胜出。把语音库剥离出去——让所有人使用同样的八个克隆说话人——优势就会易主。如果你的用户听到的语音是某个特定人物的克隆,你买的就不是ElevenLabs的语音库,那么受控榜单才是描述你这次购买的榜单。如果你是从一组现成语音菜单中挑选,情况则相反,Eleven v4那61分的领先优势才是真正值钱的数字。
还有第二个不那么令人心安的理由,让人倾向于更看重受控结果。厂商音色榜单会奖励一种独特的默认音色阵容,而这种独特的阵容会以某种方式引发两极分化,平均 Elo 分数恰恰掩盖了这一点——一位听者眼中的"有特色",在另一位听者耳中就是"做作"。采用匹配说话人的克隆音色榜单则彻底消除了这一变量,这使其成为两者中更具可复现性的测量方式。
运行其中任一个,以及我们实际路由的内容
OrcaRouter 既不托管 ElevenLabs 的语音模型,也不托管阿里巴巴的语音模型。这两家供应商都不在我们的目录中,因此无法通过我们调用其中任何一家,本文也不会暗示可以这样做——这两家的模型都只能通过供应商自己的 API 以及若干第三方平台来调用。
我们确实覆盖的是上面那一层。如果你的语音栈只是更大管线中的一个节点,我们提供200 多个模型,它们位于同一个 API key 之下,按提供商标价以 0% 加价透传,因此任何上游的调价——包括 ElevenLabs 的促销窗口期,以及 10 月 12 日随之而来的大幅提高的标价——都会在发生当天就反映到我们这边,而不是等到下一个计费周期。对于一个取决于 4 倍价格比的决策而言,这个时间差决定了一份对比是经得起时间考验,还是三周后读起来就是错的。
而当语音路径无法继续下行时,自动故障转移会将流量引向健康的上游,而不是让请求失败。在质量如此接近、价格却如此悬殊的较量中,合理的架构是让两个模型共处同一端点、由路由决定流量分配——而不是依据排行榜快照做出永久性的选择,毕竟两家供应商都会在一个季度内让这份快照失效。
裁决,及其到期日
如果你要克隆声音并且在意成本,就选 Qwen-Audio-3.1-TTS-Plus。它在固定说话人的排行榜上位列第一,价格大约只有四分之一,而且其曲线攀升更快——在一个版本迭代中、费率不变的情况下提升 54 Elo,这表明下一个版本比当前版本从纸面上看更值得押注。
如果你的用户听到的是预置语音,如果你需要在你发布前能够验证的语言覆盖,或者如果文档化的功能集——音频标签、音素控制、10,000 字符请求、十秒克隆——正在你的产品中承担着 arena 榜单无法衡量的工作,那就选 Eleven v4。它在厂商语音榜单上 61 分的领先并非无足轻重,而你能写进脚本的两个功能是能力,不是分数。
设定一个复核日期。阿里巴巴在本周期的一次版本更新中提升了 54 Elo,而 ElevenLabs 在完整的一代模型迭代中提升了 84,且 Eleven v4 的促销价将于 10 月 12 日到期。无论这份对比今天得出什么结论,最有可能将其逆转的两个事实——3.2 版本的发布和价格的恢复——都会在本季度结束前落地。
