一张关于“ElevenLabs Eleven v4 与 Qwen-Audio-3.1-TTS-Plus 对比”的主视觉卡片,配有两张评分卡:Qwen-Audio-3.1-TTS-Plus 的 Elo 为 1,178,排名第 1,价格为每 100 万字符 19.30 美元;ElevenLabs Eleven v4 的 Elo 为 1,157,排名第 2,价格为每 100 万字符 80.00 美元;图注为“以四倍价格差距换来 21 分 Elo 之差”。页脚:“Controlled Voice Arena,数据来自 Artificial Analysis,2026 年 9 月。”OrcaRouter 标志位于右下角。
Engineering & Research

Eleven v4 对比 Qwen Audio 3.1:排行榜上最便宜的语音胜出

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

在每位参赛者都被赋予相同八个克隆声音的榜单上,Alibaba Qwen-Audio-3.1-TTS-Plus以Elo 1,178分排名第一,ElevenLabs Eleven v4以1,157分排名第二。在该榜单上,夺冠的模型每百万字符收费19.30美元,而排名第二的模型收费80.00美元。这是一个21分的质量差距和四倍的价格差距指向相反方向,这是整个发布周中最有趣的结果——比ElevenLabs在另一个竞技场中拿下的第一名更有趣,因为在那个竞技场中,排序是常规的,而赢家是前十名中最贵的语音。

这两个榜单不可互换,而这场对比之所以读起来是这种结果,完全取决于你看的是哪一个。{{1}}提供商音色{{/1}}让听众评判每个厂商自己的音色。{{2}}受控音色{{/2}}会为每个模型克隆同样的八个音色——四个美式、四个英式——所以没人能靠自己的默认音色阵容取胜。ElevenLabs 以 61 分的优势赢下第一个榜单。Alibaba 以 21 分的优势赢下第二个。两个榜单都没错,而第二个榜单才是能预测一款产品会推出克隆品牌音色的那一个。

A two-column scoreboard for Qwen-Audio-3.1-TTS-Plus and ElevenLabs Eleven v4. Qwen: Controlled Voice rank 1 Elo 1,178; Provider Voice rank 4 Elo 1,258 on the 3.0 build; $19.30 per 1M chars; rate card not publicly readable; 3.1 on one board and 3.0 on the other; documentation not readable publicly. Eleven v4: Controlled Voice rank 2 Elo 1,157; Provider Voice rank 1 Elo 1,319; $80.00 per 1M chars; $0.022 per 1K until Oct 12; v4 on both boards; 90-plus languages and a 10,000-character cap. Footer: 'All ranks, Elo and board prices per Artificial Analysis; Qwen rate card not readable.'

受控语音记分牌,完整版

• 盲测偏好,匹配克隆——Qwen-Audio-3.1-TTS-Plus 排名第 1,Elo 1,178,每百万字符 19.30 美元;Eleven v4 排名第 2,Elo 1,157,80.00 美元。

• 盲测偏好,各厂商使用自家音色——Eleven v4 排名第 1,Elo 1,319,而 Qwen-Audio-3.0-TTS-Plus 排名第 4,Elo 1,258。反方向相差 61 分。

• 价格,竞技场归一化 —— Qwen $19.30 对比 Eleven v4 $80.00。Qwen 便宜 76%。

• 价格、供应商费率卡——Eleven v4 每千字符 $0.022(促销价),10月12日之后为 $0.08。Qwen Audio 3.1 自己的费率卡我们无法读取,因此 arena 归一化是我们唯一能用来比较的价格。

• 每块板卡上的版本 — Controlled Voice 为 3.1,Provider Voice 为 3.0。它们是不同的型号,板卡之间不可互换。

• Controlled Voice 中的 3.0 条目 — 排名第 5,Elo 1,124,价格同为 $19.30。3.1 版本在相同价格下比其前代多出 54 Elo。

• Qwen在Provider Voice上的早期几代——Qwen3 TTS Flash排名79,Elo 944;Qwen3 TTS排名82,Elo 930。

• ElevenLabs 自家在“受控语音”类别中的前代旗舰——Eleven v3 排名第 7,Elo 1,073。

• 分组条形图合理性检查——在 Controlled Voice 上,从第 1 名到第 10 名的八项跨度为 121 Elo。Qwen 对 Eleven v4 的 21 点领先不到整个赛场差距范围的五分之一,这正是应当采用的合适尺度。

A screenshot of the Artificial Analysis Controlled Voice Arena leaderboard, captured in English, showing Alibaba Qwen-Audio-3.1-TTS-Plus first at Elo 1,178 and $19.3 per 1M chars with 1,269 samples, ElevenLabs Eleven v4 second at Elo 1,157 and $80.0 with 1,483 samples, Cartesia Sonic 3.6 fourth at Elo 1,138, and Alibaba Qwen-Audio-3.0-TTS-Plus fifth at Elo 1,124 at the same $19.3 price, over the page subtitle 'Compare Text to Speech (TTS) models using the same 8 cloned voices (4 US, 4 UK)'.

其中的两行发挥了主要作用。第一行是 3.0 与 3.1 的对比:阿里巴巴在一次版本更新中提升了 54 Elo,而价格丝毫未变。这比 ElevenLabs 从 v3 到 v4 提升 84 点的节奏更快,也意味着本文中的具体排名顺序只是一个快照,两家厂商都在积极搅动这一排名。

第二点是 121 分的总差距。在一个有效范围约为 120 分的榜单上,21 分的差距是真实存在但幅度不大的差异——大致相当于 Qwen 自家 3.1 与 3.0 之间的差距。如果你的用例所处的语言并非两个模型各自调优所针对的语言,那么这点差距完全在几份高难度测试脚本就能推翻的范围之内。

没人指出的版本问题

正在流传的“Eleven v4 在 Controlled Voice 上排名第二”这一结果既准确又不完整,而这一遗漏对任何以此为依据做规划的人来说都很重要。在该榜单上排在 Eleven v4 之上的模型是阿里巴巴的 3.1 版本。与此同时,Provider Voice 榜单上的 Qwen 条目是 3.0 版本——就我们所见,3.1 模型并未出现在该榜单的前几行。因此,这两个标题——“Eleven v4 排名第一”和“Eleven v4 排名第二”——是关于两个不同任务上的两个不同 Qwen 模型的陈述,而在一个榜单上击败它的 Qwen 版本,并不是它在另一个榜单上击败的那个 Qwen 版本。

这不是在针对哪一家厂商设套;而是有理由让人不要相信对这样一周的任何一句话总结。如果你要在这两个系统之间做选择,你真正想要的比较,是 3.1 与 v4 在你自己克隆的声音、你自己的语言下的对比,而这两家厂商都没有公布过这样的比较。

关于 Qwen Audio 3.1,我们能说什么与不能说什么

在这里,对证据的坦诚比一张完整的规格表更有价值,所以这就是本文所依托的边界。从竞技场榜单上,我们得到 Qwen-Audio-3.1-TTS-Plus 的以下信息:受控语音 Elo 为 1,178,每百万字符 19.30 美元的价格标准化值,以及这样一个事实:它是该产品线中的当前版本,而上一版本在相同价格下得分低了 54 分。

我们没有,也不会去猜测:它的语言覆盖范围、延迟、每次请求的输入上限、是否支持内联投递指令、是否提供超出 arena 八种声音的语音克隆,以及它按自己的费率卡如何计费。这些在 Eleven v4 上都有文档记录——90 多种语言、10,000 字符上限、音频标签、十秒即时克隆、IPA 音素支持——而它们在 Qwen 这边的缺失,是公开可读信息中的空白,并不是对该模型的扣分。仅凭这篇文章做出的购买决定,会是一个建立在两个数字上的决定。

A screenshot of Artificial Analysis' Eleven v4 model page, captured in English, headed 'Eleven v4 Quality Elo, Speed & Price Analysis' and labelled 'ElevenLabs, Family ElevenLabs, Elo 1318.77', with the Provider Voice Arena Preference Elo chart showing Eleven v4 first at 1,319 ahead of Sonic 3.6 at 1,276 and Gemini 3.8 Flash TTS at 1,267, a '27 of 96 models' selector, and the Pricing section heading below.

有一种对比确实不受这一限制的影响,因为双方的数据要么都是厂商声明的,要么都是榜单声明的。在价格上,榜单标准化是共同基准,它使 Qwen 以 76% 的优势胜出。在匹配说话人条件下的质量上,同一榜单使 Qwen 以 21 Elo 的优势胜出。这两行是可比的。此处其他所有内容都不可比,本文也不会假装并非如此。

为什么受控董事会应比平时更有分量

大多数语音对比最终都会默认倒向某个排行榜,而那个排行榜往往把你本来就偏爱的模型排在首位。但在这次对比中,倾向于 Controlled Voice 有一个站得住脚的理由,而且这个理由是具体的,而非泛泛而谈。

阿里巴巴和ElevenLabs正以截然不同的资产展开竞争。ElevenLabs的优势在于多年精心策划选角所建立的语音库;阿里巴巴的优势则在于一个以快节奏持续发布模型版本的研究组织。一个让每位参赛者自带语音的榜单,衡量的是语音库不亚于合成器本身,而在这样的榜单上,ElevenLabs以61分的优势胜出。把语音库剥离出去——让所有人使用同样的八个克隆说话人——优势就会易主。如果你的用户听到的语音是某个特定人物的克隆,你买的就不是ElevenLabs的语音库,那么受控榜单才是描述你这次购买的榜单。如果你是从一组现成语音菜单中挑选,情况则相反,Eleven v4那61分的领先优势才是真正值钱的数字。

还有第二个不那么令人心安的理由,让人倾向于更看重受控结果。厂商音色榜单会奖励一种独特的默认音色阵容,而这种独特的阵容会以某种方式引发两极分化,平均 Elo 分数恰恰掩盖了这一点——一位听者眼中的"有特色",在另一位听者耳中就是"做作"。采用匹配说话人的克隆音色榜单则彻底消除了这一变量,这使其成为两者中更具可复现性的测量方式。

运行其中任一个,以及我们实际路由的内容

OrcaRouter 既不托管 ElevenLabs 的语音模型,也不托管阿里巴巴的语音模型。这两家供应商都不在我们的目录中,因此无法通过我们调用其中任何一家,本文也不会暗示可以这样做——这两家的模型都只能通过供应商自己的 API 以及若干第三方平台来调用。

我们确实覆盖的是上面那一层。如果你的语音栈只是更大管线中的一个节点,我们提供200 多个模型,它们位于同一个 API key 之下,按提供商标价以 0% 加价透传,因此任何上游的调价——包括 ElevenLabs 的促销窗口期,以及 10 月 12 日随之而来的大幅提高的标价——都会在发生当天就反映到我们这边,而不是等到下一个计费周期。对于一个取决于 4 倍价格比的决策而言,这个时间差决定了一份对比是经得起时间考验,还是三周后读起来就是错的。

而当语音路径无法继续下行时,自动故障转移会将流量引向健康的上游,而不是让请求失败。在质量如此接近、价格却如此悬殊的较量中,合理的架构是让两个模型共处同一端点、由路由决定流量分配——而不是依据排行榜快照做出永久性的选择,毕竟两家供应商都会在一个季度内让这份快照失效。

裁决,及其到期日

如果你要克隆声音并且在意成本,就选 Qwen-Audio-3.1-TTS-Plus。它在固定说话人的排行榜上位列第一,价格大约只有四分之一,而且其曲线攀升更快——在一个版本迭代中、费率不变的情况下提升 54 Elo,这表明下一个版本比当前版本从纸面上看更值得押注。

如果你的用户听到的是预置语音,如果你需要在你发布前能够验证的语言覆盖,或者如果文档化的功能集——音频标签、音素控制、10,000 字符请求、十秒克隆——正在你的产品中承担着 arena 榜单无法衡量的工作,那就选 Eleven v4。它在厂商语音榜单上 61 分的领先并非无足轻重,而你能写进脚本的两个功能是能力,不是分数。

设定一个复核日期。阿里巴巴在本周期的一次版本更新中提升了 54 Elo,而 ElevenLabs 在完整的一代模型迭代中提升了 84,且 Eleven v4 的促销价将于 10 月 12 日到期。无论这份对比今天得出什么结论,最有可能将其逆转的两个事实——3.2 版本的发布和价格的恢复——都会在本季度结束前落地。