一张主视觉卡片,将 Qwen-Audio-3.1-TTS 与 ElevenLabs Eleven v3 进行对比,列出 Qwen 的 16 种语言加 20 种方言、70% 的降价以及缺少竞技场评分,对比 ElevenLabs 的 74 种语言、约每百万字符 100 美元和 1,168 的 Elo,位于一条写着“2026年9月23日在 Apsara 发布”的绶带上方。
Guides & Insights

Qwen-Audio-3.1 对决 ElevenLabs:降价 70% 迎战行业老牌

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

该厂商于2026年9月23日将其Qwen-Audio-3.1-TTS API的价格下调了约70%,并在杭州云栖大会上与其他四款语音模型一同登台宣布。仅凭这一个数字,这次对比就值得一写:ElevenLabs Eleven v3一直是大多数西方团队默认的生产级语音方案,实际费率接近每百万字符100美元,而一个可信的挑战者刚刚以低得多的价格重新为同样的工作定价,同时还扩大了语言覆盖范围。这两个系统并不对等——Qwen-Audio-3.1-TTS是来自该厂商通义实验室的纯托管API,语音生态较小,而ElevenLabs是一个完整的内容平台,拥有业内最丰富的语音库。但如果你的决策曾经是由账单决定的,那么这周,算术变了。

9月23日究竟发布了什么

Qwen-Audio-3.1 并非单一模型。它是对阿里巴巴整个语音技术栈的一次五模型更新,而这些层级很重要,因为它们具有不同的定价和不同的用途:

Qwen-Audio-3.1-TTS——大多数团队所用合成模型的直接继任者。新增七种语言,共计 16 种,保留 20 个中文方言区,新增自然的跨语言音色迁移(同一音色可贯通普通话、粤语、英语、日语),支持基于指令的情绪、语速和表达风格控制,并能处理带噪、有回声或其他质量欠佳的参考音频,无需单独的降噪模式。

Qwen-Audio-3.1-TTS-Next——一个全新的档位,也是一款不同的产品。阿里巴巴将其称为“Audiogen”模型:它能根据文本、时间戳和参考音频,一次性生成人声、音效和背景环境声。支持多说话人对话、播客、影视声景,输出为 48 kHz。根据阿里云 Model Studio 文档,它最多可接收 3,000 个字符的输入,生成的音频播客最长 240 秒、其他情况最长 120 秒,运行速率为每秒 3 次请求,并返回 WAV、MP3 或 PCM 格式。

Qwen-Audio-3.1-ASRQwen-Audio-3.1-ASR-NextQwen-Audio-3.1-Realtime——分别对应语音识别、音频理解(情绪、音乐、环境声、事件定位)以及全双工对话。Realtime 正是阿里巴巴正在推向硬件的那一个:Qwen Office、Qoder、QwenNote A2、QwenNote Eva 桌面机器人和 Qwen AI 眼镜。

此次降价覆盖了整条产品线,而不仅限于 TTS:语音合成降幅约 70%,实时降幅约 85%,识别降幅高达 95%。阿里巴巴还开源了 Qwen-Audio-Agent——一个用于构建实时语音智能体的框架,并首次推出 Qwen3.8-LiveTranslate,将延迟压缩至 2.5 秒以内。

A screenshot of Alibaba Cloud Model Studio's English documentation site showing the reference page for qwen3.8-livetranslate-flash-realtime, a real-time audio and video translation model that accepts audio and images and outputs text and audio across 60 input languages and 29 speech output languages, under an Apsara 2026 Conference banner, with the Speech-to-Speech branch of the navigation listing the qwen-audio-3.0 realtime models.

记分牌

A two-column scoreboard for Qwen-Audio-3.1-TTS and ElevenLabs Eleven v3 across price, languages, weights, voice library, delivery control and arena score, with a footer stating that the Qwen figures are vendor-reported and unscored and the ElevenLabs figures are per Artificial Analysis.

价格—— Qwen-Audio-3.1-TTS:比上一代 Qwen-Audio 低约 70%,上一代的 3.0 Plus 档位约为每 100 万字符 27.60 美元,Flash 档位约为 15 美元。ElevenLabs Eleven v3:据 Artificial Analysis 统计,约为每 100 万字符 100 美元,Flash 约为 50 美元。

语言 — Qwen-Audio-3.1-TTS:16 种语言,外加 20 个中文方言区。ElevenLabs Eleven v3:74 种语言。

权重——Qwen-Audio-3.1-TTS:闭源,仅托管于阿里云百炼平台。ElevenLabs Eleven v3:闭源,仅提供托管服务。

语音库 —— Qwen-Audio-3.1-TTS:原生克隆加上跨语言音色迁移;没有可比的公开市场。ElevenLabs:业内最大的共享语音库,并且可从约 30 秒音频实现即时克隆。

演绎控制 — Qwen-Audio-3.1-TTS:基于指令的情感、语速与风格,继承了 3.0 引入的 86 个内联演绎标签。ElevenLabs Eleven v3:音频标签,以及周边平台(配音、智能体、工作室)。

独立基准测试 — Qwen-Audio-3.1-TTS:暂无。ElevenLabs Eleven v3:截至 2026 年 8 月,在 Artificial Analysis 的 Provider Voice Arena 排行榜上获得 1,168 Elo 分。

在挑战者真正胜出的地方

三件事,其中只有一件是价格。

价格,显然。 相比每百万字符 100 美元的现有方案,70% 的降幅可不是四舍五入的零头。它决定了你手里的是拿来打样的产品,还是能交付给每一位用户的产品。如果你在批量生成旁白,每年省下的这笔钱并不是需要你在内部据理力争的预算条目——它自己就会说话。

中文,毫不含糊。二十个中文方言区,是一道 ElevenLabs 所提供的任何东西都远不能及的护城河。如果你的产品服务于中国大陆用户、粤语使用者,或是在句中来回切换语言的离散受众,那么这场比较还没开始就已经结束了。

跨语言音色迁移。Qwen-Audio-3.1-TTS 能将一种声音自然地带到普通话、粤语、英语和日语之中。这是一项有着特定用例的具体能力——一个在语言切换后依然保持一致的品牌声音——对于要为单一主播进行本地化、而不是为每个市场重新选角的人来说,它是一项真正的差异化优势。

ElevenLabs 仍然胜出的地方,而且差距悬殊

语言覆盖面是首要的,也是最大的。七十四种语言对十六种,这不是靠一份定价公告就能弥合的差距。如果你要发布波兰语、土耳其语、越南语和葡萄牙语版本,ElevenLabs 今天就能覆盖,而 Qwen-Audio-3.1-TTS 还做不到。

第二个是生态系统。ElevenLabs 不是一个合成端点;它是一个内容平台。一个可授权使用而非克隆的共享语音库、配音工作流、智能体基础设施、一款工作室产品、以及一个有文档记录、背后有多年客户端库积累的 API 接口。从中迁移出去是一个项目,而不是一次配置更改,那些基于它构建的团队清楚地知道自己将会放弃什么。

第三点更难以命名,但无论如何都值得命名:对单一英语音色的自然度感知。Qwen 的语音合成历来在中文上表现出色,而在英语上则仅仅是相当好;尽管 3.1 版本声称改进了多语言表现,但目前还没有针对新模型的独立听测。任何告诉你他们知道新的 Qwen 语音在英语中听起来如何的人,都是在猜。

这个数字,暂时谁都不该引用

这是整个故事中会在报道里被歪曲的那部分,所以这里直白地说出来。Qwen-Audio-3.1-TTS没有任何独立基准测试得分。它的前代 Qwen-Audio-3.0-TTS-Plus 截至 2026 年 8 月中旬在 Artificial Analysis 的 Provider Voice Arena 排行榜上为 1,234 Elo,位列该榜第二至第五名之间。Qwen-Audio-3.1-TTS 尚未被加入任何竞技场。阿里巴巴发布材料中的每一项质量声明都出自厂商自报,且未经复现。

这并不会让这些说法变成假的。它只是让它们未经证实,并且这意味着,眼下对这场对比的诚实表述是:一个模型有价格却没有分数,另一个模型有分数但价格高得多。任何比这更强的说法,都不过是披着基准测试外衣的猜测。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in its August 2026 state, ranking text-to-speech models by Elo: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,234 and ElevenLabs Eleven v3 at 1,168.

同样的纪律也适用于延迟。阿里巴巴针对该系列 ASR 一侧宣传的首令牌数据——92 毫秒——来自该公司自己在 0.6B 规格上的高并发基准测试,而非第三方测试;自发布以来发表的分析指出,ASR 和 TTS 是流水线中的独立产品,而不是一个端到端模型,并且社区报告称,在伪流式模式下,长对话中延迟会不断累积。请将这一整个系列中厂商给出的延迟数字视为上限,而不是实测体验。

降价在实践中意味着什么

以一个现实的工作负载为例:一个产品每月要用英语和普通话合成 2000 万字符的旁白。按照 ElevenLabs Eleven v3 大约每百万字符 $100 的价格,这大约是每月 $2,000,即每年 $24,000。按照 Qwen-Audio-3.0-TTS-Plus 大约每百万 $27.60 的价格,同样的用量已经是每月约 $552。把 Alibaba 在 9 月 23 日宣布的约 70% 降价算进去,同样的工作负载每月就降到了数百美元的低位。

那些数字都不是可以拿来签约的标价——ElevenLabs 通过订阅层级以积分计费,而阿里巴巴的降价是按百分比削减,且各地区、各层级的费率各不相同。但这一对比的格局是明确无误的,而做预算依据的正是这一格局。

有一点值得提醒任何认真为此建模的人:阿里云已将其新加坡节点的实时转写计费从按时长计量改为按 token 计量,价格为每百万输入 token 0.93 美元、每百万输出 token 0.70 美元。当你无法控制一段给定音频会变成多少 token 时,按 token 计费比按时长计费更难预测,而且噪声、静音和多轮上下文都会推高 token 消耗量。70% 的名义降幅并不会自动转化为你特定流量上 70% 的节省。

如何真正运行交换机

如果你正在评估这件事,真正有用的是了解迁移会耗费你多少工程时间。这两个模型都是闭源托管 API,因此无论选哪个,你都是针对 HTTP 端点进行集成,而要做的工作无非是一个客户端、一套重试策略和一份音色清单——而不是架构重构。

这正是 OrcaRouter 的定位能发挥作用的地方,但首先得说一个诚实的提醒:我们并不路由 Qwen-Audio-3.1-TTS 或任何 Qwen-Audio 模型。阿里巴巴的语音端点不在我们的覆盖范围内,ElevenLabs 也是如此。我们覆盖的是它们周边的推理层——一个 API 密钥即可调用 200 多个文本模型,且零加价,也就是说,直接按供应商的标价透传,因此厂商降价当天我们这边就会生效,而不是等一个重新定价周期之后。对于构建那个应用的团队来说,驱动语音流水线——摘要器、脚本生成器、内容规划器——这意味着只需一份合同,而不是好几份,上游服务降级时自动故障转移,以及一套路由 DSL,可将多个模型组合成单次调用。这并不意味着你可以通过我们调用 Qwen 的语音。谁要是告诉你不是这样,那他肯定没看过产品目录。

谁该动,谁该等

立即行动——如果你的工作负载以中文为优先,如果方言覆盖列在你的需求清单上,如果规模成本正是让你一直停留在更便宜却更差语音上的制约因素,或者如果你需要同一个品牌语音在语言切换后依然保持一致。9月23日的定价让这笔经济账难以反驳,而中文质量在此之前就已颇具竞争力。

等等如果你的产品需要以超过约十六种语言发布,如果你依赖的是可授权的语音库而非克隆,如果你深度使用某个平台的配音或智能体工具,或者你的采购流程要求在最终批准前获得独立的质量评分。这些都不是永久的障碍,但降价并没有解决其中任何一个问题。

特别要留意一件事:Qwen-Audio-3.1-TTS 是否会出现在盲听竞技场上。一旦它出现,这场比较就不再关乎价格和语言数量,而开始关乎更便宜的声音是否真的同样出色。这正是这次发布没有回答的问题。