
Qwen-Audio-3.1 对决 ElevenLabs:降价 70% 迎战行业老牌
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
该厂商于2026年9月23日将其Qwen-Audio-3.1-TTS API的价格下调了约70%,并在杭州云栖大会上与其他四款语音模型一同登台宣布。仅凭这一个数字,这次对比就值得一写:ElevenLabs Eleven v3一直是大多数西方团队默认的生产级语音方案,实际费率接近每百万字符100美元,而一个可信的挑战者刚刚以低得多的价格重新为同样的工作定价,同时还扩大了语言覆盖范围。这两个系统并不对等——Qwen-Audio-3.1-TTS是来自该厂商通义实验室的纯托管API,语音生态较小,而ElevenLabs是一个完整的内容平台,拥有业内最丰富的语音库。但如果你的决策曾经是由账单决定的,那么这周,算术变了。
9月23日究竟发布了什么
Qwen-Audio-3.1 并非单一模型。它是对阿里巴巴整个语音技术栈的一次五模型更新,而这些层级很重要,因为它们具有不同的定价和不同的用途:
• Qwen-Audio-3.1-TTS——大多数团队所用合成模型的直接继任者。新增七种语言,共计 16 种,保留 20 个中文方言区,新增自然的跨语言音色迁移(同一音色可贯通普通话、粤语、英语、日语),支持基于指令的情绪、语速和表达风格控制,并能处理带噪、有回声或其他质量欠佳的参考音频,无需单独的降噪模式。
• Qwen-Audio-3.1-TTS-Next——一个全新的档位,也是一款不同的产品。阿里巴巴将其称为“Audiogen”模型:它能根据文本、时间戳和参考音频,一次性生成人声、音效和背景环境声。支持多说话人对话、播客、影视声景,输出为 48 kHz。根据阿里云 Model Studio 文档,它最多可接收 3,000 个字符的输入,生成的音频播客最长 240 秒、其他情况最长 120 秒,运行速率为每秒 3 次请求,并返回 WAV、MP3 或 PCM 格式。
• Qwen-Audio-3.1-ASR、Qwen-Audio-3.1-ASR-Next和Qwen-Audio-3.1-Realtime——分别对应语音识别、音频理解(情绪、音乐、环境声、事件定位)以及全双工对话。Realtime 正是阿里巴巴正在推向硬件的那一个:Qwen Office、Qoder、QwenNote A2、QwenNote Eva 桌面机器人和 Qwen AI 眼镜。
此次降价覆盖了整条产品线,而不仅限于 TTS:语音合成降幅约 70%,实时降幅约 85%,识别降幅高达 95%。阿里巴巴还开源了 Qwen-Audio-Agent——一个用于构建实时语音智能体的框架,并首次推出 Qwen3.8-LiveTranslate,将延迟压缩至 2.5 秒以内。

记分牌

• 价格—— Qwen-Audio-3.1-TTS:比上一代 Qwen-Audio 低约 70%,上一代的 3.0 Plus 档位约为每 100 万字符 27.60 美元,Flash 档位约为 15 美元。ElevenLabs Eleven v3:据 Artificial Analysis 统计,约为每 100 万字符 100 美元,Flash 约为 50 美元。
• 语言 — Qwen-Audio-3.1-TTS:16 种语言,外加 20 个中文方言区。ElevenLabs Eleven v3:74 种语言。
• 权重——Qwen-Audio-3.1-TTS:闭源,仅托管于阿里云百炼平台。ElevenLabs Eleven v3:闭源,仅提供托管服务。
• 语音库 —— Qwen-Audio-3.1-TTS:原生克隆加上跨语言音色迁移;没有可比的公开市场。ElevenLabs:业内最大的共享语音库,并且可从约 30 秒音频实现即时克隆。
• 演绎控制 — Qwen-Audio-3.1-TTS:基于指令的情感、语速与风格,继承了 3.0 引入的 86 个内联演绎标签。ElevenLabs Eleven v3:音频标签,以及周边平台(配音、智能体、工作室)。
• 独立基准测试 — Qwen-Audio-3.1-TTS:暂无。ElevenLabs Eleven v3:截至 2026 年 8 月,在 Artificial Analysis 的 Provider Voice Arena 排行榜上获得 1,168 Elo 分。
在挑战者真正胜出的地方
三件事,其中只有一件是价格。
价格,显然。 相比每百万字符 100 美元的现有方案,70% 的降幅可不是四舍五入的零头。它决定了你手里的是拿来打样的产品,还是能交付给每一位用户的产品。如果你在批量生成旁白,每年省下的这笔钱并不是需要你在内部据理力争的预算条目——它自己就会说话。
中文,毫不含糊。二十个中文方言区,是一道 ElevenLabs 所提供的任何东西都远不能及的护城河。如果你的产品服务于中国大陆用户、粤语使用者,或是在句中来回切换语言的离散受众,那么这场比较还没开始就已经结束了。
跨语言音色迁移。Qwen-Audio-3.1-TTS 能将一种声音自然地带到普通话、粤语、英语和日语之中。这是一项有着特定用例的具体能力——一个在语言切换后依然保持一致的品牌声音——对于要为单一主播进行本地化、而不是为每个市场重新选角的人来说,它是一项真正的差异化优势。
ElevenLabs 仍然胜出的地方,而且差距悬殊
语言覆盖面是首要的,也是最大的。七十四种语言对十六种,这不是靠一份定价公告就能弥合的差距。如果你要发布波兰语、土耳其语、越南语和葡萄牙语版本,ElevenLabs 今天就能覆盖,而 Qwen-Audio-3.1-TTS 还做不到。
第二个是生态系统。ElevenLabs 不是一个合成端点;它是一个内容平台。一个可授权使用而非克隆的共享语音库、配音工作流、智能体基础设施、一款工作室产品、以及一个有文档记录、背后有多年客户端库积累的 API 接口。从中迁移出去是一个项目,而不是一次配置更改,那些基于它构建的团队清楚地知道自己将会放弃什么。
第三点更难以命名,但无论如何都值得命名:对单一英语音色的自然度感知。Qwen 的语音合成历来在中文上表现出色,而在英语上则仅仅是相当好;尽管 3.1 版本声称改进了多语言表现,但目前还没有针对新模型的独立听测。任何告诉你他们知道新的 Qwen 语音在英语中听起来如何的人,都是在猜。
这个数字,暂时谁都不该引用
这是整个故事中会在报道里被歪曲的那部分,所以这里直白地说出来。Qwen-Audio-3.1-TTS没有任何独立基准测试得分。它的前代 Qwen-Audio-3.0-TTS-Plus 截至 2026 年 8 月中旬在 Artificial Analysis 的 Provider Voice Arena 排行榜上为 1,234 Elo,位列该榜第二至第五名之间。Qwen-Audio-3.1-TTS 尚未被加入任何竞技场。阿里巴巴发布材料中的每一项质量声明都出自厂商自报,且未经复现。
这并不会让这些说法变成假的。它只是让它们未经证实,并且这意味着,眼下对这场对比的诚实表述是:一个模型有价格却没有分数,另一个模型有分数但价格高得多。任何比这更强的说法,都不过是披着基准测试外衣的猜测。

同样的纪律也适用于延迟。阿里巴巴针对该系列 ASR 一侧宣传的首令牌数据——92 毫秒——来自该公司自己在 0.6B 规格上的高并发基准测试,而非第三方测试;自发布以来发表的分析指出,ASR 和 TTS 是流水线中的独立产品,而不是一个端到端模型,并且社区报告称,在伪流式模式下,长对话中延迟会不断累积。请将这一整个系列中厂商给出的延迟数字视为上限,而不是实测体验。
降价在实践中意味着什么
以一个现实的工作负载为例:一个产品每月要用英语和普通话合成 2000 万字符的旁白。按照 ElevenLabs Eleven v3 大约每百万字符 $100 的价格,这大约是每月 $2,000,即每年 $24,000。按照 Qwen-Audio-3.0-TTS-Plus 大约每百万 $27.60 的价格,同样的用量已经是每月约 $552。把 Alibaba 在 9 月 23 日宣布的约 70% 降价算进去,同样的工作负载每月就降到了数百美元的低位。
那些数字都不是可以拿来签约的标价——ElevenLabs 通过订阅层级以积分计费,而阿里巴巴的降价是按百分比削减,且各地区、各层级的费率各不相同。但这一对比的格局是明确无误的,而做预算依据的正是这一格局。
有一点值得提醒任何认真为此建模的人:阿里云已将其新加坡节点的实时转写计费从按时长计量改为按 token 计量,价格为每百万输入 token 0.93 美元、每百万输出 token 0.70 美元。当你无法控制一段给定音频会变成多少 token 时,按 token 计费比按时长计费更难预测,而且噪声、静音和多轮上下文都会推高 token 消耗量。70% 的名义降幅并不会自动转化为你特定流量上 70% 的节省。
如何真正运行交换机
如果你正在评估这件事,真正有用的是了解迁移会耗费你多少工程时间。这两个模型都是闭源托管 API,因此无论选哪个,你都是针对 HTTP 端点进行集成,而要做的工作无非是一个客户端、一套重试策略和一份音色清单——而不是架构重构。
这正是 OrcaRouter 的定位能发挥作用的地方,但首先得说一个诚实的提醒:我们并不路由 Qwen-Audio-3.1-TTS 或任何 Qwen-Audio 模型。阿里巴巴的语音端点不在我们的覆盖范围内,ElevenLabs 也是如此。我们覆盖的是它们周边的推理层——一个 API 密钥即可调用 200 多个文本模型,且零加价,也就是说,直接按供应商的标价透传,因此厂商降价当天我们这边就会生效,而不是等一个重新定价周期之后。对于构建那个应用的团队来说,驱动语音流水线——摘要器、脚本生成器、内容规划器——这意味着只需一份合同,而不是好几份,上游服务降级时自动故障转移,以及一套路由 DSL,可将多个模型组合成单次调用。这并不意味着你可以通过我们调用 Qwen 的语音。谁要是告诉你不是这样,那他肯定没看过产品目录。
谁该动,谁该等
立即行动——如果你的工作负载以中文为优先,如果方言覆盖列在你的需求清单上,如果规模成本正是让你一直停留在更便宜却更差语音上的制约因素,或者如果你需要同一个品牌语音在语言切换后依然保持一致。9月23日的定价让这笔经济账难以反驳,而中文质量在此之前就已颇具竞争力。
等等如果你的产品需要以超过约十六种语言发布,如果你依赖的是可授权的语音库而非克隆,如果你深度使用某个平台的配音或智能体工具,或者你的采购流程要求在最终批准前获得独立的质量评分。这些都不是永久的障碍,但降价并没有解决其中任何一个问题。
特别要留意一件事:Qwen-Audio-3.1-TTS 是否会出现在盲听竞技场上。一旦它出现,这场比较就不再关乎价格和语言数量,而开始关乎更便宜的声音是否真的同样出色。这正是这次发布没有回答的问题。
