一张主视觉卡片,对比 Qwen-Audio-3.0-TTS 与 Qwen-Audio-3.1-TTS,列出旧模型于 2026 年 7 月 20 日发布、Elo 为 1,238、86 个内联交付标签,对比新模型于 2026 年 9 月 23 日发布公告、降价 70% 以及基于指令的控制,两者之间有一个标注为“九周”的箭头。
Guides & Insights

Qwen-Audio-3.1-TTS 与 Qwen-Audio-3.0-TTS:两个月带来了什么

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Qwen-Audio-3.0-TTS 于 2026 年 7 月 20 日发布,并直接登顶独立语音排行榜——Plus 层级在 Artificial Analysis 的 Provider Voice Arena 排行榜上达到 1,238 Elo,位列榜单第二。九周后,也就是 2026 年 9 月 23 日,该厂商在杭州云栖大会(Apsara Conference)上发布了 Qwen-Audio-3.1-TTS,并附带约 70% 的降价。这一时间点让这次比较不同寻常:被替换的模型并未过时,它经过了基准测试、得到验证,并且仍接近榜首。因此,真正的问题不是哪一个更好,而是具体改变了什么,其中是否有任何一点对你的工作负载有影响,以及当后继模型根本还没有被评分时,你已经信赖的那个分数会怎样。

两个月,五个端点,一个家庭

阿里巴巴并没有只发布一款模型。3.1 版本涵盖五款:Qwen-Audio-3.1-ASR、Qwen-Audio-3.1-ASR-Next、Qwen-Audio-3.1-TTS、Qwen-Audio-3.1-TTS-Next 和 Qwen-Audio-3.1-Realtime。对于目前仍在调用 Qwen-Audio-3.0-TTS 的用户来说,其中只有一款可以直接替换——即普通 TTS 档——而另一款则是真正的新产品,而非升级。

第二个模型也值得了解一下,哪怕你从来不会调用它。Qwen-Audio-3.1-TTS-Next 是阿里巴巴所称的“Audiogen”模型:单次推理即可根据文本、时间戳和参考音频一并生成人声、音效与背景环境音。支持多说话人对话、播客拼接、场景音景,48 kHz 输出。阿里云 Model Studio 的文档直白地列出了它的各项限制——输入 3,000 个字符,播客场景生成音频最长 240 秒、其他场景 120 秒,每秒 3 次请求,输出为 WAV、MP3 或 PCM,且最多接受三段各 30 秒的参考音频,格式为 WAV、MP3 或 OGG Opus。不支持原始 PCM 参考输入。在北京节点上,其定价为每百万输入 token 0.848 美元、每百万输出 token 1.696 美元(不含促销价),并且仅支持中文和英文。

如果你使用的是 3.0-TTS,而你的工作是“把这个脚本变成一段语音”,那这些都不会改变你的集成方式。如果你的工作是“用音乐铺底组装一档双主持人播客”,3.1-TTS-Next 属于不同的产品类别,甚至可能正是你关注这个版本的原因。

升级,逐行解读

A two-column scoreboard for Qwen-Audio-3.1-TTS and Qwen-Audio-3.0-TTS across languages, dialects, timbre transfer, delivery control, noisy reference audio and arena score, with a footer stating that the 3.1 figures are vendor-reported and unscored and the 3.0 Plus Elo is per Artificial Analysis.

• 语言 — Qwen-Audio-3.1-TTS:厂商报告支持 16 种语言,较上一代新增七种。Qwen-Audio-3.0-TTS:据 7 月发布的公开报道所列,为 16 种语言。

• 汉语方言 — Qwen-Audio-3.1-TTS:沿用,20 个方言区。Qwen-Audio-3.0-TTS:20 个方言区。

• 跨语言音色迁移 — Qwen-Audio-3.1-TTS:支持,同一音色可在普通话、粤语、英语和日语之间通用。Qwen-Audio-3.0-TTS:不提供。

• 表达控制 — Qwen-Audio-3.1-TTS:基于指令控制情绪、语速和风格。Qwen-Audio-3.0-TTS:86 个内联表达标签。

• 含噪参考输入——Qwen-Audio-3.1-TTS:可直接处理含噪或带回声的参考音频,无需单独的降噪模式。Qwen-Audio-3.0-TTS:需要干净的参考音频。

• 独立评分 — Qwen-Audio-3.1-TTS:暂无。Qwen-Audio-3.0-TTS-Plus:截至 2026 年 8 月,在 Artificial Analysis 的 Provider Voice Arena 排行榜上为 1,238 Elo。

语言数量对不上,而这一点很重要。

这是一件小事,在其他地方都会被轻描淡写地带过去,所以值得指出。阿里巴巴的发布材料称,3.1 TTS 层级新增了七种语言。已发布的关于 7 月发布的 3.0 代的报道——包括我们当月自己的对比文章——列出了 3.0 层级支持 16 种语言。七加十六等于二十三,而不是十六,而且阿里巴巴尚未公布对这两个数字的核对说明。

可能的解释并不光鲜:3.1 的数字可能统计的是另一组语言,3.0 的数字可能在发布时被夸大了,或者“增加七种”可能描述的是 ASR 层级而非 TTS。我们不知道是哪种情况。我们确知的是,这一比较双方的语言数量都是供应商报告的数字,从未经过独立审计;任何将“16 种语言”当作任一模型确凿事实来引用的人,引用的都是营销幻灯片。在围绕某个数量做规划之前,请对照 Model Studio 文档核对你所需的具体语言。

A screenshot of Alibaba Cloud Model Studio's English documentation site with the Speech-to-Speech branch of the navigation open, showing the reference page for qwen3.8-livetranslate-flash-realtime with its model capabilities and context limit tables, under an Apsara 2026 Conference banner.

指令控制才是真正体现在代码中的变化

在 3.1 TTS 版本的所有更新中,这一项会改变你编写提示词的方式。3.0 那一代通过 86 个内联标签来控制表达——这是一套固定的词汇表,你必须学习它、把它插入到正确的位置,而它只会做到字面上所说的,绝不多做一分。3.1 这一层级用自然语言指令取代了它:你描述你想要的情感、节奏和风格,模型会去理解它。

实际差别在于表现力与可预测性之间的取舍。标签词表是一份契约——同一个标签每次都会产生相同的输出,而这正是你在生产流水线中所需要的:一条音色必须在上万条片段中保持一致。自由形式的指令覆盖面更广,但也更松散,并且会带来常见的提示词敏感性问题:“温暖但不煽情”的两种措辞不会得到完全相同的效果,同一措辞在不同时间调用两次也是如此。

如果你的当前流水线建立在那 86 个标签之上,那么升级并不是免费的。你是在用一个确定性的控制面换取一个概率性的控制面,而迁移的工作并不在于 API 调用——而在于对照新模型的解读,重新验证你手里的每一个提示词模板。在为节省做预算之前,先为这件事做预算。

跨语言音色迁移,以及它真正的用途

同一个参考音色,贯穿普通话、粤语、英语和日语,在语言切换之间依然保持同一身份。纸面上看,这像是一条功能卖点。实际应用中,它解决的是一个具体而代价高昂的问题:同一位主播需要在不止一种语言中存在,却不能因此在每种语言里都听起来像另一个人。

传统的变通做法是为每种语言单独聘请一位配音演员,并接受你的品牌声音如今变成了四个共用同一份脚本的声音。另一种选择一直是将同一位说话人克隆到每种语言中,而这恰恰是克隆声音容易发生漂移的工作流程——口音会被带过去,音色会变薄,听众在一句话之内就能察觉。跨语言音色迁移所主张的,正是这两种妥协都不必存在。

而且,眼下它完全未经验证。没有任何第三方针对 Qwen-Audio-3.1-TTS 进行过任何语言的听音测试,而阿里巴巴自家的演示是这种迁移能力成立的唯一证据。如果你考虑升级的原因正是这项能力,那么在决定之前,请用你自己的参考音频测试一下——这是一个五分钟的实验,也是唯一能回答这个问题的实验。

价格下调会如何影响3.0版法案

阿里云全线下调语音价格:语音合成降幅约70%,实时交互降幅约85%,语音识别降幅最高达95%。此次调价于北京时间2026年9月22日00:00在阿里云百炼平台生效,覆盖北京和新加坡地域,适用于3.1 TTS和3.0实时交互端点。调价后,TTS Flash档位刊例价为每百万输入Token 1.5元、每百万输出Token 12元;实时交互Flash档位刊例价为每百万Token文本输入1.5元、音频输入6元、文本输出4.5元、文本与音频合计输出12元。

如果你已经在运行 3.0-TTS,那么真正重要的部分在这里。截至 8 月,3.0 Plus 档位在 Artificial Analysis 上的价格一直接近每百万字符 27.60 美元,而 Flash 档位接近 15 美元。如果约 70% 的降幅适用于你使用的档位,那么在相同工作量下,你的账单将降至原来的约三分之一——而你无需改动一行代码。这就是这次发布的不寻常之处:对于 3.0 客户来说,降价比模型升级更有价值,而且无论你是否迁移,它都会到来。

有两点值得牢记的注意事项。百分比降幅所参照的费率因地域和层级而异,因此标题中的 70% 并不构成对你特定流量情况的承诺。此外,阿里云已将新加坡节点的实时转写计费从按时长计量改为按 Token 计量——每百万输入 Token 0.93 美元、每百万输出 Token 0.70 美元——而当静音、噪声和多轮上下文都会推高 Token 消耗量时,这种计费基础的预测性更差。请对照你自己的音频来审视新的价目表,而不是对着新闻稿。

在哪些场景下 Qwen-Audio-3.0-TTS 仍然是正确的选择

三种情况,而且它们并非边缘情况。

当你需要一个站得住脚的数字时。Qwen-Audio-3.0-TTS-Plus 拥有独立的 Elo 得分 1,238——在同一榜单上,该模型九月的读数为 1,259,依然排名第二,可见这个分数是一路向上漂移,而非衰减——它来自一个背后有数千张投票的盲听竞技场。Qwen-Audio-3.1-TTS 则完全没有竞技场得分。如果你的签核流程需要第三方证据,那么拥有证据的是那个更早的模型,而降价并不能改变这一点。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, ranking text-to-speech models by Elo with vote counts and API pricing: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,259 on a rank range of 2-3, and ElevenLabs Eleven v3 at 1,166.

当确定性胜过表达力时。如果你的生产流水线建立在 86-tag 控制面之上,那么你所拥有的系统,其输出是可以推演的。基于指令的控制能力更强,可预测性却更低,而且迁移成本是实打实的。

当升级中的任何内容都触及不到你的工作负载时。如果你以中等用量合成普通话和英语,使用干净的参考音色和一组固定的表达标签,那么跨语言音色迁移、噪声输入鲁棒性以及另外七种语言,解决的都是一些你并不存在的问题。接受降价,继续用这个模型。

同时运行两者而无需运行两个集成

代际切换中尴尬的一点在于,你往往希望两个模型同时在线——3.0 用于生产路径及其背后的评分,3.1 用于新语言和迁移功能,并且需要一种无需重新部署就能在两者之间转移流量的方式。两者都是 Alibaba Cloud Model Studio 上的封闭式托管 API,因此一个功能背后就是两个端点、两个速率限制和两种故障模式。

关于我们的定位,有一句实话要说:OrcaRouter 不路由 Qwen-Audio-3.1-TTS 或任何 Qwen-Audio 模型,也完全不路由阿里巴巴的语音端点。我们提供的是围绕此类流程的文本推理层——一个 API 密钥覆盖 200 多个模型,0% 加价,供应商目录价直接透传,因此厂商降价当天就能落到我们这边,而不必等一轮重新定价周期。如果驱动你语音流程的服务是脚本生成器、摘要工具或内容规划器,那这意味着只需一份合同,而不是好几份,上游服务降级时自动故障转移,以及一套可将多个模型组合成单次调用的路由 DSL。这并不意味着你可以通过我们调用 Qwen 的语音服务,任何暗示相反说法的页面都是对我们自身目录的错误描述。

诚实的总结

Qwen-Audio-3.1-TTS 是一次实打实的升级,带来了三项重要的新增能力——基于指令的表达控制、跨语言音色迁移,以及对劣质参考音频的鲁棒性——此外还有一次降价,而这次降价的价值超过上述任何一项。Qwen-Audio-3.0-TTS 并没有像通常两个月前发布的模型那样被取代:它仍然保有一项其继任者尚未取得的独立基准分数,也仍然覆盖着这个系列大部分差异化所依赖的中文方言范围。

所以,这个决定比营销所暗示的要更窄。如果你在批量生成,定价调整已经站在你这边。如果你需要新语言或音色转换,先迁移,并用自己的音频验证该功能。如果你需要一个经得起质疑的质量数字,那就等 Qwen-Audio-3.1-TTS 出现在盲听竞技场中——这是唯一能一锤定音的事件,而在它发生之前,诚实的立场是:较新的模型是更便宜的那个,较旧的模型是经过验证的那个。