一张为“Gemini 3.8 Live 对比 Qwen-Audio-3.1-TTS”生成的白色背景主视觉卡片,带有柔和的蓝青渐变点缀。标题下方是两个面板,标题写着“两半,相隔八天刷新”。左侧面板介绍“2026年9月15日 — Gemini 3.8 Live 与 Live API 上的 Extended Thinking”。右侧面板介绍“2026年9月23日 — 云栖大会上的 Qwen-Audio-3.1-TTS,合成缩减约70%”。页脚一行写着“它们在流水线的中段相遇,而非承担同一项任务。”OrcaRouter 标志合成于右下角。
Guides & Insights

Gemini 3.8 Live 对比 Qwen-Audio-3.1-TTS:语音技术栈的两半,相隔八天重新定价

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Gemini 3.8 Live 是 Goog​le 的语音到语音模型,于 2026 年 9 月 15 日发布,gemini-3.8-live和 gemini-3.8-live-extended-thinking在 Live API 上提供。Qwen-Audio-3.1-TTS 是 Aliba​ba 的文本转语音模型,于八天之后的 2026 年 9 月 23 日在杭州云栖大会上发布,并附带约 70% 的语音合成价格下调。这八天的间隔,正是这次对比现在值得一读、而不是等到七月才看的原因。两款产品的角色没有任何改变——一个负责听与说,另一个负责把文字朗读出来——但一条生产级语音流水线的两个半边,都在短短两周内被重建或重新定价,而过去用来判定这场对比胜负的算术,已经悄然改变。

两部分,相隔八天刷新

从让这一组合不同寻常的地方说起:这两个模型并不竞争。一个语音产品有一张嘴,也有一只耳朵,而这两个模型各占其一。Gemini 3.8 Live 完成闭环——音频和视频输入,音频输出,处理打断,并在对话底层运行工具调用。Qwen-Audio-3.1-TTS 接收一个字符串和一段参考语音,返回一段演绎。它作为一张嘴,比作为其他任何东西都更出色,而且它并不想成为一只耳朵。

九月的时机之所以耐人寻味,在于这两则公告瞄准的是同一条预算科目的两端。Google 9 月 15 日的发布是一个关于能力的故事,并未伴随价格调整;Alibaba 9 月 23 日的公告则主要是一个关于利润率的故事,新能力只是顺带出现。一个在八月搭建了混合流水线的团队,在短短八天里就有了重新审视这两条腿的理由——而这两条腿中只有一条变得更便宜了。

3.1 版本在 Qwen 方面实际改变了什么

Aliba​ba 并没有在 9 月 23 日只发布一个模型。3.1 代涵盖五个端点——Qwen-Audio-3.1-ASR、Qwen-Audio-3.1-ASR-Next、Qwen-Audio-3.1-TTS、Qwen-Audio-3.1-TTS-Next 和 Qwen-Audio-3.1-Realtime——而其中只有普通 TTS 层级这一个,对已经在调用 3.0 TTS 模型的人来说是可直接替换的。

在该档位上,有三处变化,其中一处是实实在在的迁移成本。表达控制从 86 个内联标签的固定词表转向自然语言指令:你只需描述想要的情感、节奏和风格,而不再需要在正确的位置插入正确的括号。跨语言音色迁移来了,让一个参考音色能够将其身份特征贯穿普通话、粤语、英语和日语。而且该模型现在可以直接容忍带噪或带回声的参考音频,无需单独的降噪步骤。语言覆盖范围没有变化,仍为厂商声称的 16 种语言加 20 个中文方言区;而——这一点值得点出来,因为它在别处常被一笔带过——阿里巴巴自己的材料称 3.1 档新增了七种语言,这与已公布的 7 月一代覆盖范围所列的 16 种语言对不上。在你对照百炼核实自己所需的具体语言之前,这两个数字都应视为厂商声称。

本次发布中真正意义上的新产品是 Qwen-Audio-3.1-TTS-Next,Alibaba 将其称为“Audiogen”模型:一次生成即可同时产出人声、音效和背景环境声,适用于多说话人对话、播客组装和场景制作。在北京节点上,其标价为每百万输入 token 0.848 美元、每百万输出 token 1.696 美元,输入上限为 3,000 字符,播客生成音频上限为 240 秒,其他场景为 120 秒,每秒三次请求,最多接受三段各 30 秒的参考音频片段。它仅支持中文和英文。如果你的流水线是单一旁白朗读脚本,那这款产品与你无关;如果是两位主持人加一段音乐铺底,那它才是这次发布值得关注的原因。

接缝才是你真正在选择的东西

由于这两个模型并不承担相同的工作,这个决定并非一场同台比拼。真正的问题在于:你把交接点放在哪里,以及为了让这道接缝隐形,你愿意付出多少代价。

有两种诚实的架构。第一种是单一网络:Gemini 3.8 Live 处理整个轮次,听到来电者,决定说什么并说出来,而你接受它给你的声音——你无法克隆,也无法打上品牌。第二种是级联:识别,然后是推理,接着是 Qwen-Audio-3.1-TTS 作为嘴,为你提供上千种声音,包括由你自己的真人录制的那个,代价是跨两三个供应商边界的延迟,以及当一句话被拆分到多个 API 调用时丢失的韵律。

大多数团队最终会两者都用,而这并不是缺乏勇气。在能感受到延迟的地方使用实时模型——打断、回应,以及那声告诉来电者你还在听的“嗯哼”——而在能听出质量的地方使用合成模型:对一项政策的长篇回读、以刻意放慢的语速报出的确认号码,以及必须在每一通电话中都完全一致的品牌语音。对于一大类产品来说,混合方案才是正确答案。也正是在这里,成本模型变得棘手,因为你现在要计量两种不同的单位。

A screenshot of the Artificial Analysis Speech to Speech leaderboard in English, captured 25 September 2026, showing the AA Speech to Speech Index panel with index values of 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with the cost-per-hour-of-input-audio axis running to roughly $10.75. The bar labels are set vertically and are not legible at capture size. No Alibaba Qwen-Audio model appears on the board, because the board scores speech-to-speech models and Qwen-Audio-3.1-TTS is a synthesis model.

按音频定价,这是唯一一个两者都适用的单位

Google 对 Live API 按分钟计费;Alibaba 对 Qwen TTS 各档按字符和 token 计费。要比较二者,就必须选定一个归一化基准;而对语音来说,唯一站得住脚的标准就是成品音频的小时数。

• 按输入计量 — Gemini 3.8 Live 按每音频分钟 $0.005 输入、$0.018 输出计费,对比 Qwen-Audio-3.1-TTS 按百万字符计费,其中 3.0 Plus 档位在降价前接近 $27.60,Flash 档位接近 $15,而 TTS Flash 档位在降价后标价为每百万输入 token 1.5 元、每百万输出 token 12 元
• 按输出计量 — Gemini 3.8 Live 双向对话按标价每小时实际通话时间约 $1.38,未含任何缓存;对比 Qwen-Audio-3.1-TTS 单向流,3.1-Next 档位在北京节点为每百万输入 token $0.848、每百万输出 $1.696
• 能听见来电者 — Gemini 3.8 Live 可以,原生音频与视频输入;对比 Qwen-Audio-3.1-TTS 不可以,文本输入、音频输出
• 音色 — Gemini 3.8 Live 仅一种音色,不可克隆、不可品牌定制;对比 Qwen-Audio-3.1-TTS 一千多种,可从嘈杂参考音频进行零样本克隆
• 语言 — Gemini 3.8 Live 厂商报告 97 种,可在对话中切换;对比 Qwen-Audio-3.1-TTS 厂商报告 16 种,外加 20 个汉语方言区,并支持普通话、粤语、英语和日语之间的音色迁移
• 表达控制 — Gemini 3.8 Live 依靠提示词与对话上下文;对比 Qwen-Audio-3.1-TTS 支持自然语言指令,取代了 3.0 代的 86 个内联标签
• 独立评分 — Gemini 3.8 Live 在 Artificial Analysis Speech to Speech Index 上,Extended Thinking 变体为 82.6,标准版为 76.0;对比 Qwen-Audio-3.1-TTS 无评分;最接近的 Qwen 数字是上一代 3.0 Plus 档位在 Provider Voice Arena 上的 1,259 Elo,这是对前代产品的评分,而非对本模型的评分

这个百分比降幅是相对于因地域和档位而异的费率而言的,所以醒目的 70% 并不是对你实际流量的承诺;而且阿里云还把新加坡节点上的实时转写从按时长计费改成了按 token 计费——这种计费依据更难以预测,因为静音和多轮上下文都会推高 token 消耗。请拿新的价目表对照你自己的音频算一算。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273 with a 17-point interval over 1,757 samples and $49.0 per million characters, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples at $16.5, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259 on 1,447 samples at $27.6, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0. The board scores synthesis models and carries no row for Qwen-Audio-3.1-TTS or for any Gemini 3.8 Live endpoint.

3.1 升级未能解决的

这就是双向都容易搞错的部分。3.1 的改进并不会让 Qwen-Audio-3.1-TTS 成为能胜任 Gemini 3.8 Live 所做工作的候选者——基于指令的控制、音色迁移和对噪声输入的容忍度都让它成为一张更好的嘴,而这些没有一项能给它一只耳朵。同样,Gemini 3.8 Live 的基准测试位置并不能告诉你,你的品牌音色能否在粤语中撑过一句话。

还有一个证据上的漏洞,会让降价显得更诱人、更容易被忽视。Qwen-Audio-3.1-TTS 没有独立的评分。Provider Voice Arena 上 Qwen 名称旁出现的 1,259 Elo 属于 Qwen-Audio-3.0-TTS-Plus,也就是被替换的那个模型,基于 1,447 个样本测得。继任者自己的 Arena 条目尚不存在。如果你的签核流程需要一个第三方数字——对于一个品牌声音来说,这大概应当需要——那么较新的模型正是没有这个数字的那个,而更便宜的层级正是你目前还无法为之辩护的那个。能解决这个问题的单一事件,是 Qwen-Audio-3.1-TTS 出现在盲听榜上。

一个键在何处有帮助、在何处没有帮助

3.1 版本发布带来的一个后果很容易被忽视,因为它看起来更像是提示工程的细节,而不是基础设施层面的问题。用自由形式的指令取代 86 个硬编码标签,会让你的表达指令变成文本产物。现在你需要生成它们、对它们进行版本管理,并针对新模型的解读逐一重新验证——而失效模式是漂移,不是报错,因为“温暖但不煽情”的两种措辞不会产生完全相同的效果。

这是一个包裹在语音流水线之外的文本推理问题,而这正是我们能派上用场的地方。OrcaRouter 不路由 Qwen-Audio-3.1-TTS 或任何 Qwen-Audio 模型,我们也不路由 Gemini 3.8 Live 端点——这一技术栈的两半都无法通过我们调用,此处的任何内容都不应被解读为声称可以。我们真正承载的是编写和校验方向文本的那一层:qwen/qwen3.8-flash 和 google/gemini-3.8-flash,它们属于来自单一密钥、按提供商标价且无加价的 200 多个模型之列,并配有可将多个模型组合进一次调用的路由 DSL,以及在上游性能下降时的自动故障转移。当你准备用某个刚刚改变了对提示词解读方式的模型重新校验一万条配送提示词时,生成变体并为其一致性打分这件事,应该是一份契约,而不是四份。

选择前要衡量什么

三个实验比任何董事会都更能说明问题。拿一个参考声音和你自己脚本中的一段话,通过 Qwen-Audio-3.1-TTS 跑一遍,听听基于指令的控制是否会两次给出相同的表达——这就是迁移风险,而衡量它比围绕它做规划更便宜。拿一段带有你自己背景噪声的真实通话录音,通过 Gemini 3.8 Live 跑一遍,检查当来电者在词中间打断时,轮次转换是否还能保持——这正是语音到语音指数试图量化的东西,而它在与真实电话线路接触时,可靠性不足以让人凭信。并且用音频小时而不是两家供应商开票所用的单位,来对你的用量算一笔账,因为在这一特定组合上,“廉价的中国 TTS”和“Goog​le 旗舰”之间预期的价格差异从来不像看上去那么大,而在 9 月 23 日之后,它还会更小。

A generated summary card for Gemini 3.8 Live vs Qwen-Audio-3.1-TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — speech-to-speech, Live API, 15 September 2026', 'Qwen-Audio-3.1-TTS — text-to-speech, Apsara, 23 September 2026', 'The gap: eight days, and only one of them got cheaper', 'Independent score: Gemini 82.6 on AA Speech to Speech; Qwen 3.1-TTS none', and 'Verdict: not substitutes — pick which half you are shopping for'. A footer line reads 'Vendor-reported figures where stated; independently measured where a board is named.' The OrcaRouter logo is composited in the bottom-right corner.

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新