为"Gemini 3.8 TTS vs Qwen Audio 3.0 TTS"生成的主视觉卡片,白色背景,点缀柔和蓝青渐变。左侧卡片"Qwen-Audio-3.0-TTS-Plus"列出 Elo 1,259、15 种竞技场音色、16 种语言 + 20 种方言,以及每百万字符 $27.6;右侧卡片"Gemini 3.8 Flash TTS"列出 Elo 1,260、8 种竞技场音色、130 种语言,以及每百万字符 $33.0。页脚一行文字为"Elo per Artificial Analysis Provider Voice Arena, Sept 2026."。OrcaRouter 徽标合成于右下角。
Engineering & Research

Gemini 3.8 TTS vs Qwen Audio 3.0 TTS:两种不同的“听起来对”的答案

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

在 Artificial Analysis Provider Voice Arena 上,这两个模型之间仅相差一个 Elo 分,而它们取得这一成绩靠的是解决截然不同的问题。 Qwen-Audio-3.0-TTS-Plus位列第 3,Elo 为 1,259,基于 1,447 个样本和 15 个竞技场音色,于 2026 年 9 月发布,标价为每百万字符 27.60 美元。 Gemini 3.8 Flash TTS位列第 2,Elo 为 1,260,基于 1,999 个样本和 8 个竞技场音色,于 2026 年 9 月 23 日发布,标价为每百万字符 33.00 美元。二者在统计上难分伯仲,价格却相差百分之二十,并且建立在关于什么才让合成语音出色的截然相反的理论之上。

理论才是有意思的地方。通义千问的答案是内联控制:86 个投递标签,你把它们撒在文本中,让模型知道在哪里换气、重读、转换语域。谷歌的答案则是一个方向层:逐行指令、双说话人编排,以及一小组非语言提示。如果你已经搭建了一条输出类 SSML 标注的流水线,那么这两者中会有一个适配、另一个不适配,而这种兼容性比单个 Elo 分数更重要。

这两个实际上在董事会中处于什么位置

诚实地解读 Provider Voice Arena,需要看的是区间,而不是排名。

• Qwen-Audio-3.0-TTS-Plus — 排名第 3,Elo 1,259,1,447 个样本,15 个竞技场音色,2026 年 9 月,每 100 万字符 27.6 美元。

• Gemini 3.8 Flash TTS — 排名第 2,Elo 1,260,1,999 个样本,8 个竞技场语音,2026 年 9 月,每 100 万字符 $33.0。

• Cartesia Sonic 3.6 — 排名第 1,Elo 评分为 1,273,共 1,757 个样本,8 种竞技场语音,2026年8月,每百万字符 $49.0。

前三名属于同一档。前两名公布的区间向两侧各延伸十七分,这比第一名与第三名之间的整体差距还要宽,因此它们之间的排序并不能作为稳定证据。这个榜单确实能证明的是:这三者都处于领先集团,而且它们下方没有任何一个接近——排名第 10 的 Gemini 3.1 Flash TTS 为 1,199。

唯一值得注意的不对称之处是竞技场语音数量。Qwen 派出 15 个语音,而 Gemini 为 8 个,因此 Qwen 的分数是对该厂商自家产品更广泛样本的平均值。这有利有弊:它能更公平地估计 Qwen 整体产品目录的声音表现,同时也让 Qwen 有更多机会派上一个拉低平均分的弱语音。无论哪种解读,都不会改变两者打平的结论。

A generated two-column scoreboard for Qwen-Audio-3.0-TTS-Plus and Gemini 3.8 Flash TTS — Qwen at Arena Elo 1,259, $27.60 per 1M characters, 15 arena voices, 16 languages and inline-tag style control; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 8 arena voices, 130 languages and a direction layer — over the footer 'Per Artificial Analysis Provider Voice Arena, Sept 2026.'

86 个配送标签对照方向图层

这是实质性差异,它决定了大多数集成的结果。

Qwen-Audio-3.0-TTS 内置 86 个行内演绎标签——这些嵌入文本中的标注用于控制某个片段如何被朗读。这是一种标记式方法:你的脚本本身就承载了表演。任何用过 SSML 的人对此都不会陌生,而且它能与以编程方式生成文本的工具良好配合,因为其控制入口是字符串变换,而非 API 调用。

Gemini 3.8 Flash TTS 走的是另一条路线。你像指导演员那样指导一句台词——语速、重音、情绪基调——以单独的指令形式给出,而不是内联标记。双人对话的场景可以在单次调用中编排完成。此外,还有一小组非语言提示直接写入脚本:<laughs><sigh><gasp> 作为内联提示,另外还有 |mhm||yeah| 用于附和声。

所以两个模型都接受文内标注;区别在于词表的大小,以及其余控制所在的位置。Qwen 的更广、更扁平——86 个标签,全都在文本里。Google 的在文本内更窄,在文本外更宽,把表达指导和说话人编排作为调用级参数。如果你要移植一个已经会输出丰富内联标记的系统,Qwen 的移植量更小。如果你无论如何都要在应用代码里构建指导逻辑,Google 的这种拆分更清晰。

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

语言覆盖与方言覆盖对比

覆盖率数字不具可比性,简单地将它们进行比较是错误的。

Gemini 3.8 Flash TTS 覆盖 130 种语言,可从文本中自动检测;Flash-Lite TTS 覆盖 101 种。这种横跨各语系的广度,正是本地化流程所需要的——它得触达长尾市场。

Qwen-Audio-3.0-TTS 覆盖 16 种语言以及 20 个汉语方言区。这是同一语系内部的深度。20 个方言区并非像看上去那样,是一个比 130 种语言更小的数字——它是一种不同类型的说法,而对于一款服务中国大陆各地区中文用户的产品来说,它是更有用的那一个。一个支持 130 种语言却只有一种普通话音色的模型,无法像拥有 20 个方言区的模型那样服务四川用户。

哪个更重要完全取决于你的受众。如果你的需求是“在二十个市场至少说得过去”,选Gemini。如果是要“在中国市场真正做得对”,选Qwen。

价格,以及每个字符的数字所隐藏的东西

• Qwen-Audio-3.0-TTS-Plus — 在排行榜的归一化基准上为每 100 万字符 $27.60;Flash 变体约为每 100 万字符 $15,并宣称首包延迟约为 300 ms。

• Gemini 3.8 Flash TTS — 每 100 万个规范化字符 $33.00;由 Google 计费:截至 2026 年 12 月 31 日,输入文本 token 每百万 $0.50,输出音频 token 每百万 $9.00,此后分别为 $1.00 和 $18.00。

• Gemini 3.8 Flash-Lite TTS — 每100万个归一化字符22.10美元,Elo为1,235,排名第6;每百万音频token计费6.00美元,有效期至2026年12月31日。

两个每字符数字均为 Artificial Analysis 的归一化结果,而非厂商标价——Qwen 通过阿里云模型工作室计费,Google 则按 token 计费,两者均未公布这些模型的每字符费率。这些数字应仅用于比较比率(Qwen 大约占优 1.2 倍),而非作为报价引用。

各档位的形态各不相同。Qwen 分为 Plus 和 Flash,其中 Flash 档位以牺牲质量为代价,换来约 300 毫秒的首包时延宣称。Google 则分为 Flash 和 Flash-Lite,再进一步细分为 Standard、Batch 和 Flex,以及 Priority——在 Flash TTS 上每百万音频 token 分别为 4.50 美元、9.00 美元和 16.20 美元。Google 的模式奖励你对工作负载进行分类;Qwen 的模式则奖励你预先选定质量档位。

可用性是另一个真正的区别。Gemini 3.8 Flash TTS 已在 Gemini Developer API 上正式开放使用。Qwen-Audio-3.0-TTS 是闭源的,且仅提供托管服务,通过 Alibaba Cloud Model Studio 提供,没有开放权重。如果你需要自己运行模型,这两者都不适合你——但如果你的基础设施已经部署在阿里云上,那么 Qwen 模型就是那个无需再操心出站流量问题的选择。

双方的供应商主张

除了竞技场之外,这两个模型都没有独立的基准测试,而且两家厂商发布的说法都应被如此标注。

谷歌的 Gemini 3.8 Flash TTS:在 Hume AI 语音设计基准上以 71.4 位居第一,在口音建模上以 60.8 位居第一,在 Flash 和 Flash-Lite 的 Hume 总体质量指数上分别位列第一和第二,并宣称在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语中获得盲测偏好排名前列。这些运行结果未公开。

阿里巴巴方面,针对 Qwen-Audio-3.0-TTS:86 种标签的演绎系统、20 个方言区域,以及 Flash 变体上约 300 毫秒的首包数据。同样未能复现。

竞技场 Elo 是本文中唯一独立收集的质量数据,它表明两者在排行榜上并列第一。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing Cartesia Sonic 3.6 at rank 1 with Elo 1,273, Gemini 3.8 Flash TTS at rank 2 with 1,260 across 1,999 samples, Qwen-Audio-3.0-TTS-Plus at rank 3 with 1,259, 1,447 samples, 15 arena voices and $27.6 per 1M characters, and ElevenLabs Eleven v3 at rank 17 with 1,167.

Gemini 增加了哪些 Qwen 所没有的内容

语音创建是最明显的差距。Gemini 3.8 Flash TTS 支持根据自然语言描述进行语音设计,以及基于 30 秒样本的语音复刻,并带有同意验证,输出还附带 SynthID 水印和 C2PA 凭证。自定义语音有两种形式:每个项目 200 个有状态语音,有效期为一年;或由 voicekey_... 句柄寻址的无状态语音,七天后过期。语音重混功能已列为即将推出。

输出格式控制是第二点。在一元端点上使用 WAV 24 kHz 单声道 16 位有符号 PCM,在流式端点上使用无头 PCM(audio/l16),另外还支持 audio/mulaw、audio/alaw 以及可配置的采样率。对于与电话相关的工作,支持 mulaw 可省去一次转码步骤。

该给哪一个打电话

如果您的用户说中文且要求方言覆盖,如果您希望生成器能直接输出丰富的内联标记词汇,或者您已经在使用 Alibaba Cloud 并希望以最短路径获得可用端点,请选择 Qwen-Audio-3.0-TTS。在归一化基准上,它也是两者中更便宜的那个;如果约 300 毫秒的首包延迟可以接受,Flash 变体还会更便宜。

如果你需要的是覆盖多种语言的广度而非单一语言的深度,如果你需要创建或复刻特定音色,如果你需要 mulaw 或 alaw 输出,或者如果"普遍可用而非仅限托管"是一项采购要求,那就选择 Gemini 3.8 Flash TTS。

两者都不是糟糕的选择,也都没有明显更优——而这正是一分之差的 Elo 积分差距所体现的意义。这一决定关乎的是兼容性,而非品质。

这也是为何暂时不要对任何一方押下重注的理由。OrcaRouter 让你用一个密钥即可使用 200 多个模型,按提供商标价、无加价,因此任何一家实验室的费率变动当天就会反映到你的账单上,而不是等到续约时,而且自动故障转移意味着在高负载下失灵的合成端点会切换到另一个,而不是丢弃请求。我们不托管 Qwen-Audio-3.0-TTS——它由 Alibaba Cloud Model Studio 提供服务——我们也不托管 Gemini 3.8 TTS 端点,它们来自 Google 的 API。我们承载的是文本层及其上方的路由层,正是这一点让你可以在做出选择之前,用真实流量同时运行两者一个月。

值得关注的数字是竞技场的下一次修订。Qwen 上有 1,447 个样本,Gemini 上有 1,999 个,两个置信区间仍然足够宽,以至于仅仅一个月的投票就可能将它们区分开来——也可能证实,平局才是答案。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新