
Gemini 3.8 TTS 与 Breeze TTS 2:决定这一局的是许可证,而非排行榜
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
五十六个 Elo 分将 Gemini 3.8 Flash TTS和Breeze TTS 2在 Artificial Analysis Provider Voice Arena 上分开,而且它们并不在彼此的误差范围内:该供应商的模型以 1,260 的 Elo 在 1,999 个样本和 8 个竞技场语音中排名第 2,发布于 2026 年 9 月 23 日;Breeze TTS 2 以 1,204 在 1,390 个样本中排名第 9,发布于 2026 年 8 月。在价格上,排序彻底反转——Breeze 的标价为每百万字符 34.00 美元(经归一化),而 Flash TTS 为 16.50 美元,因此,在排行榜上胜出的模型,在账单上却以大约两倍的差距落败。
如果这就是全部的比较,那它会是一篇短文,而你会根据自己对56分差距的信任程度来做选择。但这两个模型并不是同一类对象。Breeze TTS 2 是一个30亿参数的开源权重模型,你可以下载、检查并自行运行,而它的许可证,结果证明比它在排行榜上的位置更重要。Gemini 3.8 Flash TTS 是一个 API 端点,具备语音设计和双人对话功能,却完全没有权重。在两者之间做选择,其实是一个披着基准测试外衣的许可与部署问题。

每一个到底是什么
先把每个模型的形态弄清楚,再比较数字,因为除了 Elo 之外,它们在几乎每一个维度上都各不相同。
• 分发 — Breeze TTS 2 可下载:权重以 BreezeBlue/Breeze-TTS-2 的名义在 Hugging Face 上发布,并附带 PyTorch 代码。Gemini 3.8 Flash TTS 仅提供 API,可通过 Gemini API 以及 9 月 23 日公告中提及的 Google 渠道访问。
• 规模 — Breeze TTS 2 是一个 3B 参数模型,这正是它能够被自托管的原因。Google 尚未公布任一 Gemini 3.8 TTS 模型的参数数量。
• 语音创建 —— Gemini 3.8 Flash TTS 可依据文字描述进行语音设计,并能根据 30 秒样本复刻语音。Breeze TTS 2 自带一个语音库,厂商声称其数量以千计,还自有一条语音设计路径;该路径下由厂商自报的角色契合度与演绎指导评分均出自 BreezeBlue 自身,并无独立的对应评估。
• 对话 — Gemini 3.8 Flash TTS 在单次调用中即可生成双说话人对话,并支持轮次级风格设定。Breeze TTS 2 是单音色模型;一段对话需要将两次运行结果拼接而成。
• 语言——按供应商的统计,Breeze TTS 2 覆盖 50 种语言。Google 的公告称 Flash 模型涵盖 130 种,但这两个统计口径衡量的并非同一事物,不应被解读为 130 比 50。
• 延迟 — BreezeBlue 声称流式延迟低于 40 毫秒;Google 未公布 Flash TTS 的同类数据。这两个数字均未经过独立验证,而且其中只有一个确实存在。
许可证才是真正的岔路口
这是排行榜无法向你展示的部分,也正是即便两个模型在质量上有所重叠、它们仍然不可互换的原因。
Breeze TTS 2 的权重以 BreezeBlue 研究和非商业许可证发布。同一仓库中的源代码采用 Apache 2.0。这两个事实并列出现在模型卡上,却在大多数报道中被简化成“开源”,而这种错误方向会带来金钱损失:代码采用 Apache 2.0 并不意味着权重也采用 Apache 2.0,该模型的商业使用需经由托管 API,而非自托管检查点。

谷歌这边根本不存在许可问题,因为压根没有什么可授权的。你买的只是推理服务。而你让渡出去的,恰恰是开放权重通常被看中的那些东西——在数据所在之处运行模型的能力,锁定某个版本并长期保留它的能力,以及不再按字符数付费的能力。
所以,诚实的表述框架不是开放与封闭的对立。而是:
• 如果你的部署必须将音频保留在自己的基础设施内,那么这两者中只有 Breeze TTS 2 提供了一条可行路径,而这条路径就是研究许可证。在基于它构建产品之前,请先咨询法律顾问。
如果你的部署环境能够调用 API,许可问题便不复存在,比较就回归到质量、价格和功能——而在这三项中,Flash TTS 有两项领先。
• 如果你想要的是无需沟通就能商用的开放权重,那么这两者都不是那样的模型,而且竞技场里还有其他行。
Elo差距在何时有意义、何时没有意义
56 分的差距超出了榜单为这两行报告的 ±16 和 ±16 置信区间,所以这一排名并不是噪声——不像 Flash TTS 对比 Gemini 3.8 Flash-Lite TTS 那样属于噪声。但竞技场 Elo 只衡量一件事:在盲测对比中,听者更偏好两段音频中的哪一段。它是一种偏好信号,是聚合而来的。
它没有衡量的是生产管线所关心的所有事情。它不会告诉你,两个模型如何处理一段 40 分钟的脚本而不出现身份漂移,如何读出你产品的名称,当输入包含电话号码时它会如何表现,或者当被要求处理其训练之外的内容时,它的失效模式是什么样子。Breeze TTS 2 的 1,390 个样本和 Flash TTS 的 1,999 个样本都足够大,以至于总体结果是稳定的;同时又都足够小,以至于你的用例中没有任何一个单独的片段在其中得到体现。
一旦考虑到每个模型被要求完成的任务,差距也比看上去要小。Flash TTS 是在一次调用中处理两个说话人,这比 Breeze TTS 2 被评分时所面对的任务更难。至于这让那 56 分是被低估还是被高估,取决于你的使用场景,而两家厂商都没有公布足以定论的消融实验。

每项每小时的成本是多少
这两个价格数字并不能直接进行比较,而假装它们可以,是关于这场对决的报道中最常见的错误。
Google 按 token 计费:截至 2026 年 12 月 31 日,文本 token 输入为每百万 $0.50,音频 token 输出为每百万 $9.00,之后为 $18.00。Batch 和 Flex 的价格为 $0.25 和 $4.50;Priority 为 $0.90 和 $16.00。姊妹模型 Flash-Lite TTS 为 $0.50 和 $6.00,之后为 $12.00。
BreezeBlue 按字符计费:通过托管 API,每百万字符 34.00 美元。
Artificial Analysis 将两者都归一化为按每百万字符计算,以便它们能出现在同一个榜单上,而 $16.50 对 $34.00 的对比正是由此而来。这种归一化是榜单方做的,而非任何一家厂商——Google 并未公布 Flash TTS 的按字符费率,而把 $16.50 当作报价而非换算结果,正是人们最终被账单吓一跳的原因。
两个后果值得提前规划:
• Flash TTS 费率将于 2027 年 1 月 1 日翻倍。按促销价编制预算时,与 Breeze TTS 2 的差距大幅缩小;按 18.00 美元编制预算时,差距几乎消失。
• 自行托管 Breeze TTS 2 并不能让它免费,反而会使其成为一项资本成本。3B 模型小到足以在普通硬件上运行,但只有达到一定规模时,这笔账才算得过来,而且仅限于研究许可证允许的用例。
选择,而不假装只有一个答案
决策树很短。
如果你需要双说话人对话,如果你想要一个根据描述设计并以 ID 形式保留的声音,如果你的流水线可以调用 API,并且如果 12 月 31 日的费率变更在你可提前规划的范围内,那就选择 Gemini 3.8 Flash TTS。它在独立榜单上是更好的模型,在账单上也是更便宜的那个,而闭源对于一个本来就要通过 API 调用来实现的使用场景来说并不是问题。
如果数据驻留或本地部署推理是硬性要求,如果你需要一个真正可以下载的 3B 模型,或者你是在做研究而非交付产品——这正是其许可证所针对的场景,那就选择 Breeze TTS 2。不要仅凭 open-weights 标签就选择它;先读许可证。
如果你正在同时评估这两者,最省事的做法就是让这个选择保持可逆。OrcaRouter 并不托管这两款模型——调用 Gemini 3.8 Flash TTS 的地方是 Google 自己的 API 以及 Google 指定的那些入口,而调用 Breeze TTS 2 的地方则是 BreezeBlue 的托管端点。路由器在这里的用武之地是技术栈的其余部分:200 多个模型只需一个密钥即可调用,按提供商标价计费且不加价,因此像一月那次费率上调这样的供应商价格变动当天就会生效,而不必等到下一个计费周期,自动故障转移让正在评估的路径不必同时是生产路径,还有一套路由 DSL,可在单一种声音不够用时把多个模型组合成一次调用。
一句话版本:排行榜说是谷歌,许可证说看情况,而价格说在决定选哪个之前先看看你的日程表。
