一张为“Gemini 3.8 TTS vs Gemini 3.1 Flash TTS”生成的主视觉卡片,白色背景,配有柔和的蓝青渐变点缀。左侧卡片“Gemini 3.1 Flash TTS”列出了 Elo 1,199、3,430 个样本、7 个 arena 音色以及 2026 年 4 月;右侧卡片“Gemini 3.8 Flash TTS”列出了 Elo 1,260、1,999 个样本、8 个 arena 音色以及 2026 年 9 月。页脚一行文字为“Elo 依据 Artificial Analysis Provider Voice Arena,2026 年 9 月。”OrcaRouter 标志合成于右下角。
Engineering & Research

Gemini 3.8 TTS 与 Gemini 3.1 Flash TTS:这个家族中真正存在的唯一差距

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

在同一个模型家族内升级通常是容易的决定,而这一次却有个小波折,让它没那么简单。 Gemini 3.1 Flash TTS——在厂商的 API 上仍被标注为预览版——在 Artificial Analysis Provider Voice Arena 中位列第 10,Elo 为 1,199,区间为 12 点。 Gemini 3.8 Flash TTS于 2026 年 9 月 23 日发布,位列第 2,Elo 为 1,260,区间为 17 点。这是 61 点的提升,而且与榜单上大多数差距不同,它经得起误差范围的检验:3.1 的区间为 1,187 至 1,211,3.8 的为 1,243 至 1,277,两者之间有 32 点的空白区。质量上的升级是实打实的。奇怪的地方在于价格。

A generated two-column scoreboard for Gemini 3.1 Flash TTS and Gemini 3.8 Flash TTS — 3.1 at Arena Elo 1,199, $20.00 per 1M audio tokens, 7 arena voices, 3,430 samples and an April 2026 release; 3.8 at Elo 1,260, $9.00 per 1M audio tokens, 8 arena voices, 1,999 samples and a September 2026 release — over the footer 'Prices per Google; Elo per Artificial Analysis, Sept 2026.'

谷歌自己的价目表显示,音频输出费率从 3.1 的每百万 token 20.00 美元降至 3.8 的 9.00 美元——降幅达 55%。Artificial Analysis 将同样这两个模型归一化为每百万字符分别 18.30 美元和 33.00 美元,结论却恰恰相反。两组数字都已公开发布;二者都没有错;它们衡量的是不同的东西,而对于任何计划迁移的人来说,厘清二者之间的对应关系正是这一对比中最有用的部分。

升级实际上改变了什么

3.8 代并非一次重新调校。三处表面发生了实质性变化。

• 音色数量与音色创建 — 3.1 Flash TTS 随附了一套预构建音色。3.8 Flash TTS 随附 30 种预构建的录音棚音色,包括 Kore 和 Puck,此外还支持根据自然语言描述进行音色设计,以及基于 30 秒样本进行音色复刻,并配有同意验证、输出内容上的 SynthID 水印和 C2PA 凭证。音色混音被列为“即将推出”,而非已发布。

• 演绎控制——逐行指导、单次调用内的双说话人场景调度,以及直接写入脚本的非语言提示,如 <laughs><sigh><gasp>|mhm||yeah|Google 的发布材料声称,相较 3.1,其在长文本一致性和双说话人剧本控制方面有所改进。这只是厂商的说法,背后没有任何公开的运行结果作为支撑。

• 语言覆盖范围 — Flash TTS 支持 130 种语言,Flash-Lite TTS 支持 101 种语言,均可从文本中自动检测。3.1 Flash TTS 公布的覆盖范围较低。

结构性变化在于这次拆分。3.1 Flash TTS 并没有唯一的继任者;它有两个,而 Google 的文档将 Flash-Lite TTS 定位为“主力替代品”。这一点很重要,因为它意味着迁移是一个层级决策,而不是版本升级。更便宜的那一档并不是你现有产品的更新版本——而是曲线上的另一个点。

为什么价格下跌了,而排行榜却显示它上涨了

从 Google 发布的内容开始,因为那才是你实际会被计费的部分。

Gemini 3.1 Flash TTS Preview — 文本输入每百万 token 1.00 美元,音频输出每百万 token 20.00 美元。批量为 0.50 美元和 10.00 美元。

• Gemini 3.8 Flash TTS 标准版 — 2026 年 12 月 31 日前为 $0.50 和 $9.00,之后为 $1.00 和 $18.00。Batch 和 Flex 为 $0.25 和 $4.50。Priority 为 $0.90 和 $16.20。

• Gemini 3.8 Flash-Lite TTS 标准版 — 即日起至 2026 年 12 月 31 日为 $0.50 和 $6.00,之后为 $1.00 和 $12.00。Batch 和 Flex $0.25 和 $3.00。Priority $0.90 和 $10.80。

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

仅就音频输出这一项而言,3.8 Flash TTS 定价 $9.00,而 3.1 为 $20.00,降幅达 55%;3.8 Flash-Lite TTS 只需 $6.00,降幅为 70%。即便按促销结束后的 $18.00 计算,Flash TTS 仍低于它所取代的模型。这才是会落到账单上的数字,而且毫不含糊。

现在来看排行榜。Artificial Analysis 发布了一个按每百万字符计算的数值,以便让采用不同计费单位的模型能够并排排名;对于这对模型,它给出的价格是 3.1 Flash TTS 为 18.30 美元,3.8 Flash TTS 为 33.00 美元。单看这个数字,这意味着这次升级的价格几乎翻了一倍。

调和之处在于,按字符计的费率是一种换算,而不是价格,而且这两个模型的换算系数并不相同。将音频 token 转换为字符,既需要假设语速,也需要假设音频 token 的比率——Google 按每输出一秒 25 个 token 来计量音频——还需要选择以哪个服务层级作为归一化基准。如果榜单以促销后的 $18.00 费率将 3.8 归一化,却以其自身的 $20.00 将 3.1 归一化,那么两者已经足够接近,以至于假设的每字符秒数上的任何差异都会主导结果。建立在宽松语速假设之上的按字符计费率,会偏袒它所适用的模型。

因此,实用建议是:做预算时使用 Google 的 token 费率,而排行榜的字符费率只用于该排行榜以相同方式测量的模型之间的比值。不要把两者混用,也不要把从 $18.30 到 $33.00 的变化说成涨价——那是两个模型并不共享同一种归一化所产生的假象。

真正的迁移成本是另一回事,那就是促销窗口期。两个新档位在 2026 年 12 月 31 日之前均按半价计费,到 1 月 1 日翻倍。按 9 月的数字做规划、11 月才执行的迁移,将在第一季度重新定价。Flash TTS 在 2027 年 1 月的价格——每百万音频 token 18.00 美元——仍低于 3.1 的 20.00 美元,因此促销期过后降价是真实存在的,只是幅度远小于今天看起来的样子。

质量提升,以及并非其背后的因素

竞技场 Elo 是这里唯一一个由供应商以外的人收集的数字,也是唯一一个超出自身误差条的数据。相距 61 分,从 1,199 到 1,260;3.1 上有 3,430 个样本,3.8 上有 1,999 个样本,且竞技场声音为 7 对 8。较新模型上的样本数更低,这使其区间更宽,但即便如此,两个范围仍不相接。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing the top rows with Cartesia Sonic 3.6 first at Elo 1,273, Google's Gemini 3.8 Flash TTS second at 1,260, Alibaba's Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google's Gemini 3.1 Flash TTS tenth at 1,199 across 3,430 samples.

它背后没有的是:除 arena 之外的任何独立基准测试。Google 发布时给出的数字——在 Hume AI Voice Design Benchmark 上以 71.4 排名第一,在口音建模上以 60.8 排名第一,在 Hume Overall Quality Index 上 Flash 和 Flash-Lite 分别位列第一和第二,以及在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语中声称的盲测偏好名列前茅——都是厂商在引用第三方的基准测试。底层的运行记录并不公开。应把它们读作主张:方向与 arena 结果一致,但不会为其增加独立权重。

弃用问题,以及迁移清单

Google 尚未公布 Gemini 3.1 Flash TTS Preview 的停用日期。它表示 Flash-Lite TTS 被定位为其主力替代品,这种措辞通常是弃用通知的前奏,而非后续。如果你仍在使用预览版模型,正确的解读是你需要规划迁移,而不是赶一个截止日期——而且,对于一个替代品已经在 Elo 评分上领先 61 分的模型来说,等待截止日期是错误的策略。

• 查看您的工作负载需要哪个层级。Flash TTS 支持 130 种语言和完整的交付范围;Flash-Lite TTS 支持 101 种语言,每百万音频 token 收费 $6.00。语言列表才是分界线,而不是质量。

• 按照 2027 年 1 月的费率重新定价,而不是促销费率。Flash TTS 上每百万音频令牌 18.00 美元,Flash-Lite 上为 12.00 美元。

• 判断该任务是否可以批处理。Batch 和 Flex 会将两个层级的音频费率减半——每百万 token 4.50 美元和 3.00 美元。任何非交互式的内容都不应放在 Standard 层级上。

• 重新检查所有依赖该语音集的内容。默认目录包含 30 个预置语音;你在 3.1 上使用的语音可能需要重新创建,可通过语音设计或 30 秒复刻样本完成。

• 重新核查请求构造方式。3.8 模型并未公布单次请求的字符数上限,而且音频是按秒而非按字符计费的,因此一段较长的语音,实际费用会高于按字符估算的报价。

• 规划自定义语音的生命周期。每个项目 200 个有状态语音,有效期为一年;或者使用无状态的 voicekey_... 句柄,这些句柄将在七天后过期。

在你做决定的同时运行两者

同一系列内的升级、促销到期,再加上归一化上的分歧,正是不能一步切换的典型情形。OrcaRouter 目前路由的是较旧的模型——models/google/gemini-3.1-flash-tts-preview就在我们的模型列表中——因此你可以在它旁边把新模型搭起来,在把生产路径切过去之前用自己的流量做对比。我们不托管 Gemini 3.8 TTS 端点;那些来自 Google 自己的 API。我们提供的是一个密钥覆盖 200+ 个模型,按提供商标价、不加价,因此供应商的价格变动当天就会反映到你的账单上,而不是等到续约时;以及自动故障转移,让全新的模型成为你可以放心尝试的东西,而不必把面向客户的路径押在它上面。

值得关注的是,Google 是否会为 3.1 Flash TTS 预览版标注日期。那一行文档对一份迁移计划来说,比本文中的任何基准测试都更有价值,而它至今尚未被写出来。