一张为“Gemini 3.8 TTS:两只鹈鹕,两个模型”生成的主视觉卡片,白色背景,配有柔和的蓝色与青色渐变点缀。三张卡片上分别写着“Gemini 3.8 Flash TTS — Elo 1,260,排名第 2,8 个 Arena 音色,每 100 万音频 token 9.00 美元”、“Gemini 3.8 Flash-Lite TTS — Elo 1,235,排名第 6,每 100 万音频 token 6.00 美元”以及“双说话人对话 — 支持,音色设计,30 秒复刻”。页脚一行写着“Elo 数据来自 Artificial Analysis Provider Voice Arena,2026 年 9 月;标价来自 Google。”OrcaRouter 标志合成在右下角。
Guides & Insights

Gemini 3.8 TTS:两只鹈鹕、两个模型,以及一月翻倍的价格

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

要弄清这家厂商在 2026 年 9 月 23 日发布了什么,最快的办法就是看随之流传的那个演示:两只鹈鹕在争论要不要搬到帕西菲卡码头,每只鸟一个声音,按脚本逐轮对话。Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS正是那个演示背后的两款模型,二者均已在 Gemini API 上正式可用,而这两只鹈鹕绝非噱头。它们是这一代中此前的 Gemini 语音模型完全做不到的第一件事:两个说话人、一次生成,由脚本来控制谁说什么。

价格是故事的另一半,也是两个模型分道扬镳之处。Flash TTS 按每百万文本输入 token 0.50 美元、每百万音频输出 token 9.00 美元计费,该价格持续到 2026 年 12 月 31 日,之后为 18.00 美元;Flash-Lite TTS 按同样的时间表分别为 0.50 美元和 6.00 美元计费,之后为 12.00 美元。这些都是 Google 自己的费率。Artificial Analysis 将其换算为每百万字符的基准,以便与其他所有模型放在同一张榜上比较,结果分别为 16.50 美元和 11.00 美元——Lite 模型大约便宜三分之一,而且两者都远低于该榜单顶部所收取的费用。

所以有趣的问题不在于这些模型是否优秀。而在于你应该基于两者中的哪一个来构建,因为它们之间的差距并不是你从名称上会猜到的那种差距。

9月23日的公告实际包含什么内容

不是两个模型中的一个,而是两个,并且 Google 明确表示它们是两种分立的模型,而非同一个东西的小型版和大型版。公告列出了它们落地的五个地方——Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids——而 API 标识符则很直白:gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts。

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', published September 23, 2026 and credited to Leland Rechis and Alan Cowen, showing the launch announcement for Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS.

功能列表比标题所暗示的更长。以下内容来自 Google 的公告以及 Gemini API 语音生成文档:

• 语音设计——你用文字描述一种声音,然后获得一个自定义语音 ID,而不是从固定列表中选择。

• 语音复刻——30 秒的样本即可生成一个语音 ID,这也是大多数团队实际会用于品牌音色或旁白配音的途径。

• 双人对话——鹈鹕案例。脚本采用的是说话人轮次,而非单一大段散文。

• 轮次级样式设置——文档描述了一种 speech_metadata 注解,它将风格指引附加到特定的轮次上,而不是整个请求上。

• 预置语音,以及可通过 GET /v1beta/voices 访问的扩展语音库。

• {{1}}三种音频编码{{/1}} — {{2}}默认使用 WAV{{/2}},另有 {{3}}mulaw{{/3}} 和 alaw 可供电话类管道使用。

• 仅文本输入,仅音频输出。文档对此毫不含糊:TTS 模型不接受任何其他输入模态,也不产生任何其他输出,并且还有一个单独的“局限性”章节列出了这些限制。

公告里没有的,是容量规划者所需要的任何数字。速率限制、配额,以及所设计语音的存储寿命,全都存在于文档和定价页面中,而不在发布帖子里——这通常就是发布周里演示顺风顺水、生产却一塌糊涂的原因。

A screenshot of the Gemini API speech-generation documentation, showing the two model identifiers gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts alongside the speech generation request and response format.

鹈鹕才是真正的新闻

单说话人 TTS 在过去两年里已经是一个基本解决的难题。真正缺失的,是一个能在长脚本中让两个身份始终彼此区分、不发生漂移的模型,而这正是该演示真正要检验的东西——不是声音听起来像不像真人,而是四分钟过去后,说话人 A 是否仍然是说话人 A。

由此可以得出两点,而这两点正是其意义超越播客玩具的原因。

第一点是工作单元发生了变化。在单说话人模型下,一段二十分钟的对话就是二十分钟的音频,你需要把两次独立运行的结果拼接起来,而每一处接缝都是韵律重置的地方。在双说话人模型下,它只是一次调用、一个上下文,模型能够对上一句话作出反应。这是后期处理无法弥补的质量差异。

其次是脚本格式变成了接口。如果你的流水线已经输出类似 SSML 形式的内容——对每个短语进行标注——那么这种生成方式几乎可以即插即用。如果你的流水线只是把一大段文本丢给模型,然后指望它自己搞定,那么你现在就有理由重构它了,因为过去那些隐式的样式处理,现在必须被明确表达出来。这正是整个领域以不同方式做出的同一种权衡,而这也正是这两个 Google 模型与榜单上其他所有模型竞争的轴心。

一小时两段鹈鹕音频的费用

这个token账算一次还是值得的,因为按每百万音频token计的价格并不等同于按小时计的价格,而这一差异曾让不少人感到意外。

音频 token 按每秒输出以固定速率生成,因此成本随成品音频的长度而变化,而不是随脚本的长度。以谷歌自己为 Flash TTS 定的价格为例——每百万输出音频 token 9.00 美元——那么一小时的成品音频在标准层级算下来只需个位数美元,而 Lite 模型只需其中的三分之二。Batch 和 Flex 定价方面,Flash TTS 为输入 $0.25、输出 $4.50,Flash-Lite TTS 则为 $0.25 和 $3.00,对于任何无需按需生成的内容,费用还能进一步降低。Priority 定价为 $0.90 和 $16.00,适用于确实需要按需生成的工作。

三个实际后果:

• 重新生成一个段落很便宜;重新生成一个系列则是一项决策。以这样的价格,语音流水线中昂贵的部分不再是推理,而重新变回了批准录音条的那个人。

• 文本输入的价格可以忽略不计。一份几千字的脚本,按每百万文本 token 收 0.50 美元,跟音频那边比起来就是个零头。不要为了控制长度去优化脚本。

• 12月31日的断崖是真实存在的,而且它会让音频费率翻倍。如果你正在规划2027年的推广,请按促销后的数字来做预算,而不是按上线时的数字,否则你1月份就得重新规划。

那个独立的数字,以及那些不独立的

本次发布中有一个数字并非来自 Google。在 Artificial Analysis Provider Voice Arena 上(数据截取于 2026 年 9 月 24 日),Gemini 3.8 Flash TTS 以 1,260 的 Elo 位居第 2 名,覆盖 1,999 个样本和 8 个 arena 声音;Gemini 3.8 Flash-Lite TTS 以 1,235 位居第 6 名,覆盖 2,000 个样本。两者的置信区间分别为 ±16 和 ±17,且彼此都落在对方的置信区间内,因此该榜单告诉你:它们在偏好上统计上无法区分——这是一个确实有用的结果,因为它意味着更便宜的那个对听众而言并没有可测量地更差。

除此之外,其他一切都是 Google 自己的说法,也应当这样理解:表现力话术、语言数量、复刻质量。竞技场给你的只是一个偏好排名,别无其他。它不会告诉你,任一模型如何处理一段 40 分钟的脚本而不出现漂移,遇到一个它从未见过的专有名词时表现如何,或者一个设计出来的声音一周后会发生什么。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Gemini 3.8 Flash-Lite TTS at rank 6 with an Elo of 1,235, with Cartesia Sonic 3.6, Qwen-Audio-3.0-TTS-Plus, Inworld Realtime TTS-2 and BreezeBlue Breeze TTS 2 filling the rows between and around them.

Lite 模型也是更有力的论据,说明这一对是真正的分层,而不是营销档位。25 分的 Elo 差距落在误差条之内,却对应着 33% 的价格差距——这正是价格敏感型流水线几乎每次都该选择 Lite 的决策形态,也是延迟敏感型流水线应做出相反方向选择的决策形态,因为二者不仅在账单上不同,在耗时上也不同。

在哪里运行它,以及这个答案的坦诚版本

OrcaRouter 并不托管 Gemini 3.8 TTS 端点。这一点值得直截了当地说明,而不是暗示相反的情况,因为关于这两个模型,我们所能说的有用之处并不是我们提供它们——我们并不提供——而是像 12 月 31 日变动这样的供应商降价,恰恰是让路由变得值得拥有的那类事件。

OrcaRouter 将200 多个模型置于单一 API 密钥之后,按供应商标价计费,不加任何加价,因此供应商的价目表就是你的实际付费标准,而且价目表一有变动,我们这边当天即可生效,而不必等到下一个计费周期。对于正处于迁移中途的语音处理流程而言,故障转移层比模型目录更重要:你可以把某条请求路径放在仍在评估中的模型上,而无需拿生产路线去冒险,因为失败的调用可以回落到已经过验证的模型上。路由 DSL 能将多个模型组合成一次调用,适用于没有单一音色足够好的场景;而当答案比延迟更重要时,模型融合会用一组模型来回应同一个提示词。

就 Gemini 3.8 TTS 模型本身而言,要调用它们,得去 Google 自家的 API,以及 Google 在 9 月 23 日点名的那些触点。而这一组合给你的架构带来的改变——一次调用同时处理两个说话人、把风格化变成一条标注、一个可以被描述而非被挑选的声音——才是比首发折扣活得更久的部分。

接下来看什么

三件事将决定这一代究竟是阶跃式变革,还是仅仅一项功能。

第一点是漂移。还没有人发表过关于双说话人路径能否在整整一小时内保持身份一致的长篇评估;在有人做到这一点之前,pelican 演示就只是演示。第二点是声音生命周期。一个设计出来的声音如果一周后就失效,那它就只是原型;而一个能从存储配置中重新推导出来的声音才是产品,答案取决于你保留的是两个标识符中的哪一个。第三点是 12 月 31 日之后会发生什么:届时促销费率结束,语音流水线的每小时成本会在一夜之间翻倍。

这些在发布帖里一个都看不到。而这三点在文档里都看得到——发布报道恰恰读到这里就不读了。