一张为“Gemini 3.8 Flash TTS 说你好”生成的主视觉卡片,白色背景,带有柔和的蓝青色渐变点缀。一张宽大的圆角卡片上,波形图标旁边写着“30 种录音棚音色”、“130 种语言”和“每个音频 token”,右侧的第二张卡片上写着“Flash-Lite TTS - 101 种语言”。底部一行写着“Gemini API,2026 年 9 月 23 日。厂商数据。”OrcaRouter 徽标合成在右下角。
Guides & Insights

Gemini 3.8 Flash TTS 亮相:Google 将其语音产品线一分为二并降价

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

该供应商于 2026年9月23日发布了两款语音模型,公告写得仿佛标题就是语音质量。其实并非如此。Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS是该供应商在 Gemini Developer API 上推出的首批文本转语音模型,其定价低于它们所取代的预览版模型——而对于任何一直在别处按字符付费的人来说,这才是会改变预算项的部分。Gemini 3.8 Flash TTS 的音频输出费率为每百万 token 9.00 美元,直至 2026 年底。音频按每秒 25 个 token 计费,折合每生成一秒语音约 0.02 美分。它所取代的模型,Gemini 3.1 Flash TTS Preview,定价为每百万音频 token 20.00 美元。

这个故事的另一半是:如今有两个模型,而不是一个。谷歌把这条产品线一分为二:Flash TTS 承载完整的语言集和更高的音频速率,Flash-Lite TTS 则承载更短的语言列表,价格也更便宜。这与自 4 月以来 API 上一直采用的那种单一预览模型的安排形态截然不同,而它揭示了谷歌眼中市场的模样——少数需要 130 种语言和语音克隆的应用,以及数量庞大得多、只需要一个能胜任客服机器人、别无所求的英语声音的应用。

9月23日究竟发布了什么

截至发布时,这两个模型均已在 Gemini API 和 AI Studio 中正式开放使用,无需排队等候。API 中的名称分别为 gemini-3.8-flash-ttsgemini-3.8-flash-lite-tts

• Flash TTS — 130 种语言,语言可从文本自动检测,30 种预置演播室音色,包括 Kore 和 Puck。

• Flash-Lite TTS — 支持 101 种语言,具备相同的语音设计界面,定位为高吞吐量层级。

• 两者兼具——从自然语言描述进行语音设计、逐行演绎指导、双人场景编排,以及直接写入剧本的非语言提示。

• 输出 — 一元端点上为 WAV 24 kHz 单声道 16 位有符号 PCM;流式端点上为无头 PCM (audio/l16);还接受 audio/mulaw 和 audio/alaw,采样率可配置。

每百万代币的费率卡值得通读,因为各档次的差异远不止表面上那个数字:

• Flash TTS Standard — 文本输入 $0.50 / 音频输出 $9.00,2026 年 12 月 31 日之后将上涨至 $1.00 / $18.00。

• Flash TTS Batch 和 Flex — $0.25 / $4.50。

• Flash TTS Priority — $0.90 / $16.20.

• Flash-Lite TTS标准版 — $0.50 / $6.00,2026年12月31日后将上涨至 $1.00 / $12.00。

• Flash-Lite TTS Batch 和 Flex — $0.25 / $3.00.

• Flash-Lite TTS 优先级 — $0.90 / $10.80。

Gemini 3.1 Flash TTS Preview,供对比参考 — $1.00 / $20.00,批量 $0.50 / $10.00。

需要留意的是促销窗口期。谷歌将两款新模型的定价在今年年底前设为半价,并在同一张表格中公布了促销结束后的价格。任何测算每千分钟成本的人,都应采用一月份的数字,而不是九月份的。

A generated scoreboard for Gemini 3.8 Flash TTS with six rows — Arena Elo 1,260 at rank 2, audio out $9.00 per 1M tokens, 130 languages on Flash against 101 on Flash-Lite, 30 prebuilt studio voices plus voice design, cloning from a 30-second sample with SynthID, and GA availability on the Gemini API — over the footer 'Price per Google rate card; Elo per Artificial Analysis Provider Voice Arena, Sept 2026.'

语音设计才是真正全新的能力

预置音色只是基本要求。Google 在 3.8 中新增的,是一种用文字描述音色并获得它的方式,以及一种从简短样本克隆音色、并附带同意检查的方式。

语音设计接收自然语言提示词——语速、音色、口音,那些原本你可能要花一下午试听挑选的东西——并在没有参考录音的情况下返回一段可用的语音。语音复刻则反过来:你提供一段 30 秒的样本,系统验证授权同意,随后生成的语音会在合成音频上带有 SynthID 水印和 C2PA 凭证标记。语音混音让你能够混合或修改已有的自定义语音,目前被列为即将推出,而非已经上线。

自定义语音分为两种类型,它们的行为差异相当大,在生产环境中这一区别至关重要。有状态自定义语音按项目存储,每个项目上限为 200 个,生存时间为一年。无状态语音通过 voicekey_... 句柄来寻址,并在七天后过期。如果你的应用为每位客户配置一个语音,那么上限和 TTL 这两个数字将决定你是否需要自建存储层。

演绎控制是"新"的另一半。你可以像指导演员那样指导一句台词——节奏、重音、情绪基调——而不只是选一个音色然后听天由命。双人场景可以在单次调用中编排完成。而人声之外的发声是一等一的脚本元素:<laughs><sigh><gasp> 可作为行内提示,再加上 |mhm||yeah|,用来表示那些让合成对话听起来像真正对话的细小应答声。长文本朗读据称能在最小漂移下保持说话人身份,而这正是你生成一段 40 分钟有声书章节时最先出现的失效模式。

基准测试,以及是谁运行了它们

谷歌的发布材料倚重两项外部评估和一组竞技场排名。所有这些都是厂商自行报告的——谷歌只是在引用它们,而底层的运行过程并未公开——因此应把它们当作宣称,而不是测量结果。

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', captured in English and dated Sep 23, 2026, showing the header credited to Leland Rechis and Alan Cowen, the 'Introducing Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS' hero card, and the opening bullets describing the two models.

• Hume AI 语音设计基准测试 — Gemini 3.8 Flash TTS 以 71.4 的成绩位居第一,并在口音建模方面以 60.8 的成绩同样位居第一。

• Hume 综合质量指数 — Flash TTS 第一,Flash-Lite TTS 第二。

• Speech Arena 中的盲选偏好——日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语名列前茅。

• 与 Gemini 3.1 Flash TTS 相比——Google 声称其在长篇一致性和双人剧本控制方面有所提升,而这恰恰是语音表达指导功能所专为应对的两点。

有一处有据可查的出入值得指出,因为它会让任何对比不同来源的人感到困惑。博客文章描述了一个包含 2,000 多种可直接用于生产的语音的库。开发者文档则称,除 30 种预置的录音棚语音外,扩展语音库(Extended Voice Library)中还有“数百种”语音。第三方报道引用的数字又要高出一个数量级。从外部无法调和这些说法——诚实的解读是:默认获得的预置语音是 30 种,扩展语音库规模更大且描述含糊,而那些庞大的数字指的是一个包含用户自建语音的目录。如果语音数量对你的决策至关重要,那就实测你需要的那个具体语音,而不要轻信这三个数字中的任何一个。

如果你在其基础上进行构建意味着什么

真正的变化在于,文本转语音已经从一项专家专属的单独开支,变成了可以与你的语言 token 放进同一个成本模型里衡量的东西。按每秒 25 个 token 计算,一小时的生成音频就是 90,000 个音频 token,按 Flash-Lite 的促销费率算大约 54 美分。这已经足够便宜,于是有意思的问题不再是“我们负担得起合成语音吗”,而是“这个场景需要两个档位中的哪一个”。

第二个实际变化在于,全新的 TTS 模型恰恰是那种你想先试一试、却不愿把生产链路押在它上面的东西。这正是把新模型放在路由器后面、而非直接接线的理由:OrcaRouter 在一把密钥背后以供应商列表价提供 200+ 个模型,且不加价,而它的自动故障转移意味着,一个在高负载下打摆子的新语音端点会降级到你已经信任的模型,而不是让通话直接掉线。我们并不托管 Gemini 3.8 TTS 端点——那些来自 Google 自家的 API——但语音之下的文本层,以及合成调用失败时的回退路径,才是路由器真正派上用场的地方。

还缺少什么

这次发布缺少三样东西,而每一项都是实实在在的约束条件,而非吹毛求疵。

目前没有已发布的独立评估。Google 的 Hume 数据是厂商在引用第三方基准测试,这聊胜于无,却不如一次审计。在 Artificial Analysis 或同等机构发布其自行对相同模型运行的结果之前,本文中的每项质量主张都应被当作一种主张来理解。

目前没有开放权重选项。这两个模型都是闭源且仅提供 API,这使它们与陆续进入同一领域的开放语音模型属于不同类别。如果你的部署需要自行运行模型,那么这次发布并不适合你。

而促销定价就此结束。Flash TTS 在 2027 年 1 月的费率是 9 月费率的两倍,任何基于发布时数字建立的商业论证,到第一季度都得重做。这并非批评——一开始就把两个数字都公布出来,比大多数做法都更诚实——但这才是该填进电子表格里的那个数字。

谷歌尚未说明 Gemini 3.1 Flash TTS Preview 是否会被弃用,只表示 Flash-Lite TTS 被定位为其主力替代方案。仍在使用该预览版模型的人都应规划迁移,而不是等待关停通知。

A generated summary card titled 'Gemini 3.8 TTS: what changed in five lines', listing the split into Flash TTS and Flash-Lite TTS, the audio-out cut to $9.00 per 1M tokens, voice design and 30-second cloning, 130 languages on Flash against 101 on Flash-Lite, and half price until December 31, 2026.