一张为“创建并部署自定义音频”生成的 hero 卡片,副标题为“Gemini 3.8 Flash TTS”,背景为白色,带有柔和的蓝青渐变点缀。三张带编号的卡片分别写着“1 通过提示词设计一个声音”、“2 将其存储一年,或持有一个七天密钥”和“3 调用 /v1/audio/speech”,其下方有一行页脚文字:“Gemini API,2026 年 9 月 23 日。厂商数据。”OrcaRouter 标志合成于右下角。
Guides & Insights

使用 Gemini 3.8 Flash TTS 创建并部署自定义音频:语音设计、克隆,以及决定成败的两个时钟

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 都允许你通过文字描述来创造语音,而不是从列表中选择,并且两者均于 2026 年 9 月 23 日在 Gemini API 上正式发布。人们反复提及的亮点是语音设计。真正值得提前规划的是定制语音之后的去向,因为厂商提供了两种保留语音的方式,并为每种方式设定了不同的有效期。一旦选错,你的产品所依赖的语音将在一周后失效。

这就是目前为止发布报道中的空白。那些公告文章解释说,你可以通过提示让一个声音诞生,其中几篇还提到可以从 30 秒的样本进行克隆。但没有一篇详细讲解存储模型,而正是这个模型决定了语音流水线究竟是可以从配置文件复现,还是必须按周期重新配置。本文涵盖整条路径——设计、存储、调用和付费——并采用 Google 公布的价格和配额。

9月23日发布了什么

两个模型,一套 API 架构。标识符是 gemini-3.8-flash-tts和 gemini-3.8-flash-lite-tts,而 Google 的文档明确指出,两者采用“完全相同的 API 架构和提示词格式”——在它们之间切换只需更改一个参数,而无需重写。

• 输入——仅限文本。两个模型均接受文本并返回音频;它们并非多模态模型,也不会返回生成的文本。

• 输出 — 一元端点上输出 WAV、24 kHz 单声道 16 位有符号 PCM;流式端点上输出无头 PCM(audio/l16);audio/mulaw 和 audio/alaw 也可接受,采样率可配置。

• 语言 — Flash TTS 支持130种,Flash-Lite TTS 支持101种,根据文本自动检测,而非在请求中声明。

• Voices — 文档中列出了 30 个精选录音棚音色(其中包括 Kore 和 Puck),还有一个包含“数百个”更多音色的扩展语音库,可通过 voices endpoint 查询,以及下方两条创建路径。

• 方向控制——逐行控制语音输出、从单一脚本编排双人场景,以及直接写入转录文本的非语言提示,如 <laughs>、<sigh> 和 |mhm|。

之所以分为两个层级,是因为工作负载出现了分化。Flash TTS 定位为追求最高的声学保真度与复杂表演;Flash-Lite TTS 用 Google 自己的话说是gemini-3.1-flash-tts-preview的"主力替代品",面向批量配音、朗读功能和语音智能体级联。两者都取代了自 2026 年 4 月起就存在于 API 上的单一预览模型,所以如果你此前用的是预览版,这次迁移是一个层级选择,而不是版本升级。

A screenshot of Google's Gemini API text-to-speech documentation, captured in English on 24 September 2026, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) and Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts), and Python sample code that passes a speaker_config with the Kore voice to the interactions endpoint.

设计一种声音就是一个提示,而这改变了审查步骤

创建界面是这一代中真正的新事物。一个 提示词驱动的声音由自然语言描述——角色、口音、声音特质——构建而成,并返回一个可供你复用的标识符。在 API 中,这是一次语音创建调用,使用 store: true以及一个提示词输入;在 Google 自己的示例中,描述从活力四射的墨尔本 DJ 一直延伸到日本龙。声音一旦创建,就会在语音请求中通过其标识符被引用,而每次请求的风格指令随后就可以极少甚至为空,因为角色已经融入声音本身。

实际后果是工作流程的改变,而不只是多了一个功能。过去,语音选角要么是一场授权谈判,要么是一次录音棚预约,这意味着音色的选择只发生一次、而且发生在早期,并且能挺过评审,因为改动它太昂贵了。当一条音色就是一段文本时,选角就变成了一种设计令牌——一种产品经理可以在周二要求重新掷一次的东西。把描述字符串纳入源代码管理、并把生成的音色 ID 当作构建产物的团队,会在各个环境中得到一致的输出。而在 AI Studio 里手工创建音色的团队则不会,这种失败会表现为预发布与生产环境音频之间一种莫名其妙的差异。

两个时钟

{{1}}这是发布文章会略过的部分。{{/1}} {{2}}Google 允许你以两种状态之一保留设计或复制的语音,而它们的过期速度天差地别。{{/2}}

• 存储的语音 — 在启用存储后创建,它们保存在你的项目中,并受每个项目 200 个语音的配额限制,有效期为一年。

• 无状态密钥 — 语音复刻可能会返回由客户端管理的密钥(voicekey_… 形式),而不是已存储的标识符,且该密钥的有效期为七天。

把这两点放在一起看,它们就是一条设计指令。预存音色是一份为期一年的承诺,并且每个项目有 200 个的硬性上限;对于一个角色阵容固定的产品来说,这很宽裕,而对于任何需要为每位客户生成新音色的场景则毫无用处。无状态密钥则相反:没有配额压力,但密钥需要每周重新生成,这意味着你的应用需要一条刷新路径,你的基础设施也需要存储会轮换的凭据。两者都没错。没意识到自己选了哪一个就做出选择,正是语音代理在第八天突然哑掉的原因。

复制还附带另外两个特性,在向法务团队做出任何承诺之前,值得先了解清楚。创建复制语音需要语音所有者提供一段口头同意录音,且必须与参考说话人匹配——这是一次口头核验,而不是勾选一个复选框。而且输出结果自带来源信息:每个音频片段都用 SynthID 打上水印,复制语音还额外带有 C2PA 内容凭证。其设计路径有意选择了更难被滥用的那一条,而且这两道屏障都是结构性的,而非政策声明。

有一个差异值得指出而非解决:Google 的受支持模型表将语音设计和语音复刻列为在两个 3.8 TTS 模型上都可用。大多数发布报道则把复刻专门描述为 Flash TTS 方案的一部分。如果复刻对你决定选择哪个层级很重要,请对照你打算发布的那一层级的文档来核实,而不是轻信任一方的概述。

一小时音频的费用是多少

Google 对语音的计费以 token 为单位,而不是按字符或秒数,并且换算规则是公开的:音频按输出每秒 25 个 token 计量,也就是每小时 90,000 个 token。这让算术变得异常简洁,而预算里该填的是这个数字,而不是每百万 token 的单价。

• Flash TTS 标准版 — 每百万输入文本 token 0.50 美元,每百万输出音频 token 9.00 美元,优惠截至 2026 年 12 月 31 日,之后为 1.00 美元和 18.00 美元。Batch 和 Flex 分别为 0.25 美元和 4.50 美元;Priority 为 0.90 美元和 16.20 美元。

• Flash-Lite TTS 标准版 — 截至同一日期为 $0.50 和 $6.00,之后为 $1.00 和 $12.00。Batch 和 Flex 为 $0.25 和 $3.00;Priority 为 $0.90 和 $10.80。

• 以秒计费 —— 在促销期间,Flash TTS 生成音频的成本约为每小时 $0.81,促销结束后约为 $1.62;Flash-Lite TTS 则约为 $0.54,之后为 $1.08。

• 相较于它所替代的模型——gemini-3.1-flash-tts-preview的定价为每百万 $1.00 和 $20.00,因此音频输出项在 Flash TTS 上下降了 55%,在 Flash-Lite TTS 上下降了 70%。

不要针对促销价做规划。Google 把两列发布在同一张表里,这意味着一月的费率不是日后才会被发现的传闻——它今天就已经写在牌价上,而任何按 0.81 美元建立的每千分钟估算,都必须经得起翻倍的考验。

一个独立的数字,以及几个并不独立的

谷歌的公告以基准测试结果开头,而这些结果应当按其本来面目来解读。该公司称,Flash TTS 在 Hume AI 的 Voice Design Benchmark 上以 71.4 分位居第一,在口音建模上以 60.8 分领先,并且 Flash TTS 和 Flash-Lite TTS 在 Hume 的 Overall Quality Index 上排名第一和第二,在 Voice Arena 的日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语盲测偏好中也取得了强劲名次。所有这些均为厂商自行报告,没有任何一次运行结果公开。

那份清单里有一个值得注意的细节。艾伦·考恩(Alan Cowen)被列为谷歌这份公告的作者之一,而他正是 Hume AI 的创始人——那个提供这一头条数字的 Voice Design Benchmark 就出自这家实验室。这并不意味着该数字是错的,Hume 的基准测试也确有其事,但两者并非彼此独立,读者在把这 71.4 拿来当作第三方验证引用之前,应当先知道这一点。

这项独立收集的数据来自 Artificial Analysis 的 Provider Voice Arena,为本文于 2026 年 9 月 24 日截取:Gemini 3.8 Flash TTS 以 1,260 的 Elo 位列第二,在 1,999 个样本上的区间为 17 点,落后于 1,273 的 Cartesia Sonic 3.6。Gemini 3.8 Flash-Lite TTS 以 1,235 排名第六。被取代的模型 Gemini 3.1 Flash TTS 以 1,199 在 3,430 个样本中排名第十。这是盲听者偏好,而非实验室自己的评测——也是这里唯一一个并非由 Google 委托得出的质量数字。

A generated scoreboard card titled 'Gemini 3.8 Flash TTS — the scoreboard' with six rows: Arena Elo 1,260 at rank 2 over 1,999 samples; audio out $9.00 per 1M tokens to 31 December 2026; 130 languages on Flash TTS against 101 on Flash-Lite TTS; 30 studio voices plus prompt-based design; stored voices capped at 200 per project with a one-year lifetime; and a stateless voicekey with a seven-day lifetime. The footer reads 'Elo per Artificial Analysis, 24 Sept 2026; price and quotas per Google. Google's Hume AI results are vendor-reported.'

在哪里运行它,以及哪里还不能运行

这两款模型目前已在 Gemini API 和 Google AI Studio 中上线,无需排队等候。面向消费者和企业的产品形态仍处于分阶段推进的状态,而非已经正式发布:Flash TTS 即将登陆 Gemini Notebook,Flash-Lite TTS 即将登陆 Google Vids,Gemini Enterprise 的访问权限被描述为“即将推出”,而声音混音——即对现有声音调整音色、音高、语速和口音——被列为未来功能,而非当前已有功能。如果你的方案依赖混音功能,那么它目前尚不存在。

先说我们这边,诚实为先:Gemini 3.8 TTS 端点并不在 OrcaRouter 的路由表上。它所取代的那一代才是——google/gemini-3.1-flash-tts-preview已在目录中,价格为每百万 token 1.00 美元和 20.00 美元,与 Google 公布的价格一致,因为供应商标价原样传递、不加价,而且它响应的正是/v1/audio/speech端点——你的 OpenAI 兼容 SDK 本来就指向它。对语音工作负载而言,这一点比听起来更重要,因为你真正买到的,是一个稳定的端点:无论其背后的模型如何更替,你的应用都能持续调用。你的代码里存着模型字符串;目录里存着路由。当 Google 的促销窗口在 12 月 31 日关闭、Flash TTS 价格翻倍时,经路由的模型价格会在当天就随之变动,而不是等到下一次合同续签——而当某个模型宕机时,它会故障转移,而不会把你这支旁白队列一并拖垮。

A screenshot of the OrcaRouter model page for google/gemini-3.1-flash-tts-preview, captured in English on 24 September 2026, showing the model described as Google's text-to-speech model accessed via OrcaRouter, an input price of $1.00 and output price of $20.00 per 1M tokens, a p50 time-to-first-token of 6.61 seconds and p95 of 10.00 seconds over seven days, an OpenAI-compatible base URL of https://api.orcarouter.ai/v1, and a /v1/audio/speech endpoint.

如果你要在正式采用之前先评估这一代模型,最省钱的实验是做一个两级对比测试。把同一份脚本分别跑一遍 Flash TTS 和 Flash-Lite TTS,因为两者的 schema 完全相同,差别只是一个参数——然后用你自己的音频来判断,而不是看一张基准测试图表;在支付溢价之前,先上 Artificial Analysis 看看这个质量差距是否超出了误差范围。对于大篇幅旁白项目来说,这笔溢价是实打实的真金白银;而对于一个朗读电话号码的客服机器人来说,它显然买不到任何听众能听出来的东西。