一张为“Gemini 3.8 Live 与 Gemini 3.8 TTS 对比”生成的主视觉卡片,白色背景,带有柔和的蓝青色渐变点缀。左栏标题为“在 Live API 上发布”,列出“gemini-3.8-live”、“能听会说”、“音频输入,音频输出”;右栏标题为“在 TTS 端点上发布”,列出“gemini-3.8-flash-tts”、“朗读书面文本”、“文本输入,音频输出”。页脚一行写着“两者都不叫 Gemini 3.8 TTS。”OrcaRouter 徽标合成在右下角。
Guides & Insights

Gemini 3.8 Live 对比 Gemini 3.8 TTS:对话循环与朗读语音共用一个世代名称

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Gemini 3.8 Live 是一个语音到语音模型,于 2026 年 9 月 15 日发布,型号为 gemini-3.8-live 和 gemini-3.8-live-extended-thinking。"Gemini 3.8 TTS" 根本不是一个模型——它是发布报道(包括 Google 自己那篇文章的标题)用来统称 2026 年 9 月 23 日推出的那两个文本转语音端点的术语,即 gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts。所以这并非通常那种对比页面,即两个产品争夺同一项任务。它讲的是两项任务共用一个代号,以及人们把 "Live" 和 "TTS" 这两个词当成同一事物的两种口味时所犯的那个具体错误。

共享世代号所隐藏的分叉

Google 的语音生成文档自己划定了这条界线,而这句话很容易被一扫而过:“TTS 能力不同于通过 Live API 提供的语音生成。”同一段落解释了其中缘由,而原因是结构性的,而非质量问题。Live API 是为“交互式、非结构化音频,以及多模态输入与输出”而构建的。通过 Gemini API 使用 TTS“则是为需要精确朗读文本并具备细粒度控制的场景量身定制”。后文的一条说明明确了输入形式:TTS 模型只接受文本,并且只返回音频。

这一条约束——文本输入、音频输出、无音频输入——就是整个对比的全部。Gemini 3.8 Live 模型能听到正在对它说话的人。而 Gemini 3.8 Flash TTS 或 Flash-Lite TTS 模型从不听到任何人;它只是读取一个字符串并将其演绎出来。其余一切都由此而来:为其中一方而设的基准测试对另一方毫无意义,定价按不同的单位计量,失败模式也完全不可相提并论。

这一点很重要,因为从外部看,这两种用例毫无二致。语音代理和旁白流水线最终都会输出听起来像人说话的语音。但其中只有一个能被中断。

“Gemini 3.8 TTS”实际上解析到哪里

打开 Gemini API 语音生成的受支持模型表,你会发现四条 TTS 条目,却没有名为 Gemini 3.8 TTS 的条目。其中两条属于这一代:Gemini 3.8 Flash TTS,模型 ID 为 gemini-3.8-flash-tts,支持 130 种语言;以及 Gemini 3.8 Flash-Lite TTS,模型 ID 为 gemini-3.8-flash-lite-tts,支持 101 种语言。另外两条——Gemini 3.1 Flash TTS Preview 和 Gemini 2.5 Pro Preview TTS——则是被 Flash-Lite 取代的预览代次。

所以当有人说“Gemini 3.8 TTS”时,通常指的是 Flash 层级,因为发布文章主推的就是它,Arena 排行榜上排名最高的也是它。但当他们在谈实时语音代理时这么说,那其实什么也指不到,因为他们想要的东西位于另一个端点,名称不同,输入契约也不同。

还有第三种值得点名的冲突,因为它会催生最糟糕的建议。Gemini 3.8 Live 不是一款带有额外功能的文本转语音模型,而是一款语音转语音模型;它单位成本更高,是因为它每单位要完成更多工作:倾听、在话语进行中推理、应对打断,并且在 Extended Thinking 变体中,在作答前先进行深思熟虑。

真正值得比较的唯一号码

质量分数不会在这两个家族之间转移;没有一块单一的评分板能把旁白者和对话者放在同一根轴上打分。钱确实会转移,只要你诚实地选择单位,而对任何语音来说,诚实的单位都是音频小时。

• 按分钟计费 — Gemini 3.8 Live 按音频分钟数计费,输入每分钟 $0.005,输出每分钟 $0.018,而 Gemini 3.8 Flash TTS 按每百万音频 token 计费,截至 2026 年 12 月 31 日为 $9.00,之后为 $18.00
• 按输出计费 — 在未启用任何提示缓存的情况下,Gemini 3.8 Live 的双向音频按标价一小时同时输入和输出约为 $1.38,而 Gemini 3.8 Flash TTS 是单向流,按 Artificial Analysis 的归一化计算,一百万个字符的成品旁白为 $16.5
• 文本输入 — Gemini 3.8 Live 将文本和音频分列计费,每百万文本 token 输入 $0.75、输出 $4.50,而 TTS 端点对文本输入按每百万 token $0.50 计费
• Flash-Lite 档位 — Gemini 3.8 Live 没有更便宜的同类版本;选择只有 Live 或 Extended Thinking,而 Gemini 3.8 Flash-Lite TTS 标价为每百万音频 token $6.00,之后 $12.00,Artificial Analysis 给出的价格为每百万字符 $11.0
• 输入形态 — Gemini 3.8 Live 输入音频、视频和文本,输出音频,而 TTS 端点输入文本,输出音频

Live 的数字是我们根据 Google 公布的每分钟费率算出来的,并非 Google 公布的每小时数字。按字符计费的数字是 Artificial Analysis 做的归一化处理,在比较合成层级时应以这一组为准。请注意,Artificial Analysis 自家的 Speech to Speech 榜单为 Live 模型单独列出了一列“每输入音频小时成本”——Gemini 3.8 Live 约为 3.50 美元,Extended Thinking 变体约为 0.84 美元——这又是另一种归一化方式,不应把它与每分钟费率表并列对照,仿佛两者是同一种度量。

A screenshot of Google's Gemini API pricing documentation in English, captured 25 September 2026, showing the speech-generation model index — a limited-access group listing Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking and Gemini 3.1 Flash Live Preview, alongside Gemini 3.8 Flash TTS, Gemini 3.8 Flash-Lite TTS and Gemini 3.1 Flash TTS Preview — above the Gemini 3.8 Flash per-million-token rates: $0.75 input through 31 December 2026 rising to $1.50, $3.75 output including thinking rising to $7.50, $0.075 context caching rising to $0.15, and storage at $0.50 rising to $1.00 per million tokens per hour, with search requests and prompts billed at $14 per 1,000 beyond the monthly free allowance. The page carries no rate-card line for a model named Gemini 3.8 TTS.

选错了会出什么问题?

这些失效模式很有启发性,因为它们彼此如此不同。

当你需要一个对话循环时,你调用了一个 TTS 端点,而且什么错都没报。请求返回了有效的音频。你得到了一段对固定字符串的流畅、朗读自然的回应,然后就陷入了沉默——因为从来就没有任何东西在监听。团队在构建他们的第一个打断测试时发现了这一点:他们发现“用户”必须等整段音频播放完,下一轮才能开始。把对话能力加装到一个合成端点上,意味着要在它周围加上语音识别、轮次切换策略和打断机制;到这一步,你其实已经重新搭出了一条级联流程,而且你要为两个模型付费,而不是一个。

当你只需要旁白时却调用 Live 端点,就等于在为自己用不到的能力付费。Live 模型按双向计费,因为它预期的是双向交互。而对于有声书或培训视频的配音来说,输入端是一份永不改动的脚本,模型根本不需要听任何东西。你花钱买来的是一个对话循环,却只是用它来朗读一份文档。

唯一真正难以抉择的情况是级联式架构:先识别,再推理,然后合成。这种架构并没有过时,而且对许多生产系统来说它仍然是正确选择,因为它让你能够独立替换每个阶段,并为每个阶段选择不同的供应商。它的代价是延迟,以及单一端到端模型在跨越轮次边界时仍能保持的韵律。这种权衡在两个方向上都是真实存在的。

路由已存在的位置

OrcaRouter 并不提供 Gemini 3.8 Live 端点,也不提供 3.8 TTS 端点,而在谈路由之前,这一点值得先说明,因为面对如此宽泛的目录,人们很容易以为情况恰恰相反。目录中确实收录的是该家族的其他成员——google/gemini-3.8-flash,它位列 28 个 Google 模型之中,而全部模型超过 200 个,只需一个密钥,即可按供应商标价使用,绝无加价。

这一点对级联而言尤其重要。如果你的架构是识别、推理、再合成,那么推理阶段就是用一把密钥对接多家供应商最能见效的一环,因为它是你更换最频繁的阶段,也是供应商降价理应当天就体现在你账单上、而非等到下一次合同续约才体现的阶段。也正是在这一环,自动故障转移才真正物有所值:一条级联有三处可能断裂,而中间那一处做成冗余的成本最低。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples and priced at $16.5 per million characters, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0 per million characters. The board lists no model named Gemini 3.8 TTS.

一条简短的决策规则

如果模型必须对尚未以文本形式存在的内容作出响应,你需要的是 Gemini 3.8 Live,并且应按 Google 的每分钟音频费率来做预算,还要考虑清楚你需要两种变体中的哪一种。如果文本已经写好,任务只是把它演绎出来,你需要的是 Gemini 3.8 Flash TTS 或 Flash-Lite TTS,并且应按每百万字符来做预算,再根据语言覆盖范围以及质量差距是否值得价格差距来选择层级。

如果你被要求把“Gemini 3.8 Live 和 Gemini 3.8 TTS”当作两个产品来比较,那么你能做的第一件有用的事,就是先问清楚是哪个端点。需求说明上的这个名称并不能落到某一个端点上,而这个答案改变的是架构,而不只是账单。

A generated summary card for Gemini 3.8 Live vs Gemini 3.8 TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — gemini-3.8-live on the Live API, shipped 15 September 2026', 'Gemini 3.8 TTS — not a model ID; resolves to gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts', 'Input contract: Live hears audio and video; TTS reads text only', 'The one shared unit: the hour of finished audio, not the benchmark', and 'Verdict: two jobs, one generation number — ask which endpoint'. A footer line reads 'Prices and language counts are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.