
Gemini 3.8 实时泄露:两个新的语音模型,以及为什么“实时扩展思考”更重要
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
本周,两个从未出现在任何已发布文档中的字符串,出现在了一个 GCP 配额页面上:Gemini 3.8 Live,以及一个名为 Live Extended Thinking 的东西。它们由发布追踪账号 @testingcatalog 发现,并于 9 月 15 日发布,附带一句直白的说明:两者均未公开。这就是迄今为止全部的公开记录——没有模型卡,没有定价条目,没有 API 变更日志记录,也没有任何官方确认。但这两个名字落在一条脉络极为清晰的路线末端。Gemini 3.1 Flash Live仍是该公司自家文档为 Live API 相关工作推荐使用的模型,Gemini 3.5 Live和 Gemini 3.5 Live Experimental 于 8 月 26 日作为 Gemini Audio 家族登场,而同一家族的文本一侧——Gemini 3.8 Flash——自 9 月 2 日起一直持续发布。一个 "3.8 Live" 将填补这一空缺。这两个短标识中,第二个更有意思。
先说标签,因为一篇泄密报道的成败就取决于它们。这不是一次发布。这两个代号都尚未由谷歌宣布、记录、定价或确认,而且消息来源只是一个追踪发布动态的账号。下文专门关于 Gemini 3.8 Live 和 Live Extended Thinking 的所有内容均未经证实。下文关于已上线模型——Gemini 3.1 Flash Live、Gemini 3.5 Live、Gemini 3.8 Flash——的所有内容则有记录可查且可核实,我在全文中标注了哪些是哪些。
信号说明了什么,以及它没有说明什么
• 据报道——两个标识符"Gemini 3.8 Live"和"Live Extended Thinking"出现在一个 Google Cloud 配额页面上,于9月15日发布,并附注称它们"未公开"
• 未报告——公告、模型卡、价格、上下文窗口、发布日期、API id、任何基准数值,或来自 Google 的任何确认
• 佐证——截至本文撰写时,暂无。Google 的 Gemini API 模型页面(最后更新于 9 月 4 日)恰好列出了两个对话式 Live 模型:gemini-3.1-flash-live-preview和gemini-3.5-live-translate-preview,且两者均不提供"Live Extended Thinking"变体
• 同一份简报,另一项主张——同一篇 9 月 15 日的帖子还预测,Grok 4.7“应该会落在 Opus 5.0 附近,而不是 5.1”,并且其多模态工作“仍需改进”。那是另一家厂商的模型,而且是一项预测,而非实际产物;此处提及仅是为了保持来源的完整性
• 这个名称自身所暗示的内容——Google Cloud 的配额条目是按模型划分的 SKU,这支持一种可计费的 API 模型,而不是消费者版 Gemini 应用内的一项功能。这是根据该字符串出现的界面作出的推断,并非已确认的事实

为什么配额页面是模型最先泄露的地方
这才是值得理解的部分,因为它解释了为什么一个由两个词构成的产物值得用一整篇文章来写。配额页面不是营销界面。它们是计费和速率限制基础设施:Cloud 客户能调用的每个模型,在第一个付费请求得到处理之前,都需要有一条按项目划分的配额条目,而这些条目是由同一套让模型做好正式全面可用准备的工程工作来配置的。那里出现一个 slug,意味着有人已经为某个 SKU 搭好了管道——而不是有人起草了一份新闻稿。
这事有两面性,而诚实的解读是谨慎的那一种。配额条目比研究论文里的代号走得更远,因为它意味着一个面向客户的预定产品界面。它也恰恰是那种在发布前被创建、测试,然后悄悄更名的东西。这个家族的文本侧发展得足够快,足以让这一点变得具体:Gemini 3.6 Flash 于 7 月 21 日发布,Gemini 3.7 Flash 于 8 月 13 日发布,Gemini 3.8 Flash 于 9 月 2 日发布——六周内三次 Flash 发布。一条迭代如此之快的模型线,其筹备的 SKU 数量多于以那些名称正式推出的数量。
Live 产品线一直落后一个版本。
以下是让“Gemini 3.8 Live”成为一个真正值得关注的话题、而非仅仅是命名上的新奇之处的原因:谷歌的语音模型完全没有跟上其文本模型的步伐。
• 今日推荐的 Live API 模型 — gemini-3.1-flash-live-preview,最新更新于 2026 年 3 月,Google 自己的文档中仍将其描述为适用于所有 Live API 用例的模型
• 其限制——131,072 个输入 token 和 65,536 个输出 token,接收文本、图像、音频和视频输入,输出文本和音频
• 8月26日发布的 Gemini Audio 系列 —— Gemini 3.5 Live、Gemini 3.5 Live Experimental 以及 Gemini 3.5 Transcribe,其中 Transcribe 模型将取代 Chirp 3 用于语音转文字
• 与此同时,文本系列——Gemini 3.5 Flash、Gemini 3.6 Flash、Gemini 3.7 Flash 和 Gemini 3.8 Flash——在大致相同的时间窗口内经历了四个公开版本

所以音频线停留在 3.5 代,而文本线已经到了 3.8。一个“Gemini 3.8 Live”的代号首次表明,Google 打算让语音重新回到与文本相同的代际上——对于任何构建语音智能体的人来说,这意味着 Live 会话底层的推理能力可能一次性跃升三个文本模型代际,而不是一个。
为什么“Live Extended Thinking”是更有意思的标识符
如今,在 Gemini Live 模型上,思考是一个旋钮,而不是一个模型。Live API 暴露了一个 thinkingLevel 参数,它有四个档位——minimal、low、medium 和 high——默认值为 minimal,这是明确为了优化最低延迟而选择的。这个默认值说明了该产品是为哪种场景而生:一场停顿即为 bug 的对话。
一个名为“Live Extended Thinking”的独立 slug 意味着 Google 正准备将其拆分为两个产品,而不是一个调节旋钮,背后的理由很直接。在语音模型中,延迟与深思处于直接冲突之中——你无法既即时作答,又在回答前深入思考——因此,带切换开关的单一模型会迫使每个调用方为每个请求在这条线上选择一个点。两个 SKU 让客户能够将快路径(打断处理、barge-in、快速查询)和慢路径(语音代理处理多步骤任务)路由到调优方式不同的端点上,而不会让其中一个拖累另一个。
先例已经存在于 Google 自己 8 月的发布中。Gemini 3.5 Live Experimental 被描述为那个能“边说话边直接推理”、并在任务过程中逐步讲述自身进展的变体——一个明确带有思考色彩的语音模型,以独立 id 而非某项设置的形式发布。“Live Extended Thinking”读起来就像是这种直觉从实验性标签毕业,成为具名产品。这是从一串字符中作出的推断,而且它确实是推断——但这正是这条特定路线此前曾给予回报的那种推断。
你今天实际可以调用什么
这里没有任何内容会改变你当前实际能访问到的东西,这一点值得直说。没有可调用的 Gemini 3.8 Live 端点,没有可开启的 Live Extended Thinking 设置,也没有办法购买其中任何一项的访问权限。如今任何售卖“Gemini 3.8 Live 访问权限”的账号,卖的只是一个标签,而不是模型。你真正可以使用的 Live 模型是 gemini-3.1-flash-live-preview 和 gemini-3.5-live-translate-preview,二者均通过 Google 自家 API 以预览版提供。
文本这边则是另一番景象,而且它才是真正可路由的部分。Gemini 3.8 Flash——于 9 月 2 日发布,按谷歌自身标价,每百万输入 token 0.75 美元、每百万输出 token 3.75 美元,并计划于 2027 年 1 月 1 日翻倍至 1.50 美元和 7.50 美元——在 OrcaRouter 上以同样的标价运行,且不额外加价(0% 加价)。对于一款已提前公布涨价的模型而言,直通式定价比平时更为重要:当 1 月的价格生效时,这里的价格也会在同一天随之调整,无需再谈第二份合同,也无需改动任何代码。

语音产品线目前不在 OrcaRouter 上——任何厂商的 Live 或 native-audio SKU 都不在——所以这里的内容都不应被理解为我们正在托管它。路由层真正有用的地方,是这个故事的另外一半。当一款 3.8 代 Live 模型真正落地,并且当第二个带有思考风格的变体随之落地时,在快速语音路径和审慎推理路径之间做选择,就会变成一项路由决策,而不是一次重写:两个端点共用一把密钥,并且如果你所基于构建的 preview id 被停用,还能自动故障转移。对于一条今年已经改过一次名的产品线来说,这并非假设。
什么会证实这一点——什么又会将其推翻
一篇泄密文章应该告诉你它可能错在哪里。对于 Gemini 3.8 Live 和 Live Extended Thinking,佐证证据具体且可核查:
• 配额条目被公开——同一个 slug 出现在 Google Cloud 或 Vertex AI 的模型列表中,并附带速率限制,而不只是出现在截图里
• Gemini API 变更日志条目,或模型页面上的某一行,后者目前仅更新至 gemini-3.1-flash-live-preview 和 gemini-3.5-live-translate-preview
• 一份 DeepMind 模型卡——尽管相关报道称 8 月的音频模型为 Live 和 Transcribe,但它们在模型卡中被记录为“Gemini 3.5 Audio”,因此这张卡正是能确定名称的凭据
• 一行定价,正是它让暂存的 SKU 变成人们可以购买的产品
• 证伪——这些 slug 被重命名、并入现有模型的思考设置,或者干脆再也不出现。对于配额页面而言,这三种都是寻常结果,而其中任何一种都意味着这篇文章只是发得早,而不是发得对。
该关注什么,以及谁应当行动
如果你正在 Live API 上构建语音代理,那么本周你的架构无需做任何改动——你原本会基于的模型仍然是 gemini-3.1-flash-live-preview,而诚实的建议是:把模型 ID 放在一个配置值后面,并让第二个 Live 端点保持热备,因为这条产品线已经改过一次名,而且可能还会再改。如果你在选择文本模型,这次泄露与你无关;Gemini 3.8 Flash 正在发布,现在已有定价且可衡量,更有用的问题是 1 月的价格变动,而不是某个语音标识。
真正值得关注的并不是发布本身,而是“Live Extended Thinking”究竟会作为第二个模型登场,还是作为第一个模型上的第五项设置登场。如果它是一个独立的 SKU,那 Google 就是在告诉开发者:会思考的语音智能体与会说话的语音智能体是两类不同的产品——而这一主张,比名称中的任何版本号都更具分量。
真正有用的地方路由层在于这个故事的另一半。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
