
推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking:谷歌将其语音产品线一分为二
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Google 的 Gemini 3.8 Live与 Gemini 3.8 Live Extended Thinking于 2026 年 9 月 15 日登场——一次发布,两款模型,产品线就此真正分岔。最醒目的数字是 Artificial Analysis 语音到语音指数上的 6.6 分差距:82.6 对 76.0。而潜藏其下的数字是 38。在同一榜单的 τ-Voice 智能体任务完成度指标上,推理版能解决 68.6% 的仿真实客服场景,标准版则只能解决 30.1%。那 6.6 分是指数所呈现的结果,而那 38 分,才是你真正让任一模型去办成一件事时会发生的事。
发布一天后,这个分支已经有了价格。两款模型都有通过 Live API 公布的每分钟音频费率,Artificial Analysis 的排行榜显示,输入音频的每小时成本为 $0.84(标准模型),相比之下 $3.50(推理变体)——每小时成本是前者的四倍多一点,只为那 6.6 个指数点。这个取舍就是整个决策,仅凭指数来判断会出错。
这次发布与通常的语音模型更新不同之处在于,这种分化并非按规模划分的层级。它关乎对语音智能体职责的不同理解。其中一个模型是对话式界面,另一个则是恰好会说话的推理系统。
两种模型,两种工作
谷歌自己的表述对此异常清晰。Gemini 3.8 Live被描述为“为规模化和成本效益而打造,将会话智能与流畅对话和视觉基础相结合”。Gemini 3.8 Live Extended Thinking则“为高复杂度任务而打造,具备更强的智能和多步推理能力”。
实际差异体现在功能列表中,而不是规格表上:
• Gemini 3.8 Live —— 近实时的视觉输入处理、在对话中途自动切换 97 种受支持的语言,以及后台工具/API 执行,使模型在确认请求后继续对话,同时等待调用完成。
• Gemini 3.8 Live Extended Thinking — 边推理边开口,在多步骤任务运行过程中用“让我核实一下……”之类的提示语播报进展。
• 共同点 — 所有生成的音频都带有 Google 的 SynthID 水印,两者均受一份以 gemini-3-8-audio 之名发布的模型卡覆盖,且两者现在都有了文档化的 API 模型 ID:gemini-3.8-live 和 gemini-3.8-live-extended-thinking。
Extended Thinking 模型并不只是思考预算更长的 3.8 Live。它是那种能够同时维持对话和任务计划、而不会让对话停滞的模型——而这正是导致语音代理在生产环境中失败的症结所在。用户不希望在代理查找信息时陷入沉默。他们希望代理继续说话。

电路板上写着 6.6。元件上写着 38。
Speech to Speech Index 是四项底层结果的加权平均值:语音推理,由 Artificial Analysis 自有的 Big Bench Audio 数据集衡量;智能体表现,通过运行 τ-Voice 客户服务基准测试衡量;竞技场偏好,取自 Speech Agent Arena;以及任务成功率。只有具备全部四个组成部分的模型才会获得指数分数,这就是该榜单上有些行为空的原因。
拆开来看,这两款新模型根本不像一对相差 6.6 个百分点的模型:
• 语音到语音指数 — Gemini 3.8 Live 扩展思考(高)82.6 对比 Gemini 3.8 Live 76.0
• 智能体性能(τ-Voice 任务完成率) — 68.6% 对比 30.1%
• 语音推理(Big Bench Audio) — 98% 对比 92%
• 会话动态 — 91.9% 对比 96.1%
• 竞技场偏好(Elo) — 990 对比 1083
• 任务成功率 — 89.1% vs 93.2%
• 首次音频时间 — 1.35 秒 vs 1.18 秒
• 每小时输入音频成本 — 3.50 美元对比 0.84 美元
坦率地看,标准模型在八项指标中赢了四项。它的首次音频更快,在竞技场中评分更高,更有可能完成任务,并且在对话动态方面评价更好。它的价格还只有三分之一。它做不到的是,当任务有步骤时把它完成:30.1% 对 68.6% 是本次发布中任何地方最大的单项差距,而它恰好落在区分语音代理与语音界面的那一个维度上。
在把那张表当作定论之前,有两点需要说明。指数中使用的竞技场偏好数值冻结在模型获得发布资格的那一刻,因此它并不追踪 Speech Agent Arena 图表上的实时 Elo——应将其视为快照,而非实时滚动的分数。而榜单顶部的 τ-Voice 差距小到可能只是噪声:推理变体以 68.6% 领先 GPT-Live-1 的 67.9%(Astra 后端,medium effort)0.7 个百分点,紧随其后的是 GPT-Live-1(Sol,low)的 59.3% 和 Grok Voice Think Fast 2.0 High 的 56.5%。两款 Gemini 模型之间 38 个百分点的差距并不小。而对 GPT-Live-1 的 0.7 个百分点领先才是。
它在指数中的位置
在下面这张拍摄于2026年9月16日的截图中,面板顶部显示如下:
• Gemini 3.8 Live Extended Thinking (High) — 82.6(第一名)
• GPT-Live-1(Astra 后端,中等计算量)——81.5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1(Sol 后端,低投入)— 80.1
• Gemini 3.8 Live — 76.0
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71.5
这就是在一个屏幕中呈现这种差异时的情况。Extended Thinking 变体占据榜首,以榜单的 (High) 推理强度标签运行——这与它对 Grok Voice Think Fast 2.0 High 和 GPT-Realtime-2.1 High 采用的惯例相同,也是为什么你在报道中可能看到附在该模型后的“(High)”后缀是一个配置标签,而非一个单独的发布版本。标准变体位列第五——低于两个 GPT-Live-1 配置,也低于 Grok。Google 自己的博客将标准模型描述为“极具成本效益”,并指出它“在 Speech Agent Arena 中获得了第二名”,而那是衡量不同内容的另一个榜单。两种说法都成立。合在一起看,它们表明:3.8 Live 是一个价格非常实惠的优秀对话模型,而它并不是语音智能的前沿。

抢先一步的泄密
这些模型在公告发布前一天出现在 Google Cloud 的配额页面上,当时我们报道了那次发现,将其视为一个未经确认的标识符,既没有模型卡,也没有定价,Google 也未予以确认。那篇报道对状态的判断是对的,但对时间线的判断有误——大约 24 小时内确认就来了。
这个教训值得记录,因为它与通常的直觉相悖。在发布前一天泄露的 slug 就是一次发布。一个泄露的 slug,如果连续八周都没有佐证材料,那就完全是另一回事。区分二者的信号不是 slug;而是配额页面的存在,而配额页面只有在容量已被预配时才会存在。

每分钟费用是多少
在发布时,Google 的材料并未在价格上区分这两款模型——标准模型给出了费率,而推理版本则没有,这正是上方记分板所记录的情况。此后这一缺口已经填补。现在两款模型都通过 Live API 公布了定价:音频输入每分钟 $0.005,音频输出每分钟 $0.018,Google 在 9 月 16 日两款模型推出时确认了这一点。同一份公布的价目表还涵盖了 Gemini 3 Live 层级的 token 定价——文本 token 输入每 100 万 $0.75、输出每 100 万 $4.50,音频 token 输入每 100 万 $3.00、输出每 100 万 $12.00,图像或视频输入每 100 万 $1.00——不过这些 token 行是按层级而非按模型公布的,因此应将其视为该层级的价目表,而非某一特定变体的报价。
Artificial Analysis 还补上了对规划而言最重要的那个数字。其排行榜现在新增了一列“输入音频每小时成本”——即完成固定的 40 题 Big Bench Audio 子集、并归一化为每小时费率的成本——而且两款新模型在该列中都有数字:
• Gemini 3.8 Live — 输入音频 $0.84/小时,是该榜单上最低的付费费率
• Gemini 3.8 Live Extended Thinking(High)— 每小时 $3.50,仍低于它在质量上击败的两款模型
• Grok Voice Think Fast 2.0 High — 每小时 $4.80
• GPT-Live-1(Astra 后端,中等算力)— $5.83/小时
• GPT-Realtime-2(高)— 每小时4.14美元
• GPT-Realtime-2.1 High — $10.75/小时
关于上面这些截图有一点说明:由于排行榜截图中的成本面板早于这两行数据,其中既没有出现 $0.84,也没有出现 $3.50,其最低的条形数值为 $1.42。列表中的数字是从榜单截至 2026 年 9 月 16 日的汇总表中读取的,而非来自该图片。图片中显示的指数值不受影响,且与表格一致。
对照上文中的各组件来看这两个新数字,这次发布就不再是两款模型的发布,而变成了一个带有已公布兑换率的单一决策。推理变体以略高于四倍的每小时音频成本,换来 6.6 个指数点、6 个点的语音推理和 38.5 个点的智能体任务完成度。这笔钱是否值得花,完全取决于你的智能体在做什么——而一旦组件公布,答案的形态就变了。一个以完成多步骤任务为职责的语音智能体,买到的是本次发布中单一最大幅度的改进:每小时 3.50 美元,同时比 GPT-Live-1 Astra 低约 40%,比 Grok Voice Think Fast 2.0 High 低约四分之一,且得分高于两者。一个以对话为职责的语音智能体——回答、保持话题连贯、接收留言、令人愉快——用额外的推理深度几乎买不到什么,而每小时 0.84 美元买到的是目前所有人发布的最便宜的合格语音模型。
这就是这份榜单的格局。Google 将其推理模型的定价压到了它击败的那两个模型之下,又将其标准模型的定价压到了榜单上所有模型之下。如果你要大规模跑语音分钟数,推动你账单的是这个数字,而不是指数得分——而这两个版本相差 4 倍,意味着选择调用哪一个,是整套技术栈中最大的单项成本杠杆。
“Private preview”在那句话里可是实打实地发挥着作用
从合同意义上说,这两个模型都尚未普遍可用,但开发者接口已经开放,而且现在已有定价,这改变了你可以据此规划的内容:
• Gemini 3.8 Live — 开发者可通过文档中记录的 ID 在 Gemini API、Live API 和 Google AI Studio 中获取gemini-3.8-live;企业用户可在 Gemini Enterprise 中获得私有预览,面向客户体验的 Gemini Enterprise 则“即将推出”;所有人都可在 Search Live 中使用。
• Gemini 3.8 Live Extended Thinking — 在 gemini-3.8-live-extended-thinking 下提供相同的开发者接口,并增加了更广泛的消费者途径:面向 Google AI Pro 和 Ultra 订阅者的 Gemini Live、Docs Live,以及面向所有 Google AI 订阅者的 Gmail Live 和 Keep Live。
目前仍然缺失的,正是企业所需要的那部分:正式可用(GA)承诺、已公布的正常运行时间数据,以及 Google 承诺维持的费率。如果你需要这些,那就再等等。如果你正在做原型开发,这条路径今天就已经开放,而且背后有真实的价目表支撑——这比一个未公布价格的预览版所处的境况要好得多。现在就开始构建集成是合理的;但把一条关乎收入的电话线押在 Google 尚未承诺的可用性目标上,则并不合理,针对这一问题的解决办法见下文。
供应商索赔在哪里结束
谷歌在发布的同时也公布了自己的分项数据——τ-Voice 上为 68.6%,Sierra 的 τ³-Banking 排行榜上为 35.1%,Big Bench Audio 上为 97.7%,这些成绩均归功于 Extended Thinking 模型。如今,这些数字被分成了两组,而这种划分至关重要。
三项中有两项与 Artificial Analysis 在其自有测试框架下自行运行的测量结果一致。其 τ-Voice 智能体组件显示该模型为 68.6%,而 GPT-Live-1 Astra 为 67.9%,Grok Voice Think Fast 2.0 为 56.5%;其 Big Bench Audio 语音推理组件显示为 98%,而 Google 的为 97.7%。Artificial Analysis 将 τ-Voice 和 Big Bench Audio 描述为其自有基准,在可行的情况下会进行三次试验。因此,τ-Voice 和推理数字现在出现在一个你可以去查看的公开榜单上,而不仅仅是在 Google 的公告中——应将其视为得到佐证,而非已有定论,因为 Google 引用的确切数字很可能就是同一次运行的结果,而不是第二次独立运行。
Sierra 的那个数字没有此类佐证,仍属厂商宣称:在 Sierra 的 τ³-Banking 排行榜上为 35.1%,而 GPT-Live-1 Astra 为 32.0%,xAI-Realtime 为 16.5%。这同样是一个值得细细思量的数字,因为 35.1% 意味着该榜单上领先的语音模型,在每三次真实的银行业务任务完成尝试中大约有两次会失败。Google 还引用了在 Gemini Enterprise Agent Platform 中于 Live API 上执行的一项 ServiceNow EVA-Bench 运行,并将这两款模型描述为正在推动复杂工作流的帕累托前沿——而这两项说法都没有附带独立解读。
这里有一个值得牢记的先例。xAI 在 7 月报告称,Grok Voice Think Fast 2.0 的语音到语音指数(Speech to Speech Index)为 82.9。在上面截取的榜单中,该模型的得分为 81.3。供应商报告的指数得分并不总能经受住实时排行榜的检验——通常是因为该指数会被修订,有时则是因为所测试的配置并非最终发布的配置。请在你自己的流量上验证 τ-Voice 和 Big Bench 的数值,并把 agentic 列视为最需要重点测试的一列。
这些智能体实际运行的层级
这两个模型都位于后端之前。后台工具执行、多步任务规划,以及每个严肃的语音代理都会采用的委托模式,最终都归结为普通的文本模型调用——而这正是成本差异最大、锁定程度最低的层面。
OrcaRouter 提供 来自单一密钥的 190 个模型,按提供商标价,无任何加价,这意味着上游实验室的降价当天就会在我们这边生效,而不是等到下一次合同续约。对于前端为预览模型的语音栈来说,两个有用的特性是:可以在不触及语音集成的情况下更换委派目标,并且当后端出错或超时时,自动故障转移能让通话保持不中断。准确说明我们托管什么、不托管什么:Gemini 3.8 Live 端点不在我们的路由器上——它们来自 Google 自己的 API——但这些智能体常常将工作转交到的文本模型往往就在我们这边,其中包括 Gemini 3.8 Flash。
接下来看什么
有三件事将决定本次发布中悬而未决的问题。第一件是正式可用性以及谷歌承诺维持的价格——价格现已公布,但预览定价向来有变动的习惯,而价目表并不等于合同。第二件是竞技场和任务成功率这两列数据是否站得住脚,因为标准模型的 1083 Elo 和 93.2% 任务成功率,是反对为推理版本支付 4 倍价格的最有力论据,而且该指数中的竞技场数字是在资格认定时冻结的,而非实时数据。第三件是针对智能体差距本身的独立复现:68.6% 对 30.1% 是本次发布中最大的主张,也最值得复现,因为这两款模型在其他所有方面都相差无几。
在那之前,诚实的总结要依据两个数字,而不是一个。Gemini 3.8 Live Extended Thinking 是公开榜单上得分最高的语音模型,在智能体分项上直接领先,并且按小时成本低于紧随其后的两个模型。Gemini 3.8 Live 是该榜单上最便宜且够用的语音模型,更受竞技场青睐,在浅层任务上更可靠,但总分落后 6.6 分,并且在智能体被雇来做的唯一那件事上存在硬上限。谷歌已经两次推出同一分叉,价格相差四倍,让这个选择在定价上变得异常容易——前提是你看的是分项,而不只是总指数。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
