Gemini 3.8 Live 的主视觉标题卡,引题为“OrcaRouter · 模型雷达 — 发布”,副标题为“Google 将其语音产品线一分为二——一个模型面向规模化,一个面向推理。”两张卡片分别写道“Gemini 3.8 Live — Index 76.0,为规模化与成本效率而构建”和“3.8 Live Extended Thinking — Index 82.6,多步推理”,并带有 2026年9月15日、对话中支持97种语言、SynthID 音频水印和 Live API 预览的标签。OrcaRouter 标志合成在右下角。
Guides & Insights

推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking:谷歌将其语音产品线一分为二

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

GoogleGemini 3.8 LiveGemini 3.8 Live Extended Thinking于 2026 年 9 月 15 日登场——一次发布,两款模型,产品线就此真正分岔。最醒目的数字是 Artificial Analysis 语音到语音指数上的 6.6 分差距:82.6 对 76.0。而潜藏其下的数字是 38。在同一榜单的 τ-Voice 智能体任务完成度指标上,推理版能解决 68.6% 的仿真实客服场景,标准版则只能解决 30.1%。那 6.6 分是指数所呈现的结果,而那 38 分,才是你真正让任一模型去办成一件事时会发生的事。

发布一天后,这个分支已经有了价格。两款模型都有通过 Live API 公布的每分钟音频费率,Artificial Analysis 的排行榜显示,输入音频的每小时成本为 $0.84(标准模型),相比之下 $3.50(推理变体)——每小时成本是前者的四倍多一点,只为那 6.6 个指数点。这个取舍就是整个决策,仅凭指数来判断会出错。

这次发布与通常的语音模型更新不同之处在于,这种分化并非按规模划分的层级。它关乎对语音智能体职责的不同理解。其中一个模型是对话式界面,另一个则是恰好会说话的推理系统。

两种模型,两种工作

谷歌自己的表述对此异常清晰。Gemini 3.8 Live被描述为“为规模化和成本效益而打造,将会话智能与流畅对话和视觉基础相结合”。Gemini 3.8 Live Extended Thinking则“为高复杂度任务而打造,具备更强的智能和多步推理能力”。

实际差异体现在功能列表中,而不是规格表上:

Gemini 3.8 Live —— 近实时的视觉输入处理、在对话中途自动切换 97 种受支持的语言,以及后台工具/API 执行,使模型在确认请求后继续对话,同时等待调用完成。

Gemini 3.8 Live Extended Thinking — 边推理边开口,在多步骤任务运行过程中用“让我核实一下……”之类的提示语播报进展。

共同点 — 所有生成的音频都带有 Google 的 SynthID 水印,两者均受一份以 gemini-3-8-audio 之名发布的模型卡覆盖,且两者现在都有了文档化的 API 模型 ID:gemini-3.8-livegemini-3.8-live-extended-thinking

Extended Thinking 模型并不只是思考预算更长的 3.8 Live。它是那种能够同时维持对话和任务计划、而不会让对话停滞的模型——而这正是导致语音代理在生产环境中失败的症结所在。用户不希望在代理查找信息时陷入沉默。他们希望代理继续说话。

A two-column scoreboard comparing Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking. Index score 76.0 vs 82.6; built for scale and cost efficiency vs high-complexity reasoning; languages 97 mid-conversation on both; visual input near real-time on both; background tools yes on both; audio price $0.005 in / $0.018 out per minute vs not separately announced. Footer reads 'Index figures per Artificial Analysis, Sep 16 2026; pricing as announced.' The OrcaRouter logo is composited in the bottom-right corner.

电路板上写着 6.6。元件上写着 38。

Speech to Speech Index 是四项底层结果的加权平均值:语音推理,由 Artificial Analysis 自有的 Big Bench Audio 数据集衡量;智能体表现,通过运行 τ-Voice 客户服务基准测试衡量;竞技场偏好,取自 Speech Agent Arena;以及任务成功率。只有具备全部四个组成部分的模型才会获得指数分数,这就是该榜单上有些行为空的原因。

拆开来看,这两款新模型根本不像一对相差 6.6 个百分点的模型:

语音到语音指数 — Gemini 3.8 Live 扩展思考(高)82.6 对比 Gemini 3.8 Live 76.0

智能体性能(τ-Voice 任务完成率) — 68.6% 对比 30.1%

语音推理(Big Bench Audio) — 98% 对比 92%

会话动态 — 91.9% 对比 96.1%

竞技场偏好(Elo) — 990 对比 1083

任务成功率 — 89.1% vs 93.2%

首次音频时间 — 1.35 秒 vs 1.18 秒

每小时输入音频成本 — 3.50 美元对比 0.84 美元

坦率地看,标准模型在八项指标中赢了四项。它的首次音频更快,在竞技场中评分更高,更有可能完成任务,并且在对话动态方面评价更好。它的价格还只有三分之一。它做不到的是,当任务有步骤时把它完成:30.1% 对 68.6% 是本次发布中任何地方最大的单项差距,而它恰好落在区分语音代理与语音界面的那一个维度上。

在把那张表当作定论之前,有两点需要说明。指数中使用的竞技场偏好数值冻结在模型获得发布资格的那一刻,因此它并不追踪 Speech Agent Arena 图表上的实时 Elo——应将其视为快照,而非实时滚动的分数。而榜单顶部的 τ-Voice 差距小到可能只是噪声:推理变体以 68.6% 领先 GPT-Live-1 的 67.9%(Astra 后端,medium effort)0.7 个百分点,紧随其后的是 GPT-Live-1(Sol,low)的 59.3% 和 Grok Voice Think Fast 2.0 High 的 56.5%。两款 Gemini 模型之间 38 个百分点的差距并不小。而对 GPT-Live-1 的 0.7 个百分点领先才是。

它在指数中的位置

在下面这张拍摄于2026年9月16日的截图中,面板顶部显示如下:

Gemini 3.8 Live Extended Thinking (High) — 82.6(第一名)

• GPT-Live-1(Astra 后端,中等计算量)——81.5

• Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1(Sol 后端,低投入)— 80.1

Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

这就是在一个屏幕中呈现这种差异时的情况。Extended Thinking 变体占据榜首,以榜单的 (High) 推理强度标签运行——这与它对 Grok Voice Think Fast 2.0 High 和 GPT-Realtime-2.1 High 采用的惯例相同,也是为什么你在报道中可能看到附在该模型后的“(High)”后缀是一个配置标签,而非一个单独的发布版本。标准变体位列第五——低于两个 GPT-Live-1 配置,也低于 Grok。Google 自己的博客将标准模型描述为“极具成本效益”,并指出它“在 Speech Agent Arena 中获得了第二名”,而那是衡量不同内容的另一个榜单。两种说法都成立。合在一起看,它们表明:3.8 Live 是一个价格非常实惠的优秀对话模型,而它并不是语音智能的前沿。

Screenshot of the Artificial Analysis Speech to Speech leaderboard page, captured September 16, 2026. The AA-Speech to Speech Index bar chart shows Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 (Astra) at 81.5, Grok Voice Think Fast 2.0 at 81.3, GPT-Live-1 (Sol) at 80.1 and Gemini 3.8 Live at 76.0, alongside speed and cost-per-hour-of-input-audio panels.

抢先一步的泄密

这些模型在公告发布前一天出现在 Google Cloud 的配额页面上,当时我们报道了那次发现,将其视为一个未经确认的标识符,既没有模型卡,也没有定价,Google 也未予以确认。那篇报道对状态的判断是对的,但对时间线的判断有误——大约 24 小时内确认就来了。

这个教训值得记录,因为它与通常的直觉相悖。在发布前一天泄露的 slug 就是一次发布。一个泄露的 slug,如果连续八周都没有佐证材料,那就完全是另一回事。区分二者的信号不是 slug;而是配额页面的存在,而配额页面只有在容量已被预配时才会存在。

Screenshot of Google's official blog post titled 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated Sep 15, 2026 and credited to Tom Ouyang and Malini Jaganathan of the Gemini Audio Team, with the summary describing the models as Google's most advanced live dialogue models with major upgrades in intelligence and parallel reasoning.

每分钟费用是多少

在发布时,Google 的材料并未在价格上区分这两款模型——标准模型给出了费率,而推理版本则没有,这正是上方记分板所记录的情况。此后这一缺口已经填补。现在两款模型都通过 Live API 公布了定价:音频输入每分钟 $0.005,音频输出每分钟 $0.018,Google 在 9 月 16 日两款模型推出时确认了这一点。同一份公布的价目表还涵盖了 Gemini 3 Live 层级的 token 定价——文本 token 输入每 100 万 $0.75、输出每 100 万 $4.50,音频 token 输入每 100 万 $3.00、输出每 100 万 $12.00,图像或视频输入每 100 万 $1.00——不过这些 token 行是按层级而非按模型公布的,因此应将其视为该层级的价目表,而非某一特定变体的报价。

Artificial Analysis 还补上了对规划而言最重要的那个数字。其排行榜现在新增了一列“输入音频每小时成本”——即完成固定的 40 题 Big Bench Audio 子集、并归一化为每小时费率的成本——而且两款新模型在该列中都有数字:

Gemini 3.8 Live — 输入音频 $0.84/小时,是该榜单上最低的付费费率

Gemini 3.8 Live Extended Thinking(High)— 每小时 $3.50,仍低于它在质量上击败的两款模型

• Grok Voice Think Fast 2.0 High — 每小时 $4.80

• GPT-Live-1(Astra 后端,中等算力)— $5.83/小时

• GPT-Realtime-2(高)— 每小时4.14美元

• GPT-Realtime-2.1 High — $10.75/小时

关于上面这些截图有一点说明:由于排行榜截图中的成本面板早于这两行数据,其中既没有出现 $0.84,也没有出现 $3.50,其最低的条形数值为 $1.42。列表中的数字是从榜单截至 2026 年 9 月 16 日的汇总表中读取的,而非来自该图片。图片中显示的指数值不受影响,且与表格一致。

对照上文中的各组件来看这两个新数字,这次发布就不再是两款模型的发布,而变成了一个带有已公布兑换率的单一决策。推理变体以略高于四倍的每小时音频成本,换来 6.6 个指数点、6 个点的语音推理和 38.5 个点的智能体任务完成度。这笔钱是否值得花,完全取决于你的智能体在做什么——而一旦组件公布,答案的形态就变了。一个以完成多步骤任务为职责的语音智能体,买到的是本次发布中单一最大幅度的改进:每小时 3.50 美元,同时比 GPT-Live-1 Astra 低约 40%,比 Grok Voice Think Fast 2.0 High 低约四分之一,且得分高于两者。一个以对话为职责的语音智能体——回答、保持话题连贯、接收留言、令人愉快——用额外的推理深度几乎买不到什么,而每小时 0.84 美元买到的是目前所有人发布的最便宜的合格语音模型。

这就是这份榜单的格局。Google 将其推理模型的定价压到了它击败的那两个模型之下,又将其标准模型的定价压到了榜单上所有模型之下。如果你要大规模跑语音分钟数,推动你账单的是这个数字,而不是指数得分——而这两个版本相差 4 倍,意味着选择调用哪一个,是整套技术栈中最大的单项成本杠杆。

“Private preview”在那句话里可是实打实地发挥着作用

从合同意义上说,这两个模型都尚未普遍可用,但开发者接口已经开放,而且现在已有定价,这改变了你可以据此规划的内容:

Gemini 3.8 Live — 开发者可通过文档中记录的 ID 在 Gemini API、Live API 和 Google AI Studio 中获取gemini-3.8-live;企业用户可在 Gemini Enterprise 中获得私有预览,面向客户体验的 Gemini Enterprise 则“即将推出”;所有人都可在 Search Live 中使用。

Gemini 3.8 Live Extended Thinking — 在 gemini-3.8-live-extended-thinking 下提供相同的开发者接口,并增加了更广泛的消费者途径:面向 Google AI Pro 和 Ultra 订阅者的 Gemini Live、Docs Live,以及面向所有 Google AI 订阅者的 Gmail Live 和 Keep Live。

目前仍然缺失的,正是企业所需要的那部分:正式可用(GA)承诺、已公布的正常运行时间数据,以及 Google 承诺维持的费率。如果你需要这些,那就再等等。如果你正在做原型开发,这条路径今天就已经开放,而且背后有真实的价目表支撑——这比一个未公布价格的预览版所处的境况要好得多。现在就开始构建集成是合理的;但把一条关乎收入的电话线押在 Google 尚未承诺的可用性目标上,则并不合理,针对这一问题的解决办法见下文。

供应商索赔在哪里结束

谷歌在发布的同时也公布了自己的分项数据——τ-Voice 上为 68.6%,Sierra 的 τ³-Banking 排行榜上为 35.1%,Big Bench Audio 上为 97.7%,这些成绩均归功于 Extended Thinking 模型。如今,这些数字被分成了两组,而这种划分至关重要。

三项中有两项与 Artificial Analysis 在其自有测试框架下自行运行的测量结果一致。其 τ-Voice 智能体组件显示该模型为 68.6%,而 GPT-Live-1 Astra 为 67.9%,Grok Voice Think Fast 2.0 为 56.5%;其 Big Bench Audio 语音推理组件显示为 98%,而 Google 的为 97.7%。Artificial Analysis 将 τ-Voice 和 Big Bench Audio 描述为其自有基准,在可行的情况下会进行三次试验。因此,τ-Voice 和推理数字现在出现在一个你可以去查看的公开榜单上,而不仅仅是在 Google 的公告中——应将其视为得到佐证,而非已有定论,因为 Google 引用的确切数字很可能就是同一次运行的结果,而不是第二次独立运行。

Sierra 的那个数字没有此类佐证,仍属厂商宣称:在 Sierra 的 τ³-Banking 排行榜上为 35.1%,而 GPT-Live-1 Astra 为 32.0%,xAI-Realtime 为 16.5%。这同样是一个值得细细思量的数字,因为 35.1% 意味着该榜单上领先的语音模型,在每三次真实的银行业务任务完成尝试中大约有两次会失败。Google 还引用了在 Gemini Enterprise Agent Platform 中于 Live API 上执行的一项 ServiceNow EVA-Bench 运行,并将这两款模型描述为正在推动复杂工作流的帕累托前沿——而这两项说法都没有附带独立解读。

这里有一个值得牢记的先例。xAI 在 7 月报告称,Grok Voice Think Fast 2.0 的语音到语音指数(Speech to Speech Index)为 82.9。在上面截取的榜单中,该模型的得分为 81.3。供应商报告的指数得分并不总能经受住实时排行榜的检验——通常是因为该指数会被修订,有时则是因为所测试的配置并非最终发布的配置。请在你自己的流量上验证 τ-Voice 和 Big Bench 的数值,并把 agentic 列视为最需要重点测试的一列。

这些智能体实际运行的层级

这两个模型都位于后端之前。后台工具执行、多步任务规划,以及每个严肃的语音代理都会采用的委托模式,最终都归结为普通的文本模型调用——而这正是成本差异最大、锁定程度最低的层面。

OrcaRouter 提供 来自单一密钥的 190 个模型,按提供商标价,无任何加价,这意味着上游实验室的降价当天就会在我们这边生效,而不是等到下一次合同续约。对于前端为预览模型的语音栈来说,两个有用的特性是:可以在不触及语音集成的情况下更换委派目标,并且当后端出错或超时时,自动故障转移能让通话保持不中断。准确说明我们托管什么、不托管什么:Gemini 3.8 Live 端点不在我们的路由器上——它们来自 Google 自己的 API——但这些智能体常常将工作转交到的文本模型往往就在我们这边,其中包括 Gemini 3.8 Flash

接下来看什么

有三件事将决定本次发布中悬而未决的问题。第一件是正式可用性以及谷歌承诺维持的价格——价格现已公布,但预览定价向来有变动的习惯,而价目表并不等于合同。第二件是竞技场和任务成功率这两列数据是否站得住脚,因为标准模型的 1083 Elo 和 93.2% 任务成功率,是反对为推理版本支付 4 倍价格的最有力论据,而且该指数中的竞技场数字是在资格认定时冻结的,而非实时数据。第三件是针对智能体差距本身的独立复现:68.6% 对 30.1% 是本次发布中最大的主张,也最值得复现,因为这两款模型在其他所有方面都相差无几。

在那之前,诚实的总结要依据两个数字,而不是一个。Gemini 3.8 Live Extended Thinking 是公开榜单上得分最高的语音模型,在智能体分项上直接领先,并且按小时成本低于紧随其后的两个模型。Gemini 3.8 Live 是该榜单上最便宜且够用的语音模型,更受竞技场青睐,在浅层任务上更可靠,但总分落后 6.6 分,并且在智能体被雇来做的唯一那件事上存在硬上限。谷歌已经两次推出同一分叉,价格相差四倍,让这个选择在定价上变得异常容易——前提是你看的是分项,而不只是总指数。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新