Gemini 3.8 Live Extended Thinking 与 Gemini 3.8 Live 的主视觉标题卡,展示两款模型因每小时音频成本相差 4 倍而分化,$3.50 对 $0.84。
Guides & Insights

Gemini 3.8 Live Extended Thinking 对比 Gemini 3.8 Live:为真正重要的 38 分多付 4 倍价钱

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

两个模型,一次发布,一份费率卡,以及一个大多数报道都以相同方向搞错的决策。Gemini 3.8 Live Extended ThinkingGemini 3.8 Live于2026年9月15日一同发布,两者均基于Gemini 3 Pro构建,均支持97种语言并可在对话中途自动切换,均可接受近乎实时的视觉输入,也都会用SynthID为生成的音频添加水印。在Artificial Analysis发布的综合Speech to Speech Index上,二者相差6.6分——82.6对76.0。在同一榜单所衡量的每小时音频成本上,二者相差略高于四倍。

这两个数字都不该决定你的架构。真正应该决定它的是 38:这是两者在 τ-Voice——智能体任务完成组件——上的差距,其中推理变体解决了 68.6% 的模拟客服场景,而标准变体解决了 30.1%。你不是在好模型和更好的模型之间做选择。你是在一个对话式界面和一个恰好会说话的推理系统之间做选择,而价格差异是这一选择中最不有趣的部分。

价格分叉,以你实际被计费的单位表示

先从账单说起,因为这是人们容易算对、随后却会过度看重的那部分。两个模型通过 Live API 都采用相同的公开费率:音频输入每分钟 $0.005,音频输出每分钟 $0.018,而在 Extended Thinking 这一侧,那些输出 token 包含了思考部分。同样的价目表,同样的费率,没有为推理单独设置高级层级。

差异在你以工作量而非分钟来衡量时就会显现出来。Artificial Analysis 的“每输入音频小时成本”列——完成固定的 40 题 Big Bench Audio 子集的成本,按每小时数值归一化后——将这两个模型完全归入了不同的档位:

Gemini 3.8 Live Extended Thinking(High)——输入音频每小时 3.50 美元,依据 Artificial Analysis 自身的测算

Gemini 3.8 Live — 每小时 $0.84,是该榜单上报酬最低的

• GPT-Live-1(Astra 后端,中等强度)——每小时 5.83 美元,因此该推理变体仍比它击败的模型便宜约 40%

Grok Voice Think Fast 2.0 High —— 每小时 4.80 美元

• GPT-Realtime-2.1 High — 每小时 $10.75

这就是分岔所在:在同样公布的每分钟费率下,每小时的音频成本却是四倍,因为推理版本为了完成同样时长的聆听会消耗更多 token。标准模型的 0.84 美元并非折扣,而是整个榜单的地板价。

38分能买到什么

把复合体拆开,这两个模型就不再像是一对了:

语音到语音指数 — Gemini 3.8 Live 扩展思考(高)82.6 对比 Gemini 3.8 Live 76.0

智能体性能(τ-Voice 任务完成率) — 68.6% 对比 30.1%

语音推理(Big Bench Audio) — 98% 对比 92%

会话动态 — 91.9% 对比 96.1%

竞技场偏好(Elo) — 990 对比 1083

任务成功率 — 89.1% vs 93.2%

首次音频时间 — 1.35 秒 vs 1.18 秒

每小时输入音频成本 — 3.50 美元对比 0.84 美元

老老实实读一下,更便宜的模型在八项中赢下四项。它首次音频更快,更受竞技场青睐,更有可能完成一项浅层任务,并且在对话动态方面评分更高——最后这一点并非安慰奖,因为通话者注意到的正是对话动态。它做不到的,是完成一项有步骤的工作。30.1% 对 68.6% 是本次发布中任何地方最大的单项差距,而它恰好落在区分智能体与界面的那一个轴上。

关于这些行有两点需要注意。索引内的竞技场偏好数据在模型符合发布条件时即被冻结,因此它是快照,而非滚动 Elo——应将其视为某一时点的评分,而不是实时 Speech Agent Arena 图表。而且 τ-Voice 榜单顶部竞争很激烈:推理变体的 68.6% 以 0.7 个百分点领先于 67.9% 的 GPT-Live-1(Astra 后端,中等投入),GPT-Live-1(Sol,低投入)以 59.3%、Grok Voice Think Fast 2.0 High 以 56.5% 位居其后。对 GPT-Live-1 的 0.7 个百分点领先在噪声范围内。而这一对内部的 38 个百分点差距则不在。

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and Gemini 3.8 Live across six dimensions: Speech to Speech Index 82.6 vs 76.0, agentic performance on tau-Voice 68.6 percent vs 30.1 percent, speech reasoning on Big Bench Audio 98 percent vs 92 percent, arena preference Elo 990 vs 1083, time to first audio 1.35 seconds vs 1.18 seconds, and cost per hour of input audio $3.50 vs $0.84.

另一个 4 倍:推理档位在代码层面让你付出多少代价

本次发布还存在第二个分支,它并未出现在任何排行榜上。这两个模型无法直接互换,因为推理变体会改变你的客户端所必须遵守的契约。

在标准模型上,Gemini 3.8 Live的表现符合 Live API 客户端的预期:后台工具和 API 调用在模型持续说话的同时运行,而 turnComplete: true仍标记着一轮的结束。没有可选的思考级别设置,因为并没有什么需要单独配置——模型给出回答,回答完毕,这一轮就结束了。

Gemini 3.8 Live Extended Thinking上,有三件事会同时发生变化:

函数调用始终是异步的。阻塞式工具声明不会礼貌地排队——它会返回硬错误。你为标准模型编写的任何工具 schema 都必须重新声明为非阻塞式。

一个新的状态字段承载真实状态。客户端必须读取 interaction_status,而不是信任 turnComplete:当模型仍在推理或工具仍在运行时,该字段显示 IN_PROGRESS,只有整个任务完成后才会变为 IDLE。一个回合可以结束,但任务可能尚未结束。

思考深度是一个可调旋钮。该模型提供可配置的推理级别——低、中、高——而榜单上的 82.6 和 68.6 这两个数字对应的是 (高)配置。降到低级别会同时改变质量和 token 开销,而榜单上没有任何信息告诉你,低级别在任务完成上会让你付出什么代价。

第三点正是迁移陷阱。因为在涉及工具调用之前,Extended Thinking 在网络传输层面的响应方式与标准模型完全相同,所以团队可以替换模型 ID、看到一个能正常运行的演示,直到在生产环境中预订工具返回错误而非结果时,才会发现这个异步约定。在做预算时,要把客户端重构与 4 倍音频费率一并考虑;在成熟的集成中,前者是这两项成本中更大的那一项。

你的工作负载实际需要的是哪一个

决定一个会话的干净方式是问它的用途是什么,而不是你希望它有多聪明。

选择Gemini 3.8 Live,当对话本身就是交付成果时。接听、保持话题、记录留言、筛选来电者、令人愉快且快速且便宜。以每小时0.84美元的输入音频计算,它是目前任何人发布的最便宜的胜任语音模型,它受到竞技场的青睐,在浅层任务上更可靠,并且首次音频输出快170毫秒——这是来电者能感受到的差异。唯一需要接受的是上限:多步任务完成率30.1%意味着它无法完成有步骤的工作,再多的提示工程也无法改变这个数字。

当会话有任务要完成时,选择Gemini 3.8 Live Extended Thinking。预约、修改、取消、解决账户问题、在来电者等待时引导其完成多步骤流程。这就是那条38分的分界线,而它每小时价值3.50美元——请注意,这仍然比它在综合评分上超过的两个模型都便宜。你还能获得让等待变得可以忍受的旁白行为:这个模型一边推理一边说话,所以当它去查东西时,来电者听到的不是沉默,而是“让我查一下……”以及随进展而更新的提示。这正是全双工架构通过从不停下音频来解决的同一个问题;谷歌的答案是边干活边说个不停。

还有两行数据值得纳入考量。Google 还报告称,Extended Thinking 模型在 Sierra 的 τ³-Banking 排行榜上为 35.1%,而 GPT-Live-1 Astra 为 32.0%——这个由厂商报告的数字背后没有独立读数支撑,而且从绝对水平看也令人警醒,因为 35.1% 意味着该榜单上最好的模型在大约每三次真实的银行任务尝试中会失败两次。标准模型在 Speech Agent Arena 中排名第二——Google 在自己的材料中引用了这一点——这是另一个排行榜上的真实结果,衡量的是偏好而非任务完成。这两种说法都成立。合在一起,它们说明:廉价模型非常擅长供人交谈,而昂贵模型是二者中唯一能被分配工作的。

同时运行两者,无需两个集成

这一切在实践层面的反对意见是:按工作负载来挑选,意味着要维护两条路径。其实未必。两种变体都处在同一类后端之前——后台工具执行与多步规划最终都归结为普通的文本模型调用——而正是这一层,承载着你的成本差异,也正是切换代价低廉之处。

OrcaRouter 提供单一密钥即可调用的 190 个模型,按供应商标价提供,不加价,因此供应商调价当天就会在我们这边生效,而无需等到下一次合同续签。对于一个在廉价的对话层级与昂贵的推理层级之间路由的技术栈而言,真正重要的两个特性是:委派目标可以在实时流量上切换,而无需改动语音集成;以及当后端出错或超时时,自动故障转移能让会话保持存活。为明确我们托管什么、不托管什么:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 端点并不在我们的路由器上——它们来自 Google 自己的 API,即 Gemini API、Live API 和 Google AI Studio。这些智能体常常把工作交接给文本模型,Gemini 3.8 Flash 便是其中之一。

每个模型在棋盘上的位置

下面的截图拍摄于 2026 年 9 月 16 日,Speech to Speech Index 的顶部内容如下:

Gemini 3.8 实时扩展思考(高)——82.6,第一名

• GPT-Live-1(Astra 后端,中等计算量)——81.5

• Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1(Sol 后端,低投入)— 80.1

Gemini 3.8 Live — 76.0,第五名

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

在您阅读该列表时,有一点命名说明:覆盖范围中此模型附带的(High)后缀是推理强度配置标签,而非单独的发布版本。这与该榜单用于 Grok Voice Think Fast 2.0 High 和 GPT-Realtime-2.1 High 的惯例相同。

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 at 81.5, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

还有什么仍未提交?

关于这对模型,有一点很容易被误读,因此值得直说:尽管两者都已定价并备有文档,但从合同意义上讲,两者都并非正式普遍可用。

开发者可在 Gemini 3.8 LiveGemini API、Live API 和 Google AI Studio 中以 ID gemini-3.8-live;企业可在 Gemini Enterprise 中获得私密预览,Gemini Enterprise for Customer Experience 列为即将推出;消费者可在 Search Live 中使用。Gemini 3.8 Live Extended Thinking具有相同的开发者接口,ID 为 gemini-3.8-live-extended-thinking,并拥有更广泛的消费者途径——Gemini Live、面向 Google AI Pro 和 Ultra 订阅用户的 Docs Live,以及面向所有 Google AI 订阅用户的 Gmail Live 和 Keep Live。Workspace 商业客户列为即将推出。

缺失的,正是企业在靠它创收之前所需要的东西:正式可用性承诺、已公布的正常运行时间数字,以及谷歌承诺维持的费率。价格已经公布,而预览版定价往往会变动。现在就做原型,规划迁移,并且不要签署一个尚未向你提供的可用性目标。

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

这对模型实际呈现的决策比指数所显示的更狭窄,而且它并不是一条质量阶梯。如果你的智能体的工作是对话,那么廉价模型并非折衷——它是更低价格下的更优产品,而便宜四倍的费率是额外好处,而不是论据。如果你的智能体的工作是完成某件事,那么推理变体是两者中唯一能被赋予该任务的,而每小时3.50美元相对于否则会失败的预订来说只是舍入误差。要避免的错误是折中:为一个只需要良好对话的工作负载支付推理深度的费用,当团队读到6.6分的综合差距而从不向下滚动到38时,就会发生这种情况。