
Gemini 3.8 Live Extended Thinking 与 GPT-Live-1:1.1 分之差持平,账单却截然不同
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
在综合得分上,这是平局。 Gemini 3.8 Live Extended Thinking在 Artificial Analysis 的 Speech to Speech Index 上得分为 82.6; GPT-Live-1在其 Astra 后端以中等推理强度运行时,得分为 81.5。在其下方的智能体组件——τ-Voice 任务完成率——上,差距为 0.7 个百分点,68.6% 对 67.9%。在推理组件上,差距更大且方向相反:Gemini 模型在 Big Bench Audio 上为 97.7%,GPT-Live-1 为 90.1%。这组差距中没有任何一项能在第二次基准测试运行后依然成立,而且它们中没有一项应成为你决策的依据。
区分这两者的不是质量。而是它们在以下问题上各执一词:语音智能体是什么、由谁来完成思考,以及——最先触及预算项的那部分——会话如何计费。Gemini 3.8 Live Extended Thinking 按音频 token 收费,并在同一个负责说话的模型中进行推理。GPT-Live-1 按会话时长收取固定费用,无论是否有人在说话,并把实际的思考工作交给一个单独的文本模型,由你选择并单独付费。这是两款披着相同基准测试分数外衣的不同产品,而哪一款合适,取决于排行榜从不问的一个问题:在你的线路上,一次平均通话是什么样子?
1.1 分的平局,以及它究竟在哪里被打破
从数字说起,因为标题的单薄恰恰是关键所在:
• 语音到语音指数 — Gemini 3.8 Live 扩展思考(高)82.6 对比 GPT-Live-1(Astra 后端,中等投入)81.5
• 智能体性能(τ-Voice 任务完成率)—— 68.6% 对比 67.9%,而 GPT-Live-1 以低推理强度运行 Sol 后端时为 59.3%
• 语音推理(Big Bench Audio) — 97.7% 对比 90.1%,这是唯一一个差距并非噪声所致的组件
• 复杂的银行业务流程(Sierra τ³-Banking,供应商报告) — 35.1% 对比 32.0%
• 首个音频生成时间 — 1.35 秒,而通过 API 为 1.24–1.34 秒
• 实测每小时成本 — Astra 配置为 3.50 美元,对比 5.83 美元,两者均基于 Artificial Analysis 的输入音频测量结果
坦诚的解读是:这两个模型在综合指标上难分高下,在语音推理上则可分出差异——Gemini 模型领先近八分,在成本上也可分出差异——它领先约 40%。GPT-Live-1 占据优势的地方,在于基准测试难以打分的那部分体验:它是真正的全双工,边说边听,发出反馈信号,每秒多次决定是该说话还是让出话轮。Gemini 3.8 Live Extended Thinking 则是基于轮次的。它通过叙述来解决同一个根本问题——在智能体工作期间让来电者陷入沉默——一边推理一边说话,在任务运行时给出“让我查一下……”之类的提示。
两种做法都能让这条线活下去。它们给人的感觉不同。只有其中一种会出现在指数上。

两种计费模式,以及费率卡为何会误导人
这是决定大多数部署成败的章节,而恰恰是它被文档覆盖所跳过。
Gemini 3.8 Live Extended Thinking的计费方式与 token 模型相同。通过 Live API,公布的费率为每百万音频输入 token 3.00 美元——约合每分钟音频输入 0.005 美元——以及每百万音频输出 token 12.00 美元,约合每分钟 0.018 美元,其中思考 token 计入输出部分。你只为实际传输的音频付费。通话方停顿、思考或被搁置时,只要他们不出声,就不会产生任何费用。
GPT-Live-1 的计费方式和电话线路一样。它按每分钟 0.05 美元的固定价格收取会话时长费用,按秒计费,无论谁在说话、也不管有没有人说话。推理后端不包括在内:负责思考的文本模型以及它调用的任何工具都会另行叠加计费。正因如此,0.05 美元的宣传价,在 Sol 后端上按 Artificial Analysis 的测算,实际全包费用约为每小时 4.47 美元,而在 Astra medium 上约为每小时 5.83 美元。
把它们并排放在一起看,那种天真的比较——每分钟 $0.018 对 $0.05,2.8 倍的差距——在两个方向上都是错的。实测的每小时数字显示,真实差距是 $3.50 对 $5.83,更接近 1.7 倍。但会话时钟模型改变的不仅是账单的水平,还有账单的形态:在 GPT-Live-1 上,你的成本随通话时长变化,所以一条充斥着长时间、安静、低内容通话的线路——客服队列、验证步骤、IVR 转接——和一条高密度线路付一样的钱。在 Gemini 这边,成本随音频变化,所以静音免费,而啰嗦不是。先拿你自己的平均通话时长来算,再去算每分钟费率,因为决定这两者中哪个对你更便宜的正是那个数字,而对于预订线路和分诊线路,答案并不相同。
思考发生的地方
第二个结构性差异在于委托,而正是这一点决定了在这个技术栈中,你实际上能替换掉多少部分。
GPT-Live-1 是一个前端。它负责处理双工音频,而当某个查询需要真正的推理时,它会把这项工作交给一个独立的后端模型——GPT-5.5 和 GPT-6 Astra 都被记录为后端——并配有推理强度选择器,让你可以决定要购买多少后端算力。这就是为什么榜单上 GPT-Live-1 会以不同的分数出现两次:在 Astra 上以中等强度得 81.5 分,在 Sol 上以低强度得 80.1 分。它自身这两种配置之间 1.4 分的差距,比这场对决中两个模型之间 1.1 分的差距还要大,这说明在 OpenAI 这一侧,你选择哪种配置比你选择哪个供应商更重要。
Gemini 3.8 Live Extended Thinking就在同一个会开口说话的模型里进行推理。没有需要另行选择的后端,也没有为此单开的一份账单;代价是,你得在同一个模型上用思考等级——低、中、高——来调节深度,而 82.6 和 68.6 这两个数字对应的是(High)配置。后台工具和 API 执行在两边都是异步运行的,所以两个模型都不会在工作期间挂断。
一个实际后果是:由于 GPT-Live-1 的智能是语音前端背后一个外购的文本模型,它的质量上限会随着 OpenAI 发布文本模型而提升,而不是随着 OpenAI 发布语音模型而提升。Gemini 3.8 Live Extended Thinking 的上限则会随着 Google 重新训练音频模型而变动。如果你要对一个语音平台下为期两年的赌注,那么这种升级节奏上的差异,比 1.1 个指数点更值得深思。
无论你怎样选择,转换成本是什么
这两者都不是模型 ID 的简单替换,把它们当作替换来处理的团队会在生产环境中吃到苦头。迁移到 Gemini 3.8 Live Extended Thinking,意味着要接受一套不同的轮次契约:函数调用始终是异步的,因此声明为阻塞式的工具会直接返回硬错误,而不是排队等待;客户端必须读取 interaction_status 字段——IN_PROGRESS 表示推理或工具仍在运行,IDLE 才表示整个任务已完成——而不能相信 turnComplete 就意味着工作已经结束。迁移到 GPT-Live-1,则意味着要采纳其后端选择的配套机制以及第二套计费入口,还要忍受一个 2026 年 9 月 10 日才向开发者正式开放、此前已于 7 月 8 日在 ChatGPT 中亮相的 API——因此围绕它的第三方工具、SDK 和可观测性生态只有几个月而非数年的积淀。无论朝哪个方向迁移,都要在 token 账单之外为集成工作预留预算。在成熟的语音技术栈上,重构通常比这两者中的任何一项都更昂贵。
如何在不押注于它的情况下进行这样的比较
要为一个1.1个百分点的分歧下定论,明智的做法是在你自己的流量上同时运行两者,而麻烦的地方在于,这样做通常意味着两套集成、两份合同和两套凭证。但这未必意味着两套架构。在这两个系统中,语音前端都只是普通文本模型调用之上的一层薄封装——对GPT-Live-1来说这是明确说明的,而在Gemini这边,后台工具执行也以同样的方式解决——而正是这个文本层,才是你的成本差异所在之处,也是切换真正成本低廉的地方。
OrcaRouter 提供 190 个模型,均可通过单一密钥按提供商标价访问,且无加价,因此上游价格一旦变动,我们这边当天即可生效,而不必等到下一次合同续约。对于语音技术栈而言,真正重要的两个特性是:可以在实时流量上切换委派目标,而无需改动语音集成;以及在后端出错或超时时,自动故障转移能让通话保持不中断——正是这一点让你能够在真实流量上试用未经验证的配置,而无需让生产线路依赖它。准确说明我们托管什么、不托管什么:Gemini 3.8 Live Extended Thinking 端点和 GPT-Live-1 端点都不在我们的路由器上——它们来自 Google 和 OpenAI 各自的 API。而它们所委派到的文本模型则常常在我们的路由器上,Gemini 3.8 Flash 就是其中之一。
榜单顶端,以及它多么难以尘埃落定
以下截图拍摄于2026年9月16日:
• Gemini 3.8 实时扩展思考(高)——82.6,第一名
• GPT-Live-1(Astra 后端,中等强度)— 81.5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1(Sol 后端,低投入)— 80.1
• Gemini 3.8 Live — 76.0
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71.5
有三件事值得注意。首先,第一和第三相差 1.3 分,第一和第五相差 6.6 分,所以这个榜单的头部是一场混战,而不是一个排名。其次,这场对比标题中的模型并不是排名第五的 Gemini 条目——那是标准版 Gemini 3.8 Live,一个不同且便宜得多的产品,不应与这里正在比较的推理变体混淆。第三,把任何单一指数数值视为暂定是有先例的:xAI 在 7 月报告 Grok Voice Think Fast 2.0 为 82.9,而该模型在这个榜单上显示为 81.3。厂商报告的指数分数并不总能经受住实时排行榜的检验。68.6% 和 67.9% 的 τ-Voice 数字现在位于 Artificial Analysis 自有测试框架下运行的公开榜单上,因此它们得到了佐证,而不仅仅是宣称——但在同一测试框架下,两个模型之间 0.7 分的差距算不上差异。要么用你自己的流量验证,要么忽略它。

还有一个数字值得纳入决策考量,因为它是这组对比中最令人不安的一个:Google 报告称,Gemini 3.8 Live Extended Thinking 在 Sierra 的 τ³-Banking 排行榜上为 35.1%,而 GPT-Live-1 Astra 为 32.0%。这些数字由厂商自行报告、未经复现,它们所描述的图景是:该榜单上领先的语音智能体在每三次真实银行任务尝试中,大约有两次会失败。如果你的智能体必须完成受监管的多步骤工作,那么这两个模型都还谈不上成熟——在该基准上 3.1 个百分点的领先,并不能成为选择某家厂商的理由,而应成为让人类留在决策环路中的理由。

那么:如果对话自然度就是产品本身,而你的通话又短又密集,那么 GPT-Live-1 的全双工行为就是索引看不到的真正优势,而且在这种通话时长下,按会话时钟计费也还过得去。如果通话时间长、安静或变化不定,或者语音推理和每小时成本占据主导,那么 Gemini 3.8 Live Extended Thinking 在真正重要的组件上更胜一筹,而且做到这一点时每小时还便宜约 40%——但前提是:它基于轮次,企业版仍处于预览阶段,并且需要先重构客户端,才能运行你的工具。所有这些都不能证明,凭 1.1 个索引点的优势来选择其中任何一个是合理的。根据现有证据,在这两者之间做出选择的诚实理由,是计费模型及其底层架构,而这两者都是你这周就可以在自己的流量上衡量的东西。
在 OrcaRouter 上,自动故障转移可让通话保持不中断。当后端出错或超时时,
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
