
Gemini 3.8 Live vs GPT-Live-1:全双工 vs 边说话边思考的模型
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
大约两个月来,这场争论一直由架构来定论。GPT-Live-1是真正的全双工——它一边说一边听,会发出“嗯嗯”“明白了”这类反馈信号,并且每秒多次决定是该继续说,还是该让出话轮。Gemini 3.8 Live于 2026 年 9 月 15 日发布,是一个基于轮次的模型。按过去的框架来看,这让比较变得很简单,而如今这种解读方式已经错了。
真正的变化不在于谷歌追平了全双工。而在于谷歌交付了全双工此前一直被用来弥补的那样东西:一个能在多步骤任务于后台运行的同时维持对话的语音模型,以及另一个会在工作时把推理过程说出来的变体。架构层面的差异确实存在。只是它已不再是决定购买的那条轴线。
让对话继续下去的两种方法
全双工的核心赌注在于,对话质量本身就是产品。GPT-Live-1 在单一模型内部连续、同步地处理输入和输出音频,而不是将语音转文本、接入语言模型、再转为文本转语音这样串联起来。这消除了各阶段之间的信息损失,并带来了人们真正能察觉到的行为表现:你可以在它回答到一半时插话,它会随之调整;它不会把一次停顿或背景噪音误当成你发言的结束;在未被叫到之前,它会保持安静。
Gemini 3.8 Live 下的这注押在轮次式交互上:对话只是工作的脚手架。它的各项功能旨在让会话保持高效产出,而不是让节奏保持自然:近实时的视觉输入处理、在对话中途自动切换 97 种支持的语言,以及后台工具与 API 执行——它会先确认请求,再一边继续交谈,一边等待调用完成。
两个模型在思考时都不会挂断你。它们只是拒绝的方式不同。GPT-Live-1 靠从不停止音频流来做到这一点。谷歌则靠一边工作一边说话来做到这一点。

指数究竟说明了什么
Artificial Analysis 维护着一个 Speech to Speech Index——一个由语音推理、智能体性能、竞技场偏好和任务成功率组成的加权综合指标。请仔细阅读 2026 年 9 月 16 日截取的榜单,因为标题掩盖了结构:
• Gemini 3.8 Live Extended Thinking — 82.6(第一)
• GPT-Live-1(Astra 后端,中等计算量)——81.5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1(Sol 后端,低投入)— 80.1
• Gemini 3.8 Live — 76.0
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71.5
从这一排名中可以得出三点。第一,Google 占据了榜首,但靠的是昂贵的那一版本,而不是大多数人会部署的那一版本。第二,GPT-Live-1 出现了两次,因为 Artificial Analysis 评分的是整个系统,而不是语音前端——而且其两种配置之间 1.4 分的差距,是第一名和第二名之间 0.2 分差距的七倍。第三,这次对比标题中的模型 Gemini 3.8 Live 排在第五,低于 GPT-Live-1 的两个配置。
如果你是在进行同类比较——标准档对标准档——那么 GPT-Live-1 在综合指数上赢得了这场对决,而且差距不小。82.6 属于 Gemini 3.8 Live Extended Thinking,那是一款不同的产品,价格不同,推广方式也不同。

GPT-Live-1 仍然领先的地方
全双工并非营销噱头,基准测试的分项结果表明了它在哪里转化为真正的优势:
• 智能体性能 —— GPT-Live-1 在 τ-Voice 上以 67.9% 对 Grok 的 56.5% 决定性领先。谷歌尚未公布 Gemini 3.8 Live 可比的 τ-Voice 数据,仅为 Extended Thinking 版本公布了 68.6%。
• 对话动态——全双工轮流发言仍是自然度的衡量基准,而基于轮次的模型历来在这方面落后。
• 委托深度 — GPT-Live-1 将高难度查询移交给前沿文本模型处理,GPT-5.5 和 GPT-6 Astra 均被记录为后端,并公开了推理强度选择器。
• 溯源 — ChatGPT 的语音转写会附带引用链接,这在语音交互中总体上仍不常见。
制衡因素在于,GPT-Live-1 在原始语音推理上落后:在 Big Bench Audio 上为 90.1%,而 Grok 为 97.2%。而且其在 Full Duplex Bench 上 0.798 秒的主打延迟数据,与 API 的首个音频时间并非同一种测量口径,后者为 1.24–1.34 秒。
Gemini 3.8 Live 领先之处
Google 的优势与其说在于对话,不如说在于这个会话能做什么:
• 视觉,如今 — Gemini 支持摄像头输入和屏幕共享已有一段时间。GPT-Live-1 发布时并未提供视频或屏幕共享功能,OpenAI 表示这些功能即将推出,并指出较旧的 Advanced Voice Mode 可作为临时替代方案。Gemini 3.8 Live 则在此基础上新增了近乎实时的视觉输入处理能力。
• 语言覆盖范围——支持 97 种语言,并可在对话中自动切换,相比之下 OpenAI 一侧的覆盖范围要窄得多。
• 成本——公布的价格为每分钟音频输入 $0.005、每分钟音频输出 $0.018。GPT-Live-1 仅前端部分就按每语音分钟 $0.05 计费,计入后端 token 后,实测总成本约为每小时 $4.47–$5.83。
• 会出声推理的第二梯队——Gemini 3.8 Live Extended Thinking 会用“让我查一下……”之类的提示语讲述进展,这是对沉默问题的另一种解答,与全双工方案不同。
真正重要的成本比较
前端价格看上去像是碾压——每分钟 $0.018 对 $0.05——而按小时计算的数字更加悬殊。Artificial Analysis 的每输入音频小时成本图表显示,Gemini 3.8 Live 为 每小时 $1.50,而 GPT-Realtime-2 High 为 $4.14,GPT-Realtime-2.1 High 为 $10.75。Grok Voice Think Fast 2.0 则为 $4.80。
问题在于,这两个数字都不是真正的账单。GPT-Live-1 的每分钟 0.05 美元只覆盖语音前端;负责实际推理的后端文本模型单独计费,这就是一个 0.05 美元的宣传价如何变成每小时 4.47–5.83 美元的全包成本。Gemini 3.8 Live 具有相同的结构形态——后台工具执行属于文本模型的工作——而 Google 尚未公布其成本是多少。
所以,诚实的解读是:Gemini 3.8 Live 在入门价上便宜得多,而在你衡量自己的工作负载之前,两者的总成本对比都是未知的。这不是回避;这就是信息本身的实际状态。
它们两者都委托给的那一层
这是让这场对比不像看上去那样是个一锤定音决定的结构性事实。两个模型都采用委派机制。GPT-Live-1 按设计把难题交给后端文本模型处理,而 Gemini 一侧的后台工具执行最终也会归结为普通的模型调用。在两种情况下,语音前端都只是薄薄的一层,真正负责推理的是其下的文本模型——而正是这层文本层决定了你的成本波动,也正是切换成本低廉的地方。
OrcaRouter 承载190 款模型,仅需一个密钥,按供应商目录价提供,不收取任何加价,因此上游的降价当天就能反映到我们这边,而不必等到下一次合同续签。对于语音技术栈而言,真正重要的两个特性是:委派目标可以在实时流量上被替换,而无需改动语音集成;以及当后端出错或超时时,自动故障转移能让通话保持不中断。有一点需要澄清,因为很容易让人误解为相反的情况:我们并不托管 Gemini 3.8 Live 或 GPT-Live-1 语音端点——这些端点来自供应商自己的 API。它们把工作转交出去的文本模型通常都在路由器上。

如何选择
选择GPT-Live-1,如果对话质量就是产品本身——自然的打断处理、附和式回应,以及那种你是在与某个东西交谈、而不是在操作它的感觉——并且你能承受总成本,而它远高于标称费率所暗示的水平。请注意,其 API 直到 2026 年 9 月才可用,因此围绕它的第三方工具还很年轻。
选择Gemini 3.8 Live,前提是你现在就需要视觉能力,需要支持二十多种以上的语言,或者按分钟计算的经济性是你模型选择的主导因素。同时要接受:你买到的是标准版,它在综合指数上排名第五而非第一;而所有人都会引用的那个 82.6 分,属于 Extended Thinking 变体。
如果重点在于推理能力,且你想要当前指数榜上的领跑者,那就选Gemini 3.8 Live Extended Thinking——但请先确认它的上线情况,因为它经由 Gemini Live、Docs、Gmail 和 Keep 的分发路径比标准模型更广,而且其企业版可用性仍处于私密预览阶段。
下个季度值得关注的是,全双工是否仍能构成护城河。轮次式模型正通过另一条路径缩小对话差距——在工作推进的同时用旁白让音频保持忙碌——如果这在真实流量下依然成立,那么过去一年定义这一品类的架构区别,将不再是买家会问起的东西。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
