用于 Gemini 3.8 Live 对 GPT-Live-1 的主视觉标题卡,肩题为“OrcaRouter · 模型雷达——正面交锋”,副标题为“全双工与轮次制——架构之争,重新审视。”两张卡片分别写着“Gemini 3.8 Live——轮次制,现已支持视觉,97 种语言,分钟成本更低”和“GPT-Live-1——全双工,背景回应,可委派给前沿后端”,并配有标签:指数 76.0 对 81.5、每分钟 $0.018 对 $0.05,以及 OpenAI 即将推出视频。OrcaRouter 标志合成在右下角。
Guides & Insights

Gemini 3.8 Live vs GPT-Live-1:全双工 vs 边说话边思考的模型

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

大约两个月来,这场争论一直由架构来定论。GPT-Live-1是真正的全双工——它一边说一边听,会发出“嗯嗯”“明白了”这类反馈信号,并且每秒多次决定是该继续说,还是该让出话轮。Gemini 3.8 Live于 2026 年 9 月 15 日发布,是一个基于轮次的模型。按过去的框架来看,这让比较变得很简单,而如今这种解读方式已经错了。

真正的变化不在于谷歌追平了全双工。而在于谷歌交付了全双工此前一直被用来弥补的那样东西:一个能在多步骤任务于后台运行的同时维持对话的语音模型,以及另一个会在工作时把推理过程说出来的变体。架构层面的差异确实存在。只是它已不再是决定购买的那条轴线。

让对话继续下去的两种方法

全双工的核心赌注在于,对话质量本身就是产品。GPT-Live-1 在单一模型内部连续、同步地处理输入和输出音频,而不是将语音转文本、接入语言模型、再转为文本转语音这样串联起来。这消除了各阶段之间的信息损失,并带来了人们真正能察觉到的行为表现:你可以在它回答到一半时插话,它会随之调整;它不会把一次停顿或背景噪音误当成你发言的结束;在未被叫到之前,它会保持安静。

Gemini 3.8 Live 下的这注押在轮次式交互上:对话只是工作的脚手架。它的各项功能旨在让会话保持高效产出,而不是让节奏保持自然:近实时的视觉输入处理、在对话中途自动切换 97 种支持的语言,以及后台工具与 API 执行——它会先确认请求,再一边继续交谈,一边等待调用完成。

两个模型在思考时都不会挂断你。它们只是拒绝的方式不同。GPT-Live-1 靠从不停止音频流来做到这一点。谷歌则靠一边工作一边说话来做到这一点。

A two-column scoreboard comparing Gemini 3.8 Live and GPT-Live-1. Index score 76.0 vs 81.5; architecture turn-based vs full-duplex; video and screen available today vs not at launch; agentic tau-Voice not published vs 67.9%; languages 97 vs a narrower set; voice price $0.005 in and $0.018 out per minute vs $0.05 per minute plus backend tokens. Footer reads 'Index figures per Artificial Analysis, Sep 16 2026; GPT-Live-1 all-in measured at $4.47-$5.83 per hour.' The OrcaRouter logo is composited in the bottom-right corner.

指数究竟说明了什么

Artificial Analysis 维护着一个 Speech to Speech Index——一个由语音推理、智能体性能、竞技场偏好和任务成功率组成的加权综合指标。请仔细阅读 2026 年 9 月 16 日截取的榜单,因为标题掩盖了结构:

Gemini 3.8 Live Extended Thinking — 82.6(第一)

• GPT-Live-1(Astra 后端,中等计算量)——81.5

Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1(Sol 后端,低投入)— 80.1

Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

从这一排名中可以得出三点。第一,Google 占据了榜首,但靠的是昂贵的那一版本,而不是大多数人会部署的那一版本。第二,GPT-Live-1 出现了两次,因为 Artificial Analysis 评分的是整个系统,而不是语音前端——而且其两种配置之间 1.4 分的差距,是第一名和第二名之间 0.2 分差距的七倍。第三,这次对比标题中的模型 Gemini 3.8 Live 排在第五,低于 GPT-Live-1 的两个配置。

如果你是在进行同类比较——标准档对标准档——那么 GPT-Live-1 在综合指数上赢得了这场对决,而且差距不小。82.6 属于 Gemini 3.8 Live Extended Thinking,那是一款不同的产品,价格不同,推广方式也不同。

Screenshot of the Artificial Analysis Speech to Speech leaderboard page, captured September 16, 2026. The AA-Speech to Speech Index bar chart shows Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 (Astra) at 81.5, Grok Voice Think Fast 2.0 at 81.3, GPT-Live-1 (Sol) at 80.1 and Gemini 3.8 Live at 76.0, alongside speed and cost-per-hour-of-input-audio panels.

GPT-Live-1 仍然领先的地方

全双工并非营销噱头,基准测试的分项结果表明了它在哪里转化为真正的优势:

智能体性能 —— GPT-Live-1 在 τ-Voice 上以 67.9% 对 Grok 的 56.5% 决定性领先。谷歌尚未公布 Gemini 3.8 Live 可比的 τ-Voice 数据,仅为 Extended Thinking 版本公布了 68.6%。

对话动态——全双工轮流发言仍是自然度的衡量基准,而基于轮次的模型历来在这方面落后。

委托深度 — GPT-Live-1 将高难度查询移交给前沿文本模型处理,GPT-5.5GPT-6 Astra 均被记录为后端,并公开了推理强度选择器。

溯源 — ChatGPT 的语音转写会附带引用链接,这在语音交互中总体上仍不常见。

制衡因素在于,GPT-Live-1 在原始语音推理上落后:在 Big Bench Audio 上为 90.1%,而 Grok 为 97.2%。而且其在 Full Duplex Bench 上 0.798 秒的主打延迟数据,与 API 的首个音频时间并非同一种测量口径,后者为 1.24–1.34 秒。

Gemini 3.8 Live 领先之处

Google 的优势与其说在于对话,不如说在于这个会话能做什么:

视觉,如今 — Gemini 支持摄像头输入和屏幕共享已有一段时间。GPT-Live-1 发布时并未提供视频或屏幕共享功能,OpenAI 表示这些功能即将推出,并指出较旧的 Advanced Voice Mode 可作为临时替代方案。Gemini 3.8 Live 则在此基础上新增了近乎实时的视觉输入处理能力。

语言覆盖范围——支持 97 种语言,并可在对话中自动切换,相比之下 OpenAI 一侧的覆盖范围要窄得多。

成本——公布的价格为每分钟音频输入 $0.005、每分钟音频输出 $0.018。GPT-Live-1 仅前端部分就按每语音分钟 $0.05 计费,计入后端 token 后,实测总成本约为每小时 $4.47–$5.83。

会出声推理的第二梯队——Gemini 3.8 Live Extended Thinking 会用“让我查一下……”之类的提示语讲述进展,这是对沉默问题的另一种解答,与全双工方案不同。

真正重要的成本比较

前端价格看上去像是碾压——每分钟 $0.018 对 $0.05——而按小时计算的数字更加悬殊。Artificial Analysis 的每输入音频小时成本图表显示,Gemini 3.8 Live 为 每小时 $1.50,而 GPT-Realtime-2 High 为 $4.14,GPT-Realtime-2.1 High 为 $10.75。Grok Voice Think Fast 2.0 则为 $4.80。

问题在于,这两个数字都不是真正的账单。GPT-Live-1 的每分钟 0.05 美元只覆盖语音前端;负责实际推理的后端文本模型单独计费,这就是一个 0.05 美元的宣传价如何变成每小时 4.47–5.83 美元的全包成本。Gemini 3.8 Live 具有相同的结构形态——后台工具执行属于文本模型的工作——而 Google 尚未公布其成本是多少。

所以,诚实的解读是:Gemini 3.8 Live 在入门价上便宜得多,而在你衡量自己的工作负载之前,两者的总成本对比都是未知的。这不是回避;这就是信息本身的实际状态。

它们两者都委托给的那一层

这是让这场对比不像看上去那样是个一锤定音决定的结构性事实。两个模型都采用委派机制。GPT-Live-1 按设计把难题交给后端文本模型处理,而 Gemini 一侧的后台工具执行最终也会归结为普通的模型调用。在两种情况下,语音前端都只是薄薄的一层,真正负责推理的是其下的文本模型——而正是这层文本层决定了你的成本波动,也正是切换成本低廉的地方。

OrcaRouter 承载190 款模型,仅需一个密钥,按供应商目录价提供,不收取任何加价,因此上游的降价当天就能反映到我们这边,而不必等到下一次合同续签。对于语音技术栈而言,真正重要的两个特性是:委派目标可以在实时流量上被替换,而无需改动语音集成;以及当后端出错或超时时,自动故障转移能让通话保持不中断。有一点需要澄清,因为很容易让人误解为相反的情况:我们并不托管 Gemini 3.8 Live 或 GPT-Live-1 语音端点——这些端点来自供应商自己的 API。它们把工作转交出去的文本模型通常都在路由器上。

Screenshot of the OrcaRouter model page for google/gemini-3.8-flash, showing the 1M-token context window, 65K max output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and p50 time to first token of 3.35 seconds.

如何选择

选择GPT-Live-1,如果对话质量就是产品本身——自然的打断处理、附和式回应,以及那种你是在与某个东西交谈、而不是在操作它的感觉——并且你能承受总成本,而它远高于标称费率所暗示的水平。请注意,其 API 直到 2026 年 9 月才可用,因此围绕它的第三方工具还很年轻。

选择Gemini 3.8 Live,前提是你现在就需要视觉能力,需要支持二十多种以上的语言,或者按分钟计算的经济性是你模型选择的主导因素。同时要接受:你买到的是标准版,它在综合指数上排名第五而非第一;而所有人都会引用的那个 82.6 分,属于 Extended Thinking 变体。

如果重点在于推理能力,且你想要当前指数榜上的领跑者,那就选Gemini 3.8 Live Extended Thinking——但请先确认它的上线情况,因为它经由 Gemini Live、Docs、Gmail 和 Keep 的分发路径比标准模型更广,而且其企业版可用性仍处于私密预览阶段。

下个季度值得关注的是,全双工是否仍能构成护城河。轮次式模型正通过另一条路径缩小对话差距——在工作推进的同时用旁白让音频保持忙碌——如果这在真实流量下依然成立,那么过去一年定义这一品类的架构区别,将不再是买家会问起的东西。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新