GPT-Live-1 语音到语音指数文章的标题卡,展示三个最高分:GPT-Live-1 搭配 GPT-6 Astra 在中等努力下为 81.5,Grok Voice Think Fast 2.0 High 为 81.3,GPT-Live-1 搭配 GPT-5.6 Sol 在低努力下为 80.1
Guides & Insights

GPT-Live-1 以 81.5 分登顶 Speech to Speech Index——但这一排名应归功于其后端

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

GPT-Live-1,这款于 2026 年 7 月 8 日首次在 ChatGPT 内发布的​​全双工语音模型,如今以 81.5 分位居 Artificial Analysis Speech to Speech Index 榜首——这一条目之所以存在,仅仅是因为该模型被交由 GPT-6 Astra 来负责思考。如果将同一个语音前端搭配作为委派后端的 GPT-5.6 Sol,并在低推理强度下运行,它的得分为 80.1,位列第三。以 81.3 分位居第二的是 Grok Voice Think Fast 2.0 High。

在数字之前,先说两点实话。这个模型并不新:GPT-Live-1 于 2026 年 9 月 10 日进入开发者 API,此前它已作为 ChatGPT 的默认语音存在了两个月。真正新的是,以 9 月 15 日衡量,有外部评估者给它打了分——这是迄今为止关于这个模型的每一篇报道都缺失的东西,包括我们自己的报道,在其中唯一能拿到的数字都是 OpenAI 自己公布的。而领先第二名 0.2 个百分点的优势,比 GPT-Live-1 自身两种配置之间 1.4 个百分点的差距还要小——后者才是这份榜单上最有用的数字。

所以,“GPT-Live-1 是最佳语音模型”这个标题并不完全是该指数所表达的意思。它说的是,GPT-Live-1 搭配以中等强度运行的 GPT-6 Astra 才是最佳,优势为 0.2 分,而且后端的选择对结果的影响比任何竞争模型都大。

这个指数实际衡量的是什么

Artificial Analysis 将语音到语音指数构建为四个部分的等权复合指标:语音推理,由 Big Bench Audio 衡量;智能体表现,由 τ-Voice 衡量;竞技场偏好,一种基于成对人类偏好的 Elo 评分;以及任务成功率。只有四个组成部分全部可得的模型才会获得指数值——其余全部显示为破折号,这正是表格行数远多于评分数的原因。该指数本身于 2026 年 6 月 23 日发布,此后已修订两次,最近一次是将对话动态替换为任务成功率,因此某次修订的得分与另一次修订的得分并不严格可比。

阅读该排名时,还有两个方法论细节很重要。Arena Elo 会冻结在模型首次可发布时的数值,因此偏好部分奖励的是早早出现,而不是当下最好。而且该指数评分的是整个系统,而不是单个模型:对 GPT-Live-1 来说,这个数字涵盖语音前端,以及它把工作交给的任何后端模型。这是有意做出的设计选择,也是同一个模型以不同分数出现两次的原因。

该字段的顶部,如已发布:

• GPT-Live-1(Astra,中等)—— 指数 81.5,第一

• Grok Voice Think Fast 2.0 High — 指数81.3,第二名

• GPT-Live-1(Sol,低)— 指数 80.1,第三

• GPT-Realtime-2.1 High — 指数 73.9,第四

• GPT-Realtime-2 High — 指数 73.6,第五

• Grok Voice Think Fast 1.0 — 指数 72.3,第六

• Gemini 3.1 Flash Live High — 指数 71.5,第七

Artificial Analysis Speech to Speech leaderboard showing GPT-Live-1 with Astra at medium effort first at 81.5, Grok Voice Think Fast 2.0 High second at 81.3, and GPT-Live-1 with Sol at low effort third at 80.1, with the rest of the field from GPT-Realtime-2.1 High at 73.9 down to GPT-Realtime-2.1 Mini Minimal at 52.8

作为对比,GPT-Live-1 所取代的模型比它低 7.6 个百分点。这是一个真正的代际差距,这一点没有争议。

这0.2分的胜出恰恰来自唯一一个组成部分

把综合得分拆开来看,这两个领跑者就不再像是同一类模型了。就各项分项指标而言,根据 Artificial Analysis:

• 智能体性能(τ-Voice)—— GPT-Live-1 67.9% 对比 Grok Voice Think Fast 2.0 High 56.5%

• 语音推理(Big Bench Audio)— 90% 对 97%

• 任务成功率 — 87.4% 对比 94.6%

• Arena Elo — 1048 对阵 1011

• 首次音频时间 — 1.34s vs 0.70s

• 每小时成本(含后端)——5.83 美元 vs 4.80 美元

Comparison scoreboard for GPT-Live-1 with Astra at medium effort against Grok Voice Think Fast 2.0 High, contrasting their Speech to Speech Index scores of 81.5 and 81.3, agentic performance of 67.9% and 56.5%, speech reasoning of 90% and 97%, task success of 87.4% and 94.6%, time to first audio of 1.34 and 0.70 seconds, and cost per hour of $5.83 and $4.80

GPT-Live-1 在六条线中赢下两条、输掉四条,却拿下了指数。算术并不神秘:τ-Voice 差距为 11.4 分,远大于表中任何其他分差,而在等权重下,它把综合分拖过了线。直白地说,GPT-Live-1 是更好的智能体,Grok Voice Think Fast 2.0 High 是更好的倾听者,也是更快的那一个——而该指数恰好对 GPT-Live-1 擅长的方面赋予了足够大的权重,使它排在第一位。

如果你的产品是负责预订、解决问题或完成交易的语音代理,那么 τ-Voice 11.4 个百分点的领先优势就是预测你体验的那个数字。如果你的产品是必须让人感觉即时、绝不抢话的对话,那么 0.70 秒的首音频时间就是预测你体验的那个数字,而 Grok 以大约两倍的优势赢下了它。在受监管的任务执行方面,还有第二个警示:Grok 的 94.6% 任务成功率是可见表格中最高的,而 GPT-Live-1 的 87.4% 意味着大约每八个任务中就有一个无法完成。两者都是相对上一代的改进。但两者都还不是已解决的问题。

第 1 行是路由配置,不是模型

这一点比榜单排名更值得关注。GPT-Live-1 是一个全双工语音层,它自行处理聆听、说话、打断和轮次转换,并在对话继续进行的同时,将推理、工具调用和搜索委托给一个独立的后端模型。Artificial Analysis 将其中两种配对作为单独条目进行了评分。Astra 在中等强度下取得了 81.5 分。Sol 在低强度下取得了 80.1 分。

那 1.4 分的分差才是关键。第一名和第二名之间只差 0.2 分。而 GPT-Live-1 的两个计分配置之间的差距,是它的七倍。在这几行之间,语音模型没有任何变化——变化的只是由哪个模型来思考,以及以什么努力程度来思考。一个给系统排名的排行榜,正在准确地告诉你:配置才是产品。

它也会修正我们自己的报道。2026年9月11日,我们在该指数上记录到 GPT-Live-1 为 69.8%,落后于 GPT-Realtime-2.1 和 Grok。那是当时可获得的读数,它支持一个合理的结论——OpenAI 打造出了最好的对话机制,而不是最好的语音代理。该指数现在带有两个委派型 GPT-Live-1 配置,分别为 81.5 和 80.1。Artificial Analysis 不发布变更日志,并且在8月修订了该指数的组成部分,因此我们无法确定地说,较早的那个数字是一个未评分或部分评分的配置,还是在旧权重下的一次运行;可以观察到的是,这些委派组合现在作为各自的完整行出现,并且当它们出现时,答案也随之改变了。

实际后果是:"哪个语音模型"是个错误的问题,而"哪个语音模型,加上哪个后端、以多大的投入"才是正确的问题。这是一个路由问题,而这正是我们自己的产品存在所要回答的问题。OrcaRouter 将 GPT-Live-1 的委派后端 GPT-6 Astra,通过与 200 多个其他模型相同的 OpenAI 兼容端点对外提供,因此更换思考层只需更改模型 ID,而无需做一次集成。路由 DSL可将多个模型组合进单次调用,而自动故障转移意味着未经检验的搭配并不是一场生产豪赌——如果后端性能下降,请求会落到别处,而不是直接失败。准确说明一下我们不做什么:GPT-Live-1 本身并不在我们的目录里,我们也不提供它。但它委派到的那个后端,则是另一回事。

这个每小时要多少钱

GPT-Live-1 的前端按每语音分钟 0.05 美元计费,按秒计费,也就是线路持续接通一小时为 3.00 美元。这并非全部账单:委托推理、工具调用和网络搜索会按后端模型的收费标准单独计量。Artificial Analysis 测量的是综合成本,因此应使用其成本列:

• GPT-Live-1(Sol,低)— 每小时 $4.47

• Grok Voice Think Fast 2.0 High —— 每小时 4.80 美元

• GPT-Live-1(Astra,中等)——每小时 5.83 美元

• GPT-Realtime-2.1 High — 每小时 $10.75

排名胜出者是当前三个选项中最贵的一个,而获胜的配置每小时比排名第三的配置贵 30%。换个角度看,这种拆分很有启发性:每小时的 3.00 美元是语音层,其余部分——Sol 上为 1.47 美元,Astra 上为 2.83 美元——是后端 token。思考层占你账单的三分之一到一半之间,对于一个被排行榜视作脚注的组件来说,这是很大的占比。

OrcaRouter model page for GPT-6 Astra showing the model id openai/gpt-6-astra, a 1M-token context window, 128K max output, a p50 time to first token of 6.75 seconds, and pricing of $10.00 per million input tokens and $50.00 per million output tokens

不过,与其所取代的模型相比,整个系列的价格大约只有一半——每分钟 0.05 美元的前端是实打实的降价,而非换汤不换药的重新包装。由于后端 token 按后端费率计费,GPT-Live-1 部署的成本主要取决于你将请求路由到哪个推理模型,而后端既可以是 OpenAI 自家的模型,也可以是第三方模型。在 OrcaRouter 上,这些后端按供应商标价以 0% 加价透传,因此思维层的供应商调价当天即可生效,而不必等到下一个计费周期。

该指数并未解决之事

三点注意事项,均由来源明确说明,而非推断得出。GPT-Live-1 的两个条目和 Grok Voice Think Fast 2.0 High 都被标记为基于单次试验,这对一个 0.2 分的决定来说依据过于单薄——重新运行可能让第一名和第二名互换,而两个模型本身毫无变化。如前所述,Arena Elo 被冻结在每个模型首个可发布的测量值上。此外,该指数没有关于这些系统在长时间通话中如何表现的条目:各组件按设计就是短时程的,而在生产中真正会让语音代理失效的故障模式,是二十分钟对话中的漂移。

另外,这一信息来自供应商而非索引:GPT-Live-1 的 API 发布时没有图像或视频输入,没有结构化输出,也没有免费层级,并且其速率限制是按并发会话数而非每分钟请求数计算的。这些都是发布当日的限制,可能已经发生变化;在围绕它们进行设计之前,请先核实。

这个该怎么办

如果你这周要选的是架构而不是模型,那么这个指数在智能体工作上更青睐委派模式,在延迟上更青睐级联模式。GPT-Live-1 以 81.5 分成为迄今最强证据,表明将对话与推理拆分是完成任务型语音智能体的正确形态。Grok Voice Think Fast 2.0 High 以 81.3 分、0.70 秒首音频延迟和 94.6% 的任务成功率,成为最强证据,表明委派形态并非唯一可行的形态——而且它还不是最快的。

从这些数字得出的决定,比它看起来更便宜。GPT-Live-1 的两种配置,以及在六个组件中的四个上击败它的那个模型,彼此之间每小时相差不到 1.36 美元。在这样的差距下,正确的做法是别再盯着排行榜,而是用你自己的转录文本把两者都跑一遍。该指数能告诉你这一取舍的形态;它无法告诉你,你的用户处在它的哪一侧。

这个数字引发的疑问

GPT-Live-1 现在是最好的语音模型吗?

按综合得分来看,是的——领先 0.2 分,且背后只有一次试验支撑。按分项来看,这完全取决于你在构建什么:它在智能体性能和竞技场偏好上领先,但在语音推理、任务成功率和首次音频时间上落后。0.2 分的综合领先建立在某一分项 11.4 分的优势之上,这是一个站得住脚的第一名,而非决定性的第一名。

你必须使用 GPT-6 Astra 才能拿到 81.5 吗?

对于那一行来说,是的——81.5 属于在中等推理强度下搭配 Astra 配置的 GPT-Live-1。低推理强度的 Sol 是一个有文档记录的替代方案,得分为 80.1,且每小时便宜 1.36 美元,并且 OpenAI 支持将第三方模型作为后端接入,所以排行榜上的条目只是曲线上的两个点,而不是唯一选项。哪种组合最适合你的工作负载,不是公共索引能替你回答的。

为什么同一个模型在我们早前的报道中得分是69.8,而现在却是81.5?

这两个数字涵盖的内容不同。较早的读数将 GPT-Live-1 作为一个单一条目列入指数;当前表格则将其两个委托配置作为独立的、完整评分的行列出,其中 Astra 配对为 81.5,Sol 配对为 80.1。Artificial Analysis 在 8 月修订了指数的组成部分,且不发布变更日志,因此应将该差值视为所测量内容的变化,而不是模型有所改进的证据——并且应将任何进行委托的模型的单一综合分数视为关于某一配置的陈述。