文章主视觉卡片显示“Grok Voice Transcribe 2.0 vs GPT Transcribe”,徽章为“模型对比”,副标题为“相同的流式价格,不同的准确率”,标签内容为 2.7% vs 3.9% 流式 WER、3.4% vs 6.3% 首个部分结果、每 1,000 分钟 $1.67 vs $4.50 以及 162x vs 41x 实时速度,覆盖在白到蓝渐变上,右下角有 OrcaRouter 标志。
Guides & Insights

Grok Voice Transcribe 2.0 与 GPT Transcribe:相同的流式价格,不同的准确率

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

这个巧合几乎巧得过分。在 Artificial Analysis 的 AA-WER Streaming 榜单上,Grok Voice Transcribe 2.0 和 GPT Live Transcribe——流式转录端点——标价都恰好是每 1,000 分钟音频 3.33 美元。SpaceXAI 的 Grok Voice Transcribe 2.0 于 2026 年 9 月 18 日发布,返回最终转录结果的词错误率为 2.7%,在语音结束后 0.49 秒返回,首个部分转录结果为 3.4%。GPT Live Transcribe 于 2026 年 7 月 28 日与 GPT Transcribe 一同推出,其最终转录结果为 3.9%,首个部分转录结果为 6.3%。价格相同,而 SpaceXAI 在最终转录准确率上大约领先 1.2 个百分点,在部分转录准确率上领先 2.9 个百分点。同一组对比中的批处理方面则完全不是巧合:GPT Transcribe 每 1,000 分钟收费 4.50 美元,而 Grok Voice Transcribe 2.0 为 1.67 美元,在录音文件路径上存在 63% 的差距。

关于转录如何变得更好的两种不同押注

OpenAI 对准确率的答案是上下文。GPT Transcribe 和 GPT Live Transcribe 都接受自由格式提示、关键词列表和预期语言列表;在 Realtime 会话中,先前转录的轮次会作为上下文反馈给后续轮次。在 OpenAI 自己的 Context Aware ASR 基准测试中,这种条件化将 GPT Live Transcribe 的语义准确率从 38.5% 提升到 44.6%——这是供应商报告的数据,衡量的是含义是否得以保留,而非字词是否正确。OpenAI 提供的取舍很明确:向模型提供关于它即将听到什么的信息,它就能比一个原始准确率相同的通用模型更好地转录你的领域内容。

SpaceXAI 的答案就是模型本身。Grok Voice Transcribe 2.0 确实有一种偏置机制——每次请求最多 100 个关键术语,每个最多 50 个字符——但它是一份词汇表,而不是提示词。你可以告诉它“OrcaRouter”和“Kubernetes”是真实存在的词;但你没法交给它一段话,解释这是一通关于退款的客服电话。2.0 的准确率提升反而来自重新训练:在 SpaceXAI 自己源自生产环境的评估集上,词错误率在对话音频上从 8.7% 降至 3.3%,在 8 kHz 电话音频上从 10.6% 降至 7.1%,在口述凭据上从 7.2% 降至 3.2%,在涵盖 19 种语言的短命令上从 20.6% 降至 6.8%。这些是该公司在其自己的音频上得出的数字,未经其外部任何人复现;它们描述的是一个在声学问题上变得更好的模型,而不是一个更擅长被告知该预期什么的模型。

实际差异会在工作的第二个小时显现出来。一个基于上下文条件的模型,可能比其原始基准测试所显示的强得多,因为你提供了词汇和领域。它也可能对你提供的关键词产生幻觉:把“OrcaRouter”放进提示词中,一个并不能清楚听到这个词的模型还是可能把它生成出来。而对关键术语有偏置的模型会退化得更平缓,因为偏置改变的是某个术语的概率,而不是断言它确实存在。这两种失效模式都不会出现在排行榜上,而都会出现在你的日志里。

这些数字,并排

• 最终转录准确率(流式)——Grok Voice Transcribe 2.0 在 AA-WER Streaming 上的词错率为 2.7%,而 GPT Live Transcribe 为 3.9%,两者数据均来自 Artificial Analysis

• 首个部分准确率(流式)——3.4% 对比 6.3%,是本次比较中差距最大的一项,也是决定语音智能体行为的关键指标

• 从语音结束到最终转录的时间——分别是0.49秒和0.81秒,因此更准确的模型也是更快完成转录的那个

• 首个部分结果时间——0.49 秒 vs 0.26 秒,这是 OpenAI 唯一一项完胜的延迟指标

• 流式价格 — 两者均为每 1,000 分钟 $3.33,由 Artificial Analysis 根据 Grok 的 $0.20/小时和 OpenAI 的 $0.017/分钟归一化得出

• 批量准确率(非流式)——Grok Voice Transcribe 2.0 的 AA-WER 为 2.3%,而 GPT Transcribe 为 3.31%

• 批量价格 — 每 1,000 分钟 $1.67 vs 每 1,000 分钟 $4.50,从 $0.10/小时 对比 $0.0045/分钟

• 批量吞吐量 — 在同一块板卡上约为实时的 162×,相比之下约为 41×

把那份列表看成两栏,而不是一个总体判定。OpenAI 在首个部分结果延迟上以明显优势胜出,并提供了一种 Grok 所没有的上下文机制。SpaceXAI 在两种模式下的最终准确率、流式传输中的部分结果准确率、吞吐量以及批量价格上都以大幅优势胜出。没有任何一栏中 GPT Live Transcribe 既比 Grok Voice Transcribe 2.0 更快又更准确;只有一栏它更快,而那是最早出现的一栏。

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs GPT Transcribe — the scoreboard': the left column gives Grok Voice Transcribe 2.0 a 2.7% streaming final WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives GPT Transcribe 3.9%, 6.3%, 0.81s, $4.50, $3.33 and 41x real time.

你实际处于哪条批处理路径上

${{1}}1.67{{/1}}与${{2}}4.50{{/2}}之间的差距是这里最不含糊的数字,值得精确说明它为何存在。OpenAI在推出GPT Transcribe时将该产品线降价25%,从GPT-4o Transcribe时代降至每分钟$0.0045。SpaceXAI从1.0版升级到2.0版时,将其批量费率保持在每小时$0.10不变——它改进了模型却收取相同费用,这是一件更难做到的事,也是关于市场走向的更好信号。微软的MAI-Transcribe-2以相同的每小时$0.10作为限时优惠推出,因此每1,000分钟$1.67这一价位已成为前沿实验室批量转录的价格下限,而非某家供应商的促销数字。

在每月一万小时的音频量下,这一差距大约是 2,830 美元对 450 美元。对于播客存档、通话录音积压,或正在被回溯转写的媒体库而言,价格差异远超 2.3% 与 3.31% WER 之间的任何准确率差异。对于流式智能体来说,这两种产品成本相同,剩下可争论的只有准确率和延迟。

这些费率背后有一个值得点明的结构性差异:Grok Voice Transcribe 2.0 按音频小时收取固定费率,GPT Live Transcribe 按分钟计费,而 Gemini 3.5 Transcribe Live 则对音频输入和文本输出都按 token 计费。三者之中,只有一个会让你账单的金额取决于模型选择说些什么。如果你的用量大到需要做预测,那么固定费率更容易向签字付账的人交代;而且由于 OrcaRouter 以 0% 的加价透传供应商的目录价,像 OpenAI 那样 25% 的供应商侧降价,在宣布当天就会在我们这边生效,而不是等到下一次续约。

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard showing the identical $3.33 per 1,000 minutes streaming price for Grok Voice Transcribe 2.0 and GPT Live Transcribe, next to their 2.728% versus 3.918% final-transcript word error rates and 0.490s versus 0.812s times to final transcript.

两个模型都不是的样子

GPT Transcribe 和 GPT Live Transcribe 是两款产品,而不是一个带开关的产品。批处理模型处理已完成的文件、流式文件转写以及 Realtime 会话中已提交的轮次,并且按照 OpenAI 自己给出的数据,处理音频的速度约为实时的 34 倍——Artificial Analysis 在其测试框架上测得 41×。流式模型则更贵,每分钟 $0.017,而且是在部分结果上错误率大 10× 的那个。选择 OpenAI 就意味着选择你要面对这两个问题中的哪一个,因为更便宜的那个端点无法完成另一个的工作。

Grok Voice Transcribe 2.0 是一个模型,具有两种传输方式:同一套权重通过 REST 为最大 500 MB 的文件提供 /v1/stt 服务,并wss://api.x.ai/v1/stt 通过 WebSocket 为实时音频提供服务,中间结果大约每 500 毫秒输出一次。流式传输速率恰好是批处理速率的两倍,而不是单独设计的产品,这意味着你在归档音频上测得的准确率,就是你在实时场景中应期望的准确率。这也意味着无需评估第二个模型——一套提示词、一套关键术语、一套预期。

功能对等度接近,但并不完全相同。两者都会返回词级时间戳;{{1}}Grok Voice Transcribe 2.0{{/1}} 会为每个词附上置信度分数,这样一来,你就可以对低置信度的片段设定阈值,而不必对整份转写结果同等信任。两者都支持说话人分离,而 Grok 的这项功能不额外收费。两者都能处理数字、日期、货币和联系方式的逆文本规范化。{{2}}Grok Voice Transcribe 2.0{{/2}} 额外提供最多 8 个独立声道的多声道转写、填充词移除以及 Smart Turn 轮次结束检测;{{3}}GPT Transcribe{{/3}} 独有的新增能力是提示词级别的上下文条件设定,以及在 Realtime 侧自动承接此前的轮次。OpenAI 尚未公布这两款模型各自支持的语言数量;{{4}}Grok Voice Transcribe 2.0{{/4}} 记录了数十种语言,支持录制中途切换,并覆盖 25 种语言的书面形式格式化。

Screenshot of the OpenAI developers.openai.com GPT Transcribe model page describing the batch and streaming transcription endpoints, the $0.0045 per minute batch and $0.017 per minute streaming rates, the prompt and keyword context conditioning, and the Context Aware ASR accuracy figures.

如何决定,以及如何测试它

如果你正在构建一个语音代理,而它必须在来电者说完之前就作出响应,那么部分转录这一列就是你的决策变量,它把这两个模型干净利落地区分开来:Grok Voice Transcribe 2.0 在部分转录上的准确率高出 2.9 个百分点,但生成它们要慢 0.23 秒。如果错误的局部转录比迟到的局部转录更糟——比如路由、升级、合规触发的响应——就选 SpaceXAI。如果迟到的局部转录比错误的局部转录更糟,并且你有领域词汇可以喂给上下文机制,从而缩小准确率差距,就选 OpenAI。然后两者都要测量,因为两家供应商在八小时英语代理通话上的部分转录行为,都无法预测它们在你的口音、你的编解码器和你的行话上会表现如何。

如果你在做文件转录,决策就简单得多:每 1,000 分钟 $1.67 对 $4.50,WER 2.3% 对 3.31%,两者指向同一方向。唯一让你在批量任务中继续留在 GPT Transcribe 上的理由,是上下文条件机制对你的音频发挥了某种原始准确率差距无法抵消的作用——这在高领域特定性的录音上确有可能,而且是可验证的。

目前 OrcaRouter 的目录里还没有这两款转写模型,所以转写调用本身会直接发往厂商自己的 API。而一个 OrcaRouter 密钥背后真正覆盖的,是转写结果所喂养的一切:智能体模型、摘要器、分类器,以及决定该如何处理这段文本的代码。第二份合同通常就出现在这里——语音用一家厂商,而对文本进行推理的模型用另一家——但这并非必须如此。一个密钥即可调用 200+ 个模型;如果某家提供商性能下降,会自动故障转移;如果你想把请求依次发给多个模型、比较之后再定夺,还有路由 DSL 可用。这个说法比“我们为你路由转写”要小,但它是真的。

值得关注的是,OpenAI 会在准确率上作出回应,还是继续主打上下文。该公司已在一年内推出两代转录产品,并降价一次;上下文机制确实具有差异化优势,但在衡量原始转录能力的榜单上,它目前落后于 SpaceXAI 和 Microsoft。如果 GPT Transcribe 2 问世时上下文机制完好无损,且错误率降至 2% 左右,那么这种对比在批处理侧将一夜之间发生逆转——而流式处理的价格本就相同,这让这场竞赛值得关注。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新