文章主视觉卡片,标题为“Grok Voice Transcribe 2.0”,配有“NEWS”徽章与副标题“流式准确率排名第一的席位,价格保持不变”,卡片上的标签分别显示:最终转写 WER 2.7%、首个部分结果 3.4%、语音结束后 0.49 秒,以及每流式小时 $0.20;背景为白到蓝的渐变,OrcaRouter 标志位于右下角。
Engineering & Research

Grok Voice Transcribe 2.0 以不变的价格登顶流式转录准确率榜首

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Grok Voice Transcribe 2.0 是 SpaceXAI 于 2026 年 9 月 18 日发布的语音转文字模型,而关于它真正重要的那个数字,并不是发布博文开篇所强调的那个。而是这个:第一份部分转写——也就是来电者的话还没说完时,语音智能体实际能据以行动的那段文字——词错误率从 Grok Voice Transcribe 1.0 的 18.3% 降到了 3.4%。这是 Artificial Analysis 的 AA-WER Streaming 榜单上的测量结果,新模型如今在该榜单的最终转写排名(2.7% WER,语音结束后 0.49 秒)和首次部分转写排名(3.4%,0.49 秒)上均位居第一。最终转写的准确率也有所提升,从 3.9% 提高到 2.7%,这确实是实打实的进步,但幅度不大。真正改变你能搭建什么的,是部分转写的那一跃。

1.0 和 2.0 之间究竟有哪些变化

这两个版本是同一 API 中的同一产品,SpaceXAI 未对接口做任何更改:Grok Voice Transcribe 2.0 的选择方式是,将grok-voice-transcribe-2.0传给/v1/stt,而不是grok-voice-transcribe-1.0;或者在为流式传输创建 WebSocket 连接时选择它。省略 model 参数的现有集成会继续获得 1.0,直到 SpaceXAI 切换默认值;该公司表示,这将在未来几周内发生,同时旧版本将被弃用。在此之前,2.0 是选择加入的,而 1.0 可以有意识地固定使用,对于这样的变更来说,这是恰当的形态:在它无论你是否要求都会成为你的生产默认值之前,你可以在自己的音频上对它进行 A/B 测试。

将 Artificial Analysis 的数据并排对照来看,它们所讲述的故事比“准确率翻倍”要具体得多:

• 最终转录准确率 — Grok Voice Transcribe 2.0 在 AA-WER Streaming 上 WER 为 2.7%,而 Grok Voice Transcribe 1.0 为 3.9%,两者均在语音结束后测量

• 首次部分转录准确率——3.4% WER 对比 18.3%,这是两个版本之间最大的单项差距

• 生成最终转录文本所需时间——0.49 秒 vs 0.37 秒,因此新模型比它所取代的旧模型定型更慢

• 首个部分结果耗时 — 0.49s 对比 0.25s,同样更慢

• 批处理(非流式)准确率 — 在 Artificial Analysis 的非流式榜单上,AA-WER 为 2.3%,而 Whisper Large v3 为 4.07%,GPT Transcribe 为 3.31%

批量吞吐量——在同一块板卡上约为实时的 162 倍,落后于 MAI-Transcribe-2 的 333 倍,领先于 Gemini 3.5 Transcribe 的 88 倍

那第四行和第五行是本次发布中坦诚的告诫。SpaceXAI 以延迟换取了准确度。新模型返回第一个部分结果和最终转录文本的速度比 1.0 慢了约三分之一秒。在一个 Deepgram Flux 能在 0.02 秒内返回部分结果、Soniox v5 能在 0.05 秒内返回部分结果的赛道上,Grok Voice Transcribe 2.0 完全不是在速度上竞争——它竞争的是正确性,而且它在这一权衡中以巨大优势胜出。这种权衡是否正确,完全取决于你的应用是需要立即开始回话的实时语音智能体,还是半秒钟根本察觉不到的转录流水线。

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Grok Voice Transcribe 1.0 — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% final transcript WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives Grok Voice Transcribe 1.0 3.9%, 18.3%, 0.37s and the same two prices, with throughput not measured; the footer credits both columns to Artificial Analysis.

“准确率翻倍”的说法,经核实

SpaceXAI 的主打说法是,2.0 在价格相同的情况下准确率是 1.0 的两倍,而它自己的评估表在其选定的数据集上支持了这一点。在 8 kHz 英语客户支持通话中,词错误率从 10.6% 降至 7.1%。在与 Grok 的对话中,从 8.7% 降至 3.3%。在语音凭据——账号、电话号码、电子邮件地址——中,从 7.2% 降至 3.2%。在跨 19 种语言的短命令中,从 20.6% 降至 6.8%,错误大约减少了三分之二。这四个数据集均取自 SpaceXAI 的生产流量,比较也是 SpaceXAI 自己进行的;公司外部无人复现过这些结果。请把这张表看作模型调优所在之处的地图,而不是通用准确率保证。

Artificial Analysis 的结果是不属于厂商自报的那部分:一个独立测试框架在约八小时音频上运行,其中 50% 权重给私有的 AA-AgentTalk 集合,25% 分别给 VoxPopuli 和 Earnings22。它支持一个比“准确率翻倍”更窄也更有用的说法——在那个特定组合上,该模型是已测得的准确率最高的流式转写器。有一个值得点出的细节:SpaceXAI 的帖子称其“在 32 个流式模型中”排名第一,而排行榜页面本身只标出了 33 个模型中的 27 个。排名是真的;营销文案中的模型总数是公司的计数,不是该榜单的。

同样值得精确说明的是,在 AA-WER Streaming 上排名第一涵盖了什么、又不涵盖什么。这个榜单偏重英语,而且座席对话占比很高。它并不衡量你的口音、你的编解码器、你的领域词汇,或者你的八声道呼叫中心音频。一个能在它上面登顶的模型,在你的录音上仍可能表现得很差,而这正是选择加入窗口重要的原因。

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first on both the Final Transcription ranking at 2.728% word error rate and 0.490s and the First Partial Transcription ranking at 3.359% and 0.489s, with Grok Voice Transcribe 1.0 further down at 18.275% on partials.

定价保持不变,而这是这里第二重要的事实

Grok Voice Transcribe 2.0 的定价与 1.0 相同:通过 REST 端点处理批量文件与录制文件为每音频小时 0.10 美元,通过 WebSocket 进行流式传输为每音频小时 0.20 美元。在 Artificial Analysis 的价格榜上,流式 SKU 折合每 1,000 分钟 3.33 美元,批量 SKU 为 1.67 美元——与微软为 MAI-Transcribe-2 收取的批量费率相同,约为 ElevenLabs Scribe v2 Realtime 每流式分钟费用的三分之一。

说话人分离、带置信度分数的词级时间戳以及关键术语偏置都包含在该费率中,而不是单独计量,这在本市场中并非普遍做法。Gemini 3.5 Transcribe Live 对音频输入和文本输出都按 token 计费,因此你的成本会随模型输出的多少而变化,而不仅仅取决于音频运行了多久。统一的每小时费率更易于预测,也更便于跨供应商比较——而且由于 OrcaRouter 以 0% 加价传递提供商标价,供应商端对该费率的调整会在当天就反映到我们这边,而不是等到一个重新定价周期之后。

API 实际提供给你的内容

功能清单很广泛,且大多是继承而来,而非全新增加——如果你仅从功能角度评估此次升级,这一点值得了解:

• 单一模型同时支持批处理与流式——REST 适用于最大 500 MB 的录音文件,WebSocket 端点位于 wss://api.x.ai/v1/stt,约每 500 毫秒输出一次中间结果

• 包含说话人分离,以及最多 8 个独立声道的多声道转录

• 词级时间戳,并附带置信度分数,因此你可以对低置信度的片段设置阈值,而不必对整份转录文本给予同等信任

• 关键术语偏置,每个请求最多支持 100 个领域术语,每个术语最多 50 个字符

• 针对数字、日期、货币、电话号码和电子邮件地址的逆文本规范化,支持25种语言的书写形式格式化

• 填充词移除与 Smart Turn 话轮结束检测,专为语音智能体打造

• 自动语言检测,可在录音中途切换语言并单次完成,覆盖 12 种音频格式以及从 8 kHz 到 48 kHz 的采样率

• REST 和流式传输的服务限制均为每秒 10 个请求,每个团队 100 个并发流式会话,托管在 us-east-1

唯一一条不在功能列表上的生产说明是:该服务仅在单一区域运行。如果你的音频源自美国以外,网络传输段现在就成了你延迟预算的一部分,而 AA-WER Streaming 明确将网络延迟计入其时序。SpaceXAI 提供零数据保留条款,并援引 SOC 2 Type II、BAAs 和欧盟数据驻留选项,因此其合规方面的说明比地理方面的更为完善。

Screenshot of the SpaceXAI docs.x.ai Speech-to-Text page listing the Grok Voice Transcribe 2.0 REST and WebSocket endpoints, the grok-voice-transcribe-2.0 model parameter, the 500 MB file limit, key-term biasing and the published rate limits.

谁该行动,又该关注什么

如果你已经在使用 Grok Voice Transcribe 1.0,并且你的应用会依据部分转写结果采取行动——轮次检测、打断处理、实时智能体响应——那么部分准确率从 18.3% 到 3.4% 的这一差距已经足够大,测试 2.0 不再是可选项。这个数字从“通常是错的”变成“通常是对的”,也就意味着部分转写结果从只能用于展示,变成了可以据此进行路由。如果你的应用是在录音文件上等待最终转写结果,那么这一改进确实存在,但幅度较小,而新增的 0.12 秒提交延迟就是它的代价。

如果你完全在用另一家厂商,那么关注这个版本的真正理由并不是排行榜名次,而是:一家前沿实验室刚刚大幅提升了自己的转写模型,却没有涨价。这正是当一个市场里准确率不再是收费点时所呈现的样子。升级路径也是最省事的那种:一个参数,无需改代码,不用签新合同,而且一旦出问题还能回退到固定版本。

接下来要关注的是默认版本的切换。当 SpaceXAI 将 2.0 设为默认并开始弃用 1.0 时,所有从未传入模型参数的集成都会立刻迁移到新模型上,延迟变化也包含在内。依赖旧的 0.25 秒 partial 时序的团队现在就应该锁定版本,而不是等在生产环境中发现这一变化。第二件要关注的事是独立复现:Artificial Analysis 的条目是一次真实测量,但它只是基于单一音频混音的单个榜单,且尚无第三方发布在生产音频上对 1.0 与 2.0 的同等条件对比运行结果。