文章主视觉卡片显示“Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe”,带有“模型对比”徽章和副标题“流式赛道属于其中之一”,标签显示 2.7% vs 4.0% 流式 WER、3.4% vs 5.8% 首次部分结果、0.49s vs 0.40s 最终结果和 $1.67 vs $5.00 每 1,000 分钟,背景为白色到蓝色的渐变,OrcaRouter 标志位于右下角。
Guides & Insights

Grok Voice Transcribe 2.0 与 Gemini 3.5 Transcribe:流式转写赛道只属于其中之一

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Grok Voice Transcribe 2.0 和 Gemini 3.5 Transcribe 是来自竞争对手实验室的两款最新的前沿语音转文本模型,而诚实的比较方式是先承认它们并非为同一项任务而打造。SpaceXAI 的 Grok Voice Transcribe 2.0 于 2026 年 9 月 18 日发布,是一款以流式优先、附带批处理模式的模型:它在 AA-WER Streaming 榜上以最终转写 2.7% 的词错误率位居榜首,首个部分转写为 3.4%,两者均在语音结束后 0.49 秒到达。Gemini 3.5 Transcribe 于 2026 年 8 月 26 日发布,是一款以批处理优先、附带流式 SKU 的模型,而它的两个部分表现迥异——预录制路径在 Artificial Analysis 的非流式榜上测得 2.6% 的 AA-WER,而单独的 gemini-3.5-transcribe-live 端点在流式榜上以 0.40 秒的延迟测得 4.0%。把这四个数字并列一看,这场对比的轮廓就一目了然:在 Gemini 3.5 Transcribe 占优的准确率方面,两者接近;而在 Grok Voice Transcribe 2.0 占优的方面,两者并不接近。

他们俩唯一共同作战的分路

两个模型都能转写实时音频,所以流式场景是唯一一个直接比较能说明问题的领域。在这一场景中,Grok Voice Transcribe 2.0 在最终转写准确率上领先 Gemini 3.5 Transcribe Live 1.3 个百分点——在相同的测试框架、相同的约八小时音频,以及 AA-AgentTalk、VoxPopuli 和 Earnings22 上相同的 50/25/25 加权下,WER 为 2.7% 对 4.0%。这不是舍入误差;在这样的错误率下,这大致相当于谷歌模型每转写七十五个词就多出一个错词。在首次部分转写结果上,差距还要更大,为 3.4% 对 5.8%,而部分转写正是实时语音智能体必须在说话者说完之前就据以行动的内容。

延迟则呈现相反的情况,而这正是对比中最容易被忽略的部分。Gemini 3.5 Transcribe Live 在语音结束后 0.40 秒返回最终转录结果,Grok 为 0.49 秒;它的首个中间结果在 0.25 秒返回,Grok 为 0.49 秒——到达首个可用词的速度大约快一倍。这两个模型都无法与这一榜单上真正快的梯队竞争,其中 Deepgram Flux 为 0.02 秒,Soniox v5 为 0.05 秒,但在这两者之间,取舍十分明确:Google 开口更快,而 SpaceXAI 开口时更可能是对的。对于一个不能抢话的轮次交接型智能体来说,0.24 秒的额外中间结果延迟是实实在在的代价,准确率上的优势必须足以证明其值得。

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% streaming final WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and a 100-concurrent-session cap; the right column gives Gemini 3.5 Transcribe 4.0%, 5.8%, 0.40s, $5.00, about $5.40 and a 10-minute session cap.

Gemini 3.5 Transcribe 真正胜出的地方

语言覆盖是最清晰的一项,而且差距悬殊。Google 的模型能处理 85+ 种语言;Grok Voice Transcribe 2.0 支持数十种语言,并提供书面形式格式化——也就是逆文本归一化,把口语中的数字、日期、货币和电子邮件地址转换成其书面形式——已在 25 种语言中有文档记录。如果你的音频是葡萄牙语、越南语,或是一句话内夹杂两种语言的语码转换,那么哪个模型在 Artificial Analysis 排行榜上更准确这个问题在很大程度上只是理论上的,因为该排行榜以英语为主且智能体对话占比很高。Google 报告其自身多语言套件在 FLEURS 上的流式 WER 为 5.50%、非流式 WER 为 5.04%,这些数字由供应商报告,未经独立复现,但至少描述了多语言场景。

第二个优势是免费层级。Gemini 3.5 Transcribe 在 Google 的 API 上提供免费的输入和输出 token,但有个前提:免费层级的内容会被用于改进 Google 产品,而付费层级的内容则不会。对于原型、副业项目,或处理你本来不会付费转录音频的内部工具来说,这是一个按小时收费的供应商都无法匹敌的真正选择。Grok Voice Transcribe 2.0 从第一个音频小时开始就要付费。

第三点是,Gemini 3.5 Transcribe 是一个带转录模式的通用多模态模型,而非专门打造的 ASR 服务。它可以接受提示,可以把文本作为上下文,而且它与 Google 发布的其他一切共用同一套 API 接口。如果转录只是某条流水线中的一个环节,而这条流水线同时还需要对转录文本进行推理,那么把两者放在同一次模型调用中,自有其价值,而这是逐词错误率所无法体现的。

每千分钟的价格计算

Artificial Analysis 将两种模型都归一化为每 1,000 分钟音频的成本,这是比较固定小时费率与 token 计费的唯一方式:

• 批量、预录制 — Grok Voice Transcribe 2.0 每 1,000 分钟 $1.67(每小时 $0.10),对比 Gemini 3.5 Transcribe 每 1,000 分钟 $5.00(每小时 $0.30,起价为每 1M 输入 $2.00 和每 1M 输出 token $12.00)

• 流式传输 — Grok Voice Transcribe 2.0 为每 1,000 分钟 $3.33($0.20/小时),而 Gemini 3.5 Transcribe Live 约为每 1,000 分钟 $5.40,按每 1M 音频输入 $3.50 和每 1M 文本输出 token $21.00 混合计算

• 批处理吞吐量——在同一块板卡上,Grok Voice Transcribe 2.0 约为实时速度的 162 倍,而 Gemini 3.5 Transcribe 约为 88 倍,因此对于文件处理工作,更便宜的模型也是更快的那个

• 实时会话上限 —— Grok Voice Transcribe 2.0 通过 WebSocket 流式传输,除每团队 100 个并发会话这一限制外,未公布任何会话时长上限;而 Gemini 3.5 Transcribe Live 则每次会话上限为 10 分钟

最后那行是运营层面的细节,它对架构的决定作用比准确率数字更大。实时会话 10 分钟的上限意味着长时间通话、长时间会议和长时间流都必须被切分并重新建立,而每一次重新建立都是一道接缝,上下文会在此丢失。Grok 的流式端点在其批处理路径上带有 500 MB 的文件大小上限,在流式路径上则有每团队 100 个会话的并发限制,这是另一类约束——关乎吞吐量而非持续时间。

Token 计费值得在你选择 Google 这一侧之前先了解清楚,因为它让你的账单变成两个变量而非一个变量的函数。Gemini 会分别对音频输入和文本输出计费,因此,一个输出冗长格式或重复自身内容的模型,会比不这么做的模型成本更高;而单词更长的语言,也会比单词更短的语言成本更高。Grok 的固定每小时费率不会随这些因素变动。对于高用量工作负载,固定费率更容易预测;而且由于 OrcaRouter 以 0% 加价透传提供商的标价,任一供应商一侧的变更都会在发生当天就反映到你的账单上,而不是等到下一次合同续约时。

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first at 2.728% final-transcript word error rate and 0.490s, Gemini 3.5 Transcribe Live at 3.998% and 0.395s with a 5.774% first-partial figure, and the faster Deepgram Flux and Soniox v5 rows for latency context.

功能形态:各自拒绝做什么

能力列表之间的分歧比准确率数字所显示的要大,而且这些差距恰恰出现在对特定应用至关重要的地方:

• 说话人分离 — 在 Grok Voice Transcribe 2.0 上免费提供,不额外收费;Gemini 3.5 Transcribe Live 不支持该功能,因此该端点上完全不提供带说话人标注的实时转写文本

• 词级时间戳 — Grok Voice Transcribe 2.0 会连同逐词置信度分数一起返回它们;Gemini 3.5 Transcribe Live 则不返回任何内容,这排除了置信度阈值筛选和精确字幕对齐的可能性

• 多声道音频 — Grok Voice Transcribe 2.0 可在单次处理中转写多达 8 个独立声道;Gemini 3.5 Transcribe Live 没有对应功能,因此多声道通话录音需要按声道分别建立会话

• 关键术语偏置 — Grok Voice Transcribe 2.0 每次请求最多接受 100 个领域术语;Gemini 3.5 Transcribe 接受自定义词汇表和可选的语言提示

• 语音智能体基础设施——Grok Voice Transcribe 2.0 内置填充词移除与 Smart Turn 轮次结束检测;Gemini 3.5 Transcribe Live 覆盖了流式场景,但将轮次逻辑留给应用自行处理

• 输入处理 — Grok Voice Transcribe 2.0 支持直接上传文件,最大可达 500 MB,涵盖 12 种音频格式;Gemini 3.5 Transcribe 的预录音频路径需要提供公开的 HTTPS URL,且有 15 分钟和 300 MB 的上限,并且无法将智能格式化模式与词级时间戳或说话人标签结合使用

那份清单呈现出的规律是:SpaceXAI 打造的是一个转写产品,而 Google 打造的是一项转写能力。当转写本身就是整个应用时,说话人分离、时间戳、声道拆分和话轮检测正是你需要的功能;而当转写只是更大应用中的一个环节时,可提示性、语言覆盖广度以及「一个 API 搞定一切」才是你想要的。抽象而言,两份清单并无高下之分,而一个仅凭准确率做选择的团队,最终会在自己并不需要的那一类功能上有所欠缺。

Screenshot of the Google ai.google.dev speech-generation documentation for Gemini 3.5 Transcribe, showing the pre-recorded and live transcription endpoints, the token-based audio-input and text-output pricing, the supported-language list and the 10-minute live session ceiling.

在它们之间做选择,以及什么会改变答案

当音频仍在播放、转录就必须准确无误时,就该选择 Grok Voice Transcribe 2.0:实时坐席轮流发言、绝不能出错的实时字幕、要求包含说话人归属和声道分离的联络中心音频流,或者任何既看重每 1,000 分钟 $1.67 价格、又看重 162× 吞吐量的批处理流水线。当音频是多语言的且涉及 Grok 文档所列语言之外的语言时,当转录结果要馈送给一个还需要对其推理的模型时,当你想用免费层级进行原型验证时,或者当批处理路径的 2.6% AA-WER 对你的用途来说已经足够、而额外的语言覆盖比价格差异更有价值时,就该选择 Gemini 3.5 Transcribe。

大多数团队在这里实际做的并不是二选一。两个模型都可以通过同一个 OrcaRouter API 密钥访问,同时还能访问 200+ 个其他模型,这意味着你可以把实时 agent 流量路由到 Grok Voice Transcribe 2.0,把长篇多语言存档路由到 Gemini 3.5 Transcribe,而无需维护两份供应商合同、两套计费关系和两组凭证。这也是你为自己音频解决准确率问题的办法:在相同录音上运行两者,比较你实际得到的转录文本,让路由 DSL 把流量发送到它该去的地方。排行榜告诉你,在别人八小时的英语 agent 通话上哪个模型胜出;只有你自己的音频才能告诉你,在你的音频上哪个模型会赢。

悬而未决的问题是,当Google下一次修订Live端点时,那个流式传输差距会如何变化。Gemini 3.5 Transcribe Live以公开预览版发布,其4.0%的数字是在它可调用大约一天后测得的——这是一个强烈的早期信号,但它沉淀的时间比它如今落后于的Grok数字更短。如果Google在保持0.25秒部分延迟的同时缩小了1.3个百分点的流式传输差距,那么这种取舍就不再是取舍,Grok的优势将收窄至价格和功能。在那之前,分化很清晰:最快的部分结果是Google的,最准确的是SpaceXAI的,而榜单上没有任何一个模型两者兼具。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新