
Grok Voice Transcribe 2.0 与 MAI Transcribe 2:两条赛道,而非两个对手
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
这两款模型相隔十五天发布,定价精确到分完全相同,但它们几乎永远不会出现在同一个采购决策中。由 SpaceXAI 于 2026 年 9 月 18 日发布的 Grok Voice Transcribe 2.0,是当音频仍在传入时你要调用的模型——它通过 WebSocket 流式传输,大约每 500 毫秒输出一次中间结果,并在 Artificial Analysis 的 AA-WER 流式榜单上位居榜首:最终转写的词错误率为 2.7%,首个部分结果为 3.4%。由 Microsoft AI 于 2026 年 9 月 3 日发布的 MAI-Transcribe-2,是当音频已经是文件时你要调用的模型——它仅支持批处理,在 Artificial Analysis 的非流式榜单上,它是测得的最准确的托管模型,AA-WER 为 2.04%,领先于 Grok Voice Transcribe 2.0 的 2.29%,吞吐量大约快 2 倍。两者标价均为每音频小时 0.10 美元,约合每 1,000 分钟 1.67 美元。如果你的需求是实时,那就没有什么可比较的。如果你的需求是文件,那就有。
没有任何供应商会替你划清这条界限
流式支持不是一个功能开关。Grok Voice Transcribe 2.0 对录音文件通过 REST、对实时音频则通过`wss://api.x.ai/v1/stt`提供同一个模型,因此你在存档文件上测得的准确率,就是你在实时通话中获得的准确率。MAI-Transcribe-2 则完全没有流式 SKU:微软的发布材料明确将其定位为面向长音频和批量音频,虽然其模型卡在应用场景中列出了实时字幕,但通往该场景的路径是把音频切分成片段、再逐段送入批量 API —— 这是一条需要你自己搭建和运维的流水线,而不是你可以买到的延迟保证。微软主打的约 411 倍实时吞吐量是一个处理速度指标,而不是响应时间指标,而在关于此次发布的报道中,这两者却经常被混为一谈。
实际后果是:如果你在构建轮流对话的语音智能体、实时字幕,或任何需要人类或模型对进行中的语音作出反应的场景,那么无论 MAI-Transcribe-2 的准确率有多高,它都不是候选方案。如果你是在事后转写会议、隔夜处理联络中心录音、媒体档案或合规积压任务,那么流式处理就是累赘,批处理指标才说明一切。
MAI-Transcribe-2真正领先之处
先说文件上的准确率。2.04% 对 2.29% 的差距是在同一个独立测试框架上测得的——Artificial Analysis 的 AA-WER v2,其中 50% 来自 AA-AgentTalk,VoxPopuli 和 Earnings22 各占 25%——这使它成为这项比较中最确凿的事实。这是 0.25 个百分点的差异,大约相当于每千词少两个半错误。这是否重要取决于你拿转录文本做什么;对于可搜索的档案来说不重要,而对于法律或医疗记录来说可能就重要了。
吞吐量方面位居第二,而且领先幅度比准确率差距还大:333× 实时速度,对比 Grok Voice Transcribe 2.0 的 162×。这两个数字都是 Artificial Analysis 的实测结果,衡量的是每秒可转录的输入音频秒数,而非厂商宣称。按此速度,一千小时的存档在 Microsoft 模型上约需三小时计算即可完成,在 SpaceXAI 模型上则约需六小时。对于一次性迁移而言,这无关紧要;但对于持续摄入的流水线来说,墙钟时间减半就是实实在在的容量差异。
第三,语言覆盖范围。Microsoft 列出了 60 种语言,支持自动检测、录音中途的语码切换,并在这 60 种语言上于 FLEURS 取得平均 5.2% 的词错误率——这是厂商自报的数字,未经独立复现,但至少它针对一份明确列出的语言清单描述了多语言场景。SpaceXAI 记录了数十种语言,支持录音中途切换,并针对其中 25 种提供书面形式格式化。如果你的音频不在覆盖充分的"英语加主要欧洲语言"这一集合内,那么 FLEURS 的数字就比一个偏重英语、充斥客服对话的排行榜更有参考价值。
还有两个差异在实际运营中很重要。MAI-Transcribe-2 提供可配置的转写风格——逐字转写,保留不流畅之处,以及会将其清除的干净转写——而 Grok Voice Transcribe 2.0 则用一个填充词移除开关来处理同样的问题。此外,微软的模型在 Microsoft Foundry 上处于公开预览阶段,这意味着没有 SLA,并且在它正式发布之前,官方一直建议不要用于生产环境;SpaceXAI 的模型已正式可用,并公布了速率限制:每个团队每秒 10 次请求、100 个并发流式会话。

Grok Voice Transcribe 2.0真正领先之处
• 实时流式传输——一个每约 500 毫秒返回中间结果的 WebSocket 端点,相较之下仅有批处理模式,且未公布任何实时 SKU
• 首个部分转录准确率——在 AA-WER Streaming 上,0.49 秒时 WER 为 3.4%,而 MAI-Transcribe-2 并未参与这一类别
• 在智能体对话音频上的批处理准确率——总体为 2.29%,但在非流式榜单的 AA-AgentTalk 子集上,排名比标题所暗示的更接近;而在流式榜单以智能体为主的组合中,Grok 明显领先
• 语音智能体底层管道 —— Smart Turn 的轮次结束检测与填充词移除均内置于模型中,而 MAI-Transcribe-2 则将轮次逻辑交由调用方处理
• 多声道音频——单次处理即可转写多达8个独立声道,这对立体声或多方通话录音尤为重要
• 词级置信度 — 时间戳为每个词附带一个置信度分数,因此低置信度的片段可以被标记出来,而不是被同等信任
• 可用性条款 — 正式发布并提供已公布的并发限制,而公共预览版则无 SLA
• 价格持久性 — 每小时 $0.10 是批处理的长期费率,也是 $0.20 流式处理层级的基础费率;相比之下,微软相同的 $0.10 只是限时发布优惠,并未公布 2027 年的标准费率
最后这一点,是大多数对比都会略过的。这两款模型目前价格相同,但其中一个价格有到期日,另一个没有。微软尚未公布促销结束后的费率,而各方报道对于该优惠是持续到 2026 年底,还是根本没有明确的结束时间,说法不一。如果你按照微软每 1,000 分钟 1.67 美元的价格来测算三年的转写预算,那你测算的是一个厂商并未承诺的数字。

这种重叠确实存在,而且它构成了功能列表的大部分。
暂且不谈流式传输的问题,这两款产品则高度趋同。两者都支持说话人分离。两者都返回词级时间戳。两者都处理逆文本规范化——将数字、日期、货币、联系方式以书面形式呈现。两者都接受领域术语,Grok Voice Transcribe 2.0 每次请求最多支持 100 个关键术语,MAI-Transcribe-2 则接受领域术语和缩写列表。两者都自动检测语言,并能跟随说话者在录音中途切换语言。两者都能处理 8 kHz 电话音频,而这正是大多数转录模型会悄然失败的情况,也是 SpaceXAI 着力调优最多的场景——其内部电话数据集在不同版本之间的 WER 从 10.6% 降至 7.1%,这是该公司基于自家音频报告的数字。
两者也都带有输入限制,这些限制不仅影响预算,更塑造了架构。Grok Voice Transcribe 2.0 可接受最大 500 MB 的文件,支持 12 种音频格式,采样率从 8 kHz 到 48 kHz。MAI-Transcribe-2 的限制并非由模型决定,而是由 Foundry 路径设定,因此团队应查阅 Microsoft 自己的文档来了解当前上限,而不要假设其与专用 STT 服务具有同等规格。
这种趋同意味着,决策会按顺序归结为三个问题:它是否需要实时,你实际有多少种语言,以及准确率差距会让你付出多大代价。第一个问题是二元的,会直接排除一个选项。第二个问题通常可以从你自己的一段音频样本中得到答案。第三个问题足够小,以至于对大多数基于文件的工作负载来说,它不会决定任何事情——0.25 个百分点的差距是真实存在的,但同样真实的是,这两个模型都处在任何人所测得的最佳数字的半个百分点以内。

这个该怎么办
把它们视作两条并行的技术栈,而不是一场正面对决。一个既运行实时坐席辅助、又运行隔夜合规归档的联络中心,并不是要在 Grok Voice Transcribe 2.0 和 MAI-Transcribe-2 之间二选一——它两个都在跑,唯一的问题是这样一来是否要付出两套供应商关系、两套凭证、两张发票和两个速率限制的代价。目前这两个模型都不在 OrcaRouter 的目录里,所以转写调用本身要各自发往对应供应商自己的 API。而一个 OrcaRouter 密钥真正覆盖的是下游的一切:摘要器、分类器、对转写内容进行推理的智能体,以及在同一条录音上比较两家供应商输出的评估任务。最后这一点才是值得在意的原因——你无法根据排行榜在这些模型之间做出选择,因为那个排行榜是八小时的英语坐席对话,而你的音频并不是。
关注两件事。第一,微软是否会在首发优惠结束后为 MAI-Transcribe-2 设定标准价格;如果永久定价为每 1,000 分钟 1.67 美元,那么仅凭成本它就会成为默认的批处理选择,而如果回落到 MAI-Transcribe-1 的每小时 0.36 美元,这场讨论就会短得多。第二,微软是否会推出流式 SKU。模型卡已经把实时字幕列为一个目标场景,而 MAI-Transcribe-2 与流式赛道之间唯一缺的就是一个端点——如果这一点落地,这两者就不再是不同赛道,而会成为竞争对手。
