
Grok Voice Transcribe 2.0 对比 Muse Voice Transcribe:17 天的统治与四分之一秒
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026年9月1日,Meta 表示,Muse Voice Transcribe 在 Artificial Analysis 的流式语音识别评测中以 3.1% 的最终词错误率拿下第一,而这一说法在十七天内无人挑战。9月18日,SpaceXAI 发布了 Grok Voice Transcribe 2.0,在同一榜单上取得 2.7%,并占据了该位置。两个模型,一个排名,相隔十七天——而更有意思的比较并非 0.4 个百分点的准确率差距,因为 Meta 的模型在最终确定一句话上仍然大约快三倍:语音结束后 0.16 秒,而 Grok Voice Transcribe 2.0 为 0.49 秒。Muse Voice Transcribe 是 Meta Superintelligence Labs 打造的实时音频感知模型,用于在 Meta 自家产品内部运行;在那里,四分之一秒的差别,决定了助手是让人觉得在场,还是让人觉得迟缓。Grok Voice Transcribe 2.0 是一个转录 API,为供任何人调用而构建,其价格让批量工作变得可行。这两个数字都是发布当天的厂商自报数据,而两者中只有一个此后被独立列入公开榜单。
排行榜现在实际上显示的是什么
AA-WER Streaming 排行榜是一个加权综合指标——AA-AgentTalk 占 50%,VoxPopuli 占 25%,Earnings22 占 25%,约八小时、大多为智能体形态的英语音频——两个模型都在其上评测,这正是它成为罕见正面对决的原因:至少数字是可比的。以下是并排对比,并包含厂商报告的数据:
• 最终转录准确率——Grok Voice Transcribe 2.0 的词错率(WER)为 2.7%,对比 Muse Voice Transcribe 的 3.1%
• 首次部分转录准确率 — 3.4% 对比 3.6%
• 首个部分结果耗时 — 0.49 秒 vs 0.13 秒
• 语音结束后到最终转录的时间 — 0.49 秒 vs 0.16 秒
• 说话人分离错误率 — 已纳入,未公布具体数值;而 Meta 评估中的平均值为 17.5%
分别看准确率行和延迟行,因为它们指向相反的方向,而两者都是真的。在准确率上,两个模型在最终转写上的差距在 0.4 个百分点以内,在首批部分结果上则是 0.2 个百分点——这个差距小到无论哪家公司下一次发布都可能使其反转,也小到任何通情达理的人都不应据此在两者之间做选择。在延迟上,两者则并不接近。Meta 的模型大约八分之一秒返回部分结果,大约六分之一秒给出最终结果,而 SpaceXAI 的模型在两个方向上大约都需要半秒。
整段对比用一句话就能概括:Grok Voice Transcribe 2.0 用延迟换取了准确率,而 Muse Voice Transcribe 则反其道而行之。SpaceXAI 将其首次部分结果错误率从 1.0 版本的 18.3% 降至 2.0 版本的 3.4%,代价则是在同一指标上从 0.25 秒增加到 0.49 秒。Meta 的模型则采用了相反的设计思路:80 毫秒的音频分块,以及一个通过强化学习得到的自适应延迟,用来决定在确定文本之前等待多久——这一机制的整个目的,就是在保持快速确定的同时维持准确率。两种选择都没有错。它们是对不同问题的回答。
你问的是哪个问题
如果转录结果要喂给一个必须在对话停顿间隙内做出响应的语音代理,那么 0.16 秒和 0.49 秒就是两种不同的产品。人类轮流对话能容忍几百毫秒的间隙,超过之后交互才开始让人觉得不对劲,而延迟预算是共享的——先转录,再推理,然后语音合成。一个能在六分之一秒内返回最终转录的模型,为流水线的其余部分留出了空间;而一个要花半秒的模型,在模型还没来得及思考任何事情之前,就已经消耗掉了大部分预算。这正是 Meta 所为之打造的,也是为什么这个模型运行在 Mac 上的 Meta AI 内部以及 Muse Code 内部,而不是主要作为供他人流水线使用的端点来提供。
如果转录稿是一份文档——一通通话录音、一场会议、一个视频库、一份合规存档——那么半秒不算什么,准确率差距也仍然不算什么,唯一重要的数字是一小时音频要花多少钱。而这正是两者急剧分化之处,其方向会让只看流式费率的人感到意外。
批处理价格减半,流式处理多十分之一
Meta 标价 Muse Voice Transcribe 为每音频小时 0.18 美元,或每 1,000 分钟 3.00 美元。Grok Voice Transcribe 2.0 标价为批处理每小时 0.10 美元,流式处理每小时 0.20 美元。所以:
• 流式 — Grok Voice Transcribe 2.0 每小时 0.20 美元,而 Muse Voice Transcribe 为 0.18 美元,因此 Meta 便宜约 10%
• 批量或录制 — 每小时 $0.10,对比 $0.18,因此 SpaceXAI 便宜 44%
• 按标价包含——说话人分离、带置信度的词级时间戳、关键词偏置和逆文本规范化在 SpaceXAI 一侧,而流式转录、说话人分离和端点检测作为单一模型在 Meta 一侧
• 免费套餐还是自托管——两者都不是
只做流式处理的团队在价格上应该对两者无所谓,而应根据延迟来做选择,这意味着选 Meta。任何有相当规模录音音频的团队都应该去看批处理那一行,因为每小时 0.08 美元的差价会不断累积:每月 5,000 小时,一个方案是 500 美元,另一个是 900 美元,而两者之间的准确率差距比这两个数字各自的舍入误差还小。
授权状况在要紧的方面完全相同,在不要紧的方面则不同。两者都是闭源权重——Muse Voice Transcribe 是专有产品,只能通过 Meta 托管的 API 使用;Grok Voice Transcribe 2.0 是商业 API,不提供下载。如果你的要求是音频绝不离开你控制的基础设施,那么两者都不是可选方案;而且两者都会让你面临供应商在你脚下更改价格、模型版本或弃用时间表的风险。这是一个真实存在的考量,而非假设:Grok Voice Transcribe 1.0 在其继任者发布后不到两周,就已经走上了弃用之路。

说话人分离,这是两者都没有主推的功能
两个模型都在单遍处理中完成说话人归属,而两年前这还是事后拼接上去的独立系统;这里的对比异常具体,因为 Meta 公布了一个数字,而 SpaceXAI 没有。
Meta 报告称,在其评估中,平均说话人分离错误率为 17.5%,无需后处理即可处理 20 个或更多说话人,而且是将这些说话人作为流式模型的一部分来处理,而不是作为一个下游步骤——"谁说了什么"随文本一同到达,而不是在文本之后才到达。在流式场景中,这确实很难做到:只有听够了某个说话人轮次的内容,才能识别出这个轮次;而 17.5% 是一个真实数字,也附带一个真实的限定条件:它是 Meta 自己的数字,是在 Meta 自行选择的评估集上取的平均值。
SpaceXAI 的模型包含说话人分离功能,且不额外收费,同时还在单次请求中最多支持八个独立音频声道,这是解决同一问题的另一种方式——如果你的音频以每位参与者各自独立的声道形式到达(联络中心的电话系统通常如此),那么声道分离比说话人分离更可靠,而且根本不存在错误率的问题。如果你的音频以单一混合流的形式到达,你就只能依赖说话人分离的质量,而这两家供应商中只有一家告诉了你那个质量究竟如何。
有个值得注意的二阶差异:Muse Voice Transcribe 把说话人分离、转写和端点检测视为一个模型产生一个输出,这意味着各组件无法独立失效。Grok Voice Transcribe 2.0 则让你把声道、关键术语和说话人分离作为彼此独立的调节杠杆。单一模型运行起来更简单,但调试起来更难。

语言,以及两份模型卡不再具有可比性的地方
Meta 用超过 70 种语言训练了 Muse Voice Transcribe,并在发布时对其中 25 种进行了广泛验证,支持句子内部和句子之间的原生语码转换,并支持时长超过一小时的音频。Grok Voice Transcribe 2.0 可处理自动语言检测,并支持在录音中途切换,还应用逆向文本规范化——将口述的日期、货币、电话号码和电子邮件地址呈现为书面形式——覆盖 25 种语言。
重叠部分是:一边是25种经过广泛验证的语言,另一边是25种归一化语言;这两个集合并不是同样那25种,而且两家供应商都没有公布名单。“训练了70多种语言”和“支持25种语言格式化”并不是可相提并论的说法,不应该彼此相减。可以说的是,Meta提出的是更广的多语言主张,而SpaceXAI提出的是一个范围更窄但更具可操作性的主张:检测语言只是基本要求,而将模型听到的内容格式化为下游系统能够解析的形式,才是缺失时会让集成出问题的部分。
这个选择,以及它可能不由你来做出的原因
抛开营销话术,这个决定可以归结为三句话。如果转写内容要在对话中实时使用,就选 Muse Voice Transcribe,因为 0.16 秒可不是细节。如果你有大量已录制的音频,就选 Grok Voice Transcribe 2.0,因为批量价格只要一半同样不是细节。如果你这两个极端都用不上,那就根据其他制约因素来选——地区、合同、现有集成——因为准确率上的差距并不足以一锤定音。
复杂之处在于,这两个模型中有一个并不是通常意义上的“在售”产品。Muse Voice Transcribe 的存在,是为了让 Meta 自家的助手显得更快,而它之所以能通过 Meta Model API 获取,很大程度上是因为 Meta 认定,曝光所带来的生态价值超过了独家专有的价值。这种情况可能改变,而且可能很快改变:就在同一周,Meta 还着手将 Muse 的连接器平台向第三方开发者开放,这说明这家公司是在投资自己的分发渠道,而不是甘当其他所有人的中立供应商。把生产环境的依赖建立在一个竞争对手的内部模型之上,就是在赌相关条款不会改变,而这样的赌注在历史上记录不佳。
这种不对称性正是不要把二者中的任何一个硬编码的理由。OrcaRouter 通过一个兼容 OpenAI 的密钥开放 200 多个模型,支持跨提供商自动故障转移,且按提供商标价 0% 加价——因此,当 SpaceXAI 将默认版本切换为 2.0 并弃用 1.0,或者当 Meta 重新定位其语音 API 时,所需的改动只是一个模型字符串,而不是一个迁移项目。对于一个三周内领头羊两次易主的类别而言,路由层才是技术栈中应当保持稳定的部分,而模型则恰恰是不应稳定的那部分。

未来一个月值得关注的一件事:既然 Grok Voice Transcribe 2.0 已经取代了 Muse Voice Transcribe,Artificial Analysis 是否会在流式榜单上重新测评 Muse Voice Transcribe。Meta 的 3.1% 和 SpaceXAI 的 2.7% 在发布时都已公布,但只有 SpaceXAI 的数据被独立列入榜单。如果重新测试时 Meta 的数字站得住脚,那么准确率差距就真的像看上去那么小,而延迟差距将决定一切。如果站不住脚,那十七天的统治就是故事的全部。
