
MAI-Transcribe-2 vs Muse Voice Transcribe:同一周,两种截然相反的音频押注
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0247智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82代码
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75代码
- obsidianQwen3.8 27B2026-08-1541智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69代码
- grokSpaceXAI: Grok 4.62026-08-1251智能77代码
- metaMeta: Muse Spark 1.22026-08-0547智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0347智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69代码
2026年9月1日所在的那一周里,两家前沿实验室各推出了一款语音模型;MAI-Transcribe-2与Muse Voice Transcribe最好被理解为对“音频智能应当存在于何处”这一问题的两种相反回答。Muse Voice Transcribe由Meta Superintelligence Labs于9月1日发布,是一款实时音频感知模型:它能转写语音、区分二十位以上的说话人、并检测说话人是否已经讲完,所有这些都在对实时音频80毫秒块的单次流式处理中一并完成,并且它在所被测的流式语音转写排行榜上位居榜首。MAI-Transcribe-2则由微软于两天后的9月3日发布,押的是相反的赌注:它是一个完全不追逐实时延迟的批处理引擎,而是把全部功力倾注于转写预录音频文件,在独立的非流式排行榜上达到最佳词错误率,速度约为实时的411倍,每1000分钟约合1.67美元。把二者作为“转写模型”直接对比,反而掩盖了真正的决策所在——这个决策取决于你需要文字时音频处于其生命中的哪个时刻:是它正在发生之际,还是已经结束之后。
两个产品指向不同的时刻
{{1}}Muse Voice Transcribe{{/1}} 专为音频仍在进行中的场景而打造。它是 Meta Muse 系列中的自回归多模态模型,只需一次处理即可完成三项任务——{{2}}自动语音识别、对超过二十位说话人的说话人分离,以及端点检测,即判断说话人是否已停止说话以便系统做出响应{{/2}}。Meta 表示,最终转录文本会在说话人停止说话后约 0.16 秒内生成;这些最终转录文本的词错误率为 3.1%,首批部分转录的词错误率为 3.6%——这些数据是 Meta 在发布当天援引 Artificial Analysis 流式排行榜公布的,截至本文撰写时尚未被独立复现。它可以单流处理时长超过一小时的音频,也能{{3}}在句子中途切换语言{{/3}},并以 70 多种语言训练而成,其中 25 种语言在发布时经过了全面验证。通过 Meta Model API 使用,价格为每 1,000 分钟音频 3.00 美元,约合每小时 0.18 美元。Meta 已确认不会开放模型权重。
MAI-Transcribe-2 专为音频已是文件这一场景而构建。微软的模型在 Artificial Analysis 的非流式排行榜上实现了 2.0% 的 AA-WER——位列第二,也是托管批量 API 中的最佳成绩——运行速度约为 411 倍实时,这是一个吞吐量数字,而非延迟承诺。它支持 60 种语言的转录并具备自动语言识别功能,集成了说话人分离、词级时间戳、关键词偏向以及逐字/净化两种风格,并支持 Hinglish 和 Spanglish 等语码转换场景。该模型通过 Microsoft Foundry 以公开预览形式提供,并已在 MAI Playground 上以每音频小时 $0.10 的限时发布优惠开放至年底,目前尚未宣布流式产品。微软的发布文章明确将其定位用于长音频和批量音频——在这些工作负载中,流式模型的低延迟毫无价值,但其每分钟成本却并非如此。

为什么这两个准确率数字并不冲突
人们自然会想要把2.0%和3.1%放在一起比较,然后宣布一个胜者,但这种做法错了两处。首先,这两个数字衡量的是不同任务:MAI-Transcribe-2的2.0%是在预录音频上的非流式准确率,模型可以查看整个文件;Muse Voice Transcribe的3.1%则是在最终转录文本上的流式准确率,是在音频到达时边接收边转录的约束条件下产生的。流式是更难的问题,因此流式排行榜和非流式排行榜是分开的榜单,各有各的分数。其次,两者的标签权重不同:MAI-Transcribe-2的数字是Artificial Analysis对该模型的评测结果,而Muse Voice Transcribe的数字是Meta在发布日报告的Artificial Analysis的评测结果——属于厂商自报且未经复现。最诚实的说法是,两个模型都在各自榜单顶部构成了可信的主张,而任何一个数字都不能告诉你另一条赛道上的情况。
说话人分离才是真正的比较所在,因为它是两款产品都具备的功能,也是双方抱负展示明显差异之处。Muse Voice Transcribe 将区分超过二十位说话人作为核心流式能力提供,Meta 报告其平均说话人分离错误率为17.5%,对照其援引的21.1%至28.6%竞品范围——同样系 Meta 单方面报告,未经核实。MAI-Transcribe-2 也捆绑了说话人分离功能,但微软完全没有公布说话人数量上限,也没有公布任何说话人分离错误率。对于两方通话,两款产品都表现不错,差异无关紧要。但对于十二人焦点小组或座谈录音来说,Muse Voice Transcribe 是两者中唯一明确给出多说话人数量上限的产品;而 MAI-Transcribe-2 的说话人分离能力毫无量化数据,这正是你在把更困难的音频托付给它之前,必须先对它进行测试的最重要原因。
有意义的比价
在价格上,两者的接近程度超出了批处理与流式处理这种对比框架所暗示的水平,因为每 1,000 分钟 1.67 美元(MAI-Transcribe-2,早鸟价)和每 1,000 分钟 3.00 美元(Muse Voice Transcribe)都处于托管语音服务的低价区间。这种比较只有在同一类别内才有意义。对于预录制的批处理转写,MAI-Transcribe-2 的价格不到流式原生模型的一半,同时具备更好的非流式 WER——但只有当您确实需要 Muse Voice Transcribe 的流式处理管线时,才值得把录音文件交给它处理,而这并不是处理存档的高效方式。对于实时会议音频,Muse Voice Transcribe 是本文中唯一真正可用的产品;其 3.00 美元的费率低于它推出时所对标的其他实时转写 API——Gemini 3.5 Transcribe Live 约为每 1,000 分钟 9 美元,GPT Live Transcribe 为 17 美元——同时还提供超过二十位发言人的说话人分离能力,这是那些产品所不具备的。坦率的价格结论是:Meta 把流式价格定得很低,微软把批处理价格定得更低,而这两个数字都属于促销期定价,一旦各家厂商公布标准费率,价格就会发生浮动。

哪个对应哪个音频
如果你的音频是实时的——会议实时转写、语音代理、实时字幕,任何需要在说话的同时获取文字的场景——Muse Voice Transcribe 就是首选,而且优势明显。它是这里唯一的流式模型,能在同一轮处理中区分二十多个说话人,而且从第一天起定价就旨在拿下这个赛道。它的弱点是需要带入试用中考虑的:准确率和说话人分离数据均由 Meta 自行报告,而且这个上线仅一周的流式模型尚未证明其在启动基准之外的嘈杂音频上表现如何。
如果你的音频已经是文件——档案、通话录音、媒体库,或任何要批量处理的内容——MAI-Transcribe-2 在每个关键指标上都是更优的选择:更低的实测 WER、约高出一个数量级的吞吐量,以及低于流式模型的每千分钟价格。它的风险恰好与 Muse 相反:推出仅四天、没有流式 SKU、说话人分离质量未经测量、定价采用早鸟价但背后的标准价格尚未公开。
介绍 MAI-Transcribe-2 的 Microsoft 发布页面列出了微软捆绑提供的功能,而流媒体竞争对手在同一次发布中并未提供这些功能。当您需要判断哪些说法属于产品功能范畴、哪些仍只是基准测试承诺时,这份文档就是您应当查阅的依据。

而且,如果转录只是你流水线的前半段,那么这两者之间的选择,就不如你在它们之上所做的选择重要。Muse Voice Transcribe 转录的实时会议音频,在真正有用之前,仍需摘要生成、行动项提取和后续草拟;MAI-Transcribe-2 转录的存档通话,仍需被搜索、脱敏,或路由到正确的下游系统。正是在这一层,多模型平台才体现出自身价值——OrcaRouter 用一个 API 覆盖 200 多个模型,按供应商目录价格原价透传、零加价,让下游工作只需一次集成,就能按工作负载调用不同模型。因此,无论哪个语音模型赢得你的试点,转录层之上的技术栈都无需为切换而重建。Muse Voice Transcribe 和 MAI-Transcribe-2 目前都不在该名单上;两者都托管在各自厂商的 API 上。本周真正落定的赌注更加聚焦、也更有用:实时转录和批量转录都已变得足够便宜,以至于差异化因素不再是文字本身——而是你如何利用这些文字。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
