
MAI-Transcribe-2-Streaming 现已上线:微软以 2.5% WER 夺得流式转录桂冠
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
MAI-Transcribe-2-Streaming 是微软 AI 对其 9 月发布所留下的那个问题的回答,而它用 28 天就给出了答案。MAI-Transcribe-2-Streaming 于 2026 年 10 月 1 日发布,是一款实时语音转文本模型,它在词语出现的同时就进行转写,而不是等文件结束后再转写。微软称,在 Artificial Analysis 的 AA-WER Streaming 评测中,无论是最终转写还是部分转写,其准确率均排名第一:词错误率为 2.5%,最终转写在语音结束后 0.13 秒即可就绪。这是厂商基于某追踪机构方法论的说法,而非该追踪机构发布的数据项——截至本文撰写时,该榜单的 37 个模型中并不包含它,而它将会取代的模型是 Grok Voice Transcribe 2.0(Streaming),后者的成绩为 2.73% 和 0.49 秒。它所基于的模型 MAI-Transcribe-2 于 9 月 3 日以批处理模型形式发布,词错误率为 2.0%,没有实时版本;流式版本弥合了这一差距,同时没有太多牺牲让批处理版本引人注目的准确率。它真正放弃的是价格:发布时流式的费率是批处理的 5.4 倍。
微软想要的叙事,是在流式排行榜上实现全盘横扫。数据所支撑的叙事则更窄,也更有意思——一款声称同时在准确率和延迟上领先的模型,处在这样一个前沿:榜单上最准确的条目,稳定下来所需时间是最快条目的四倍,而那些最快条目中没有一个的词错率低于 3%,且其定价与现有产品持平,而非更低。以下是这场发布会的实况,厂商说法均已标注。
Microsoft 在10月1日发布了什么?
MAI-Transcribe-2-Streaming 通过 Azure AI Speech 服务中的 Microsoft 语音技术栈提供服务,其文档以该模型自身的名称发布,并采用与批量版本相同的纯 API、不发布权重分发模式。它可转写 60 种语言,并支持自动连续语言检测,因此对于在流中途切换语言的会话,无需事先声明语言。Microsoft 将其定位在 Artificial Analysis 流式图表中准确率与延迟的帕累托前沿上——这是厂商对该追踪器数据的自行解读,也是该追踪器自身图表所支持的解读。
流式模型并不是这次发布的全部。Microsoft 还随之发布了两款语音模型:MAI-Voice-2.1,覆盖 23 种语言,涉及 26 个区域设置;以及 MAI-Voice-2.1-Flash,可处理最长 45 秒的音频,延迟约为 150 毫秒。整体来看,10 月 1 日的发布是一套完整的实时对话技术栈——听、理解、说——而不是一次单一模型的发布。

查看流媒体排行榜
AA-WER Streaming 针对每个模型衡量两件事:最终转写文本错得有多严重,以及说话人停止说话后还要多久才能完成转写。微软声称,MAI-Transcribe-2-Streaming 在这两方面都领先:语音结束后 0.13 秒时,最终转写的词错误率为 2.5%;首个部分转写在 0.12 秒时也是同样的 2.5%,微软称这是首次在两项准确率上都做到第一。请把这当作厂商数据来看——截至起草时,该追踪器自己的流式榜单尚未标出这个模型,因此没有独立的 MAI-Transcribe-2-Streaming 条目可供查看。榜单确实展示的是它声称要击败的竞争阵营,而这个阵营之间的差距,比“夺冠”式说法所暗示的要更接近:
• Grok Voice Transcribe 2.0 —— 据 Artificial Analysis,在语音结束后 0.49 秒即可达到 2.73% 的最终转写 WER,并且是当前榜单第一。这比 Microsoft 声称的 2.5% 落后 0.23 个百分点,且稳定下来大约慢四倍——这就是能跟得上的字幕与滞后字幕之间的差别。
• Muse Voice Transcribe — 据 Artificial Analysis 称,在 0.16 秒时为 3.06%。延迟方面最接近的竞争对手:约落后 30 毫秒,准确率比 Microsoft 宣称的差 0.5 个百分点。
• ElevenLabs Scribe v2 Realtime —— 根据 Artificial Analysis 的数据,在 0.14 秒下为 3.59%。速度上基本持平,准确率上落后超过一个百分点。
• Gemini 3.5 Transcribe Live — 0.40 秒时流式 WER 为 4.00%,这是 Artificial Analysis 公布、Google 为其自家 Live API 模型引用的数字。这意味着 1.5 个百分点的差距,而本次发布所瞄准的正是这一对比。
“首个中间结果”这一列,是该项声明与榜单其余部分最格格不入之处。在同一个追踪器上,Grok Voice Transcribe 2.0 的首个中间结果为 3.36%,Gemini 3.5 Transcribe Live 的为 5.77%——中间结果本应比最终转写更差,通常要差一个百分点甚至更多,因为模型在句子结束前就已下定论。首个中间结果与最终数字相同,才是微软此次发布中真正不寻常的地方,而这正是追踪器自身数据尚无法证实的一点。在出现对应数据行之前,请将其作为一项声明来引用。
需要坦率说明的是,对阅读字幕的人来说,0.13 秒和 0.16 秒是相同的产品体验,而 2.5% 相对于目前领跑榜单的 2.73%,大约相当于每 1,000 个词错 2 个。这样的领先幅度真实存在,但很小,至于它是否大到让人能感知,则取决于工作负载。真正带来影响的是长尾场景:一条每天运行八小时的联络中心流,按 2.73% 对 2.5% 来算,一年就会多出数万个错误词;而且转写中的词错误并非均匀分布——它们恰恰集中在那些让转写稿有价值的专有名词和数字上。

9.00美元每1,000分钟能买到什么
流式处理的成本高于批处理,而 Microsoft 将其定在实时档位的最高价,而不是更低。MAI-Transcribe-2-Streaming 的标价为每音频小时 $0.54,换算下来,每 1,000 分钟流式音频为 $9.00,并被称为优惠价,有效期至年底。相比之下,批处理版 MAI-Transcribe-2 为每音频小时 $0.10——每 1,000 分钟 $1.67——因此,对于同一底层系列而言,实时转写的成本约为基于文件的费率的 5.4×,且词错误率高出 0.5 个百分点。这并不是 Microsoft 在隐瞒的加价;这是持久连接以及必须在句子结束前就准确无误的部分转写所对应的诚实价格。
与流式层级的其他产品相比,局面喜忧参半。MAI-Transcribe-2-Streaming 与 Gemini 3.5 Transcribe Live 持平,价格约为每 1,000 分钟 9 美元——更准确,价格相同。它的价格高于每 1,000 分钟约 6.50 美元的 ElevenLabs Scribe v2 Realtime 和 Deepgram Flux,高于约 4 美元的 Cartesia Ink-2,并且大约是约 3 美元的 Muse Voice Transcribe 的三倍。因此,这次发布是以同等定价主打准确性和延迟,而不是价格战;已经在使用更便宜流式模型的团队,将用美元换取 WER 上的百分点。
这种取舍值得被精确地点明,因为批量发布所颠覆的正是同一种取舍。9月,微软让准确性变得廉价。10月,它让实时准确的成本与其他人一样。如果你的流水线最终只需要转录文本,那么10月1日的任何变化都不会改变你的账单。如果它需要在通话仍在进行时就拿到转录,那么权衡考量刚刚转向了质量。

在转录内容之上构建,是该决策的另一半,而这正是多模型层发挥价值之处。实时转录很少是流水线的终点——它会被摘要、评分、搜索、路由和升级,而这些步骤需要不同成本的不同模型。OrcaRouter 正是为这一层而存在:一个 API 覆盖 200 多个模型,提供商目录价以 0% 加价透传,自动故障转移,以及一个路由 DSL,可将实时转录发送给一个模型进行合规筛查,发送给另一个模型生成会议记录,而无需第二次集成。MAI-Transcribe-2-Streaming 本身并不在该名单上——它通过 Microsoft 自己的语音堆栈提供服务——但它生成的流式转录恰恰是那种高容量、延迟敏感的输入,表明应保持其上层与模型无关。
什么尚未被证明?
有三件事确实悬而未决。第一,说话人分离:批处理模型将说话人归属捆绑在一起,却没有公布说话人分离错误率,而 Microsoft 的流式资料完全没有声称支持说话人分离——对于为实时坐席辅助或字幕提供支持的实时模型而言,谁说了什么往往比原始 WER 更重要。第二,多语言细分:60 种语言并具备自动连续语言检测,是一个覆盖面很广的宣称,而且流式模型按语言划分的延迟可能比批处理对应版本波动大得多,因为部分转录内容的质量取决于模型多快确定一种语言。Microsoft 没有发布任何按语言划分的流式表格。第三,流式 WER 是在干净的基准音频上测得的;真正损害实际部署的故障模式是嘈杂的远场音频流,而在发布当天并不存在独立的远场流式对比。
它会让你的技术栈处于何种境地
这次发布的有趣之处并不在于 Microsoft 拥有最准确的流式转录。而在于节奏:9 月批处理,10 月流式,同属一个系列,面向同一套文档界面,而定价结构如今对同一底层能力覆盖了每 1,000 分钟 1.67 美元到 9.00 美元。这首次让团队有了真正的选择——只在实时性重要的地方为实时付费,其余一切都用批处理——但这也意味着转录层现在需要按工作负载来调优,而不是一次性标准化。
逐字解读这个标题式论断,它作为厂商声明是站得住脚的:微软称 MAI-Transcribe-2-Streaming 在最终转写和首个部分转写的准确率上均位列第一,并且处于帕累托前沿。打星号的地方在于:该追踪榜单尚未将这个模型标绘上去,它声称对当前领先者的优势小到可能在重跑中消失,价格优势为零,而且说话人分离方面的情况尚未披露。这些才是值得关注的地方,而不是那顶王冠。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
