文章头图卡片标题为“MAI-Transcribe-2 正式上线”,配以“新闻 · MICROSOFT AI”徽章,副标题为“微软以每小时 0.10 美元的价格争夺语音转文字市场主导权”;统计栏显示 AA-WER 2.0%(据 Artificial Analysis 排名第 2)、约 411 倍实时速度(排名第 2)以及每小时 0.10 美元的发布定价;整体为白至蓝渐变背景,右下角带有 OrcaRouter 标识。
Guides & Insights

MAI-Transcribe-2 已上线:微软以每小时 0.10 美元的价格竞逐语音转写霸主地位

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

MAI-Transcribe-2 正是这样一款模型:{{1}}微软AI押注它能将语音转文字从高端功能变成大众化商品,而它发布时附带的数据指标,正是为论证这一点而设计的{{/1}}。该模型于2026年9月3日在 Microsoft Foundry、MAI Playground 与微软自有 API 接口上进入公共预览。{{2}}MAI-Transcribe-2 是微软五个月内推出的第三款语音模型{{/2}}——此前有4月发布的 MAI-Transcribe-1(每音频小时 $0.36)和6月发布的 MAI-Transcribe-1.5——{{3}}也是首款在团队选购时真正依据的两项指标上领先于它所点名的每一家托管式竞品的模型{{/3}}。在 Artificial Analysis 的非流式词错误率排行榜上,{{4}}其 AA-WER 为 2.0%,位居第二;速度约为实时的 411 倍,也位居第二{{/4}},{{5}}这两项表现使它在准确率与速度上处于帕累托前沿{{/5}}:在这份榜单上,{{6}}没有任何模型能在准确率和速度上同时胜过它{{/6}}。{{7}}其发布价格比前代产品低约72%{{/7}}。

微软自己为此次发布打出的标题是“全球最快、最准、最便宜的语音识别模型”,但读这句话时,应当连同原始材料上附带的星号注释一起看。这才是发布故事的真实经过——厂商的说法已逐条标注,仍待验证的部分也单独列了出来。

微软实际发布的产品

MAI-Transcribe-2 是一款针对预录音频的批处理转录模型,直接面向长音频——会议、通话、媒体档案、联络中心录音。微软将其定位于吞吐量和每分钟成本占据主导地位的工作负载。它支持 60 种语言的转录和自动语言识别;内置说话人分离,可将词语归到正确的说话人;返回词级时间戳;还支持针对人名、缩写和领域术语的关键词偏置。两种可配置的转录风格覆盖了常见的划分:“逐字”(verbatim) 风格保留填充词和重新起头的内容,用于合规级转录稿;“干净”(clean) 风格则剔除不流利之处,用于字幕和笔记。微软还专门提到混合语言语音中的语码转换,例如 Hinglish 和 Spanglish,以及模型在嘈杂真实音频中的稳健性。

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2 (dated September 3, 2026), showing the headline 'MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world' and the opening paragraph naming new features — diarization, configurable transcription styles, word-level timestamps — and comparisons against Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large and Scribe V2.

可用性方面的故事与功能列表同等重要。微软并未将其限制在企业级语音堆栈之后:该模型如今即可在 MAI Playground 中演示,并通过 Microsoft Foundry 以公共预览形式提供服务,Foundry 文档则归入 Azure AI Speech 服务之下。这是一种深思熟虑的分发选择——将前沿模型放在开发者仅凭一个密钥即可触及的地方,而不是放在需要企业销售周期先行审批的位置。微软尚未公布模型权重,且发布材料中没有任何迹象表明它打算公布。

按字面意思理解标题

“世界上最快的、最准确的和最便宜的”是三个强度不同的说法,而发布文章本身悄悄弱化了其中两个。每个说法的诚实版本是:

• 准确性 — 在 Artificial Analysis 的排行榜上,MAI-Transcribe-2 以 2.0% 的 AA-WER 位列第二,而非第一;Microsoft 正文自身也写的是第二。“最准确”的说法只有被解读为“在追踪到这一水平的托管批量 API 中”才能站得住脚,而且即便如此,它也只是对一款发布四天的模型的宣称,并非稳固的桂冠。Microsoft 还单独报告称,该模型在 FLEURS 多语言基准上以 60 种语言 5.2% 的平均 WER 位居第一——该数字来自 Microsoft 的发布文章,尚未按语言逐一独立复算。

• 速度——根据 Artificial Analysis 的数据,MAI-Transcribe-2 的运行速度约为实时速度的 411 倍,在该榜单上位列第二。奇怪的是,微软自己的公告从未列出这一绝对数字,而是以更友好的相对倍数作为宣传口径——“处理速度比领先竞品最高快 10 倍,尤其适合长音频”,具体而言比 OpenAI 的 GPT-Transcribe 快 10 倍,比 ElevenLabs 的 Scribe v2 快 7 倍,比 Gemini 3.5 Transcribe 快 5 倍。这些倍率是微软对同一组 Artificial Analysis 数据的表述框架,而基准速率才是关键:“比 Gemini 3.5 Transcribe 快 5 倍”听起来差距不大,直到你把它换算成处理每小时音频所需的计算分钟数,才会真正意识到差距。

• 最便宜——只有在两个前提同时成立时这句话才成立,微软自己也说得很清楚。$0.10的费率是“限时优惠,有效期至年底”,发布材料中任何地方都没有披露促销结束后的标准价格。而且它只是在高精度托管API中最便宜;像Whisper Large v3 Turbo这样的自托管开源模型,转录成本实际上只相当于电费。商品化的论点确实成立——只是比标题所暗示的范围更窄。

Screenshot of the Artificial Analysis Speech-to-Text leaderboard summary table showing Word Error Rate and Median Speed Factor columns for models including MAI-Transcribe-2 and MAI-Transcribe-1.5 under Microsoft AI, alongside rows for ElevenLabs Scribe v2 and Gemini 3.5 Transcribe.

每1,000分钟1.67美元能买到什么

按每音频小时 0.10 美元计价,MAI-Transcribe-2 相当于每 1,000 分钟音频约 1.67 美元。这个数字之所以能让人直观感受到差距,是因为要与其他在准确性上展开竞争的托管转录 API 进行对比。GPT-Transcribe 的标价为每 1,000 分钟 4.50 美元;Gemini 3.5 Transcribe 的预录音频服务按 Google 基于 token 的定价计算,约为每 1,000 分钟 5 美元;ElevenLabs 的 Scribe v2 标价更高。按每月 1,000 小时音频计算——这是一个可观但不算庞大的联络中心或媒体工作负载——MAI-Transcribe-2 的早鸟价与 GPT-Transcribe 的标价之间的差距约为每月 170 美元,且月月如此,这还未计入任何准确性差异。正是这样的价格差距,让转录不再是一个团队需要费心优化的开支项,而变成一个他们可以直接忽略的开支项。

这两项告诫应当同时说明。其一,促销价格在被终结之前不过是一场定价实验:基于0.10美元费率构建产品的团队应当清楚,标准费率并未公开,而2027年预算中诚实的规划数字应介于发布优惠价与微软在优惠到期时给出的定价之间。其二,“该精度层级中最便宜”的说法对总体拥有成本毫无说明——该模型仅提供API访问,因此对高用量团队而言,真正重要的比较是每1000分钟1.67美元相对于运行自有开放权重技术栈的全部成本,而不仅仅是与其他API的比较。

压缩到记分牌上,发射位置看起来是这样——下方每个数字都带有上文正文中附加的来源标注。

A single-column scoreboard titled 'MAI-Transcribe-2 — the scoreboard' listing AA-WER 2.0% (#2 per Artificial Analysis), speed ~411x real time (#2), price $1.67 per 1,000 minutes early-bird through 2026, 60 languages with automatic language ID, bundled diarization with unpublished error rate, and no streaming SKU announced, with the OrcaRouter logo bottom right.

什么尚未被证明?

尽管发布声明说得非常具体,有三件事实际上仍是悬而未决的。第一是流式处理:MAI‑Transcribe‑2 是一个批处理模型,微软在速度上的说法针对的是文件吞吐量,而且没有宣布或演示任何实时 SKU——“411×”并不是实时转录的延迟数字。第二是说话人分离质量:说话人归属是捆绑提供的,但微软没有发布说话人分离错误率,而这个特性在独立测试中最有可能表现得比 WER 更差。第三是多语言细分:单一一个 60 种语言的 FLEURS 平均值可能掩盖各语言之间的巨大差异,而微软没有公布分语言表格。每一条都说明,这个故事在第四天还没有结束。

它离开您的转录堆栈之处

这一切并不意味着现在就要选择 MAI-Transcribe-2,这正是为什么这个定价也值得那些并无更换供应商计划的团队关注。语音转文本很少是流程的终点——转写稿还会被摘要、执行、检索和路由,而正是下游这一层,才让多模型架构真正派上用场。像 OrcaRouter 这样的平台正是为技术栈的那一半而存在的:一个 API 覆盖 200 多个模型,供应商目录价以 0% 加价原样传递,自动故障转移,以及一套路由 DSL,让转写内容可以按工作负载送入不同的模型——会议纪要交给一个摘要器,合规审查交给另一个——无需做第二次集成。MAI-Transcribe-2 本身目前并不在那个名册上;它运行在微软自家的 API 和微软列出的第三方平台上。但它刚刚设定的这个价格,已经让语音转写成为一种商品,而这正是迄今最有力的论据:转写层以上的部分应当构建成与模型无关的架构。

发布价格便是信号。微软并不只是想在功能上赢得语音转文字市场——它要让高准确率变得极其便宜,以至于这个品类不再成为单独计费的项目。MAI-Transcribe-2 理应获得它如今的关注;只需读一下"全球最快、最准、最便宜"的说法,再注意其附带的三个星号:AA-WER 排名第二、促销定价直至年底,以及一个尚未讲出的流式转写故事。