
MAI-Transcribe-2-Streaming 对比 Gemini 3.5 Transcribe Live:同样 9 美元,不同取舍
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
MAI-Transcribe-2-Streaming 和 Gemini 3.5 Transcribe Live 的费用相同,但二者建立在关于流式转录器用途的截然相反的理论之上。两者处理流式音频的价格都约为每 1,000 分钟 9.00 美元。微软的模型于 2026 年 10 月 1 日发布,是一件精密仪器:宣称在 0.13 秒内生成最终转录,流式词错误率为 2.5%,按照微软自己的说法,在最终转录和部分转录的准确率上均排名第一,基于 Artificial Analysis 的流式评测方法测得,但尚未作为一行出现在该榜单上。另一个模型自 2026 年 8 月 26 日起公开预览,并通过 Live API 提供服务,是一件覆盖型工具:支持 85 种以上语言并可在流中途切换,提供免费层级,流式词错误率为 4.00%,延迟 0.40 秒,这是 Artificial Analysis 为其测得的数字。两者都不是显而易见的选择,原因是它们并非真正在竞争同一种工作负载。
以下是按数字实际呈现情况进行的正面比较——厂商报告的数据已标注,追踪器数据已注明来源,还有那些某一模型在另一模型完全未参与竞争的维度上胜出的部分。
一句话版本
• 准确率与延迟——按已公布的数据来看 MAI-Transcribe-2-Streaming。Microsoft 声称,流式 WER 为 2.5%,0.13 秒即可得到最终转写,且在最终转写和部分转写的准确率上均排名第一,并且在 0.12 秒时的首个部分转写上达到 2.5%。相比之下,Artificial Analysis 给出的 Gemini 3.5 Transcribe Live 为 4.00%,耗时 0.40 秒。Microsoft 声称的优势是 1.5 个百分点,并且最终稳定下来大约快三倍。但需要注意的是,该追踪器尚未将 MAI-Transcribe-2-Streaming 本身绘制进去——榜单当前的领先者是 Grok Voice Transcribe 2.0,为 2.73% 和 0.49 秒,Muse Voice Transcribe 为 3.06% 和 0.16 秒——因此 2.5% 是一个厂商数据,用来与追踪器确实测量的这一领域相对照。在这两个模型都公布的指标轴上,这并非难分伯仲,但其中只有一侧的数据是独立公布的。
• 语言广度 — Gemini 3.5 Transcribe Live。支持 85 种以上语言,可自动检测,并且能在不重启会话的情况下在流式传输中途切换语言,这是 Google 为 Live API 宣传的核心亮点。MAI-Transcribe-2-Streaming 覆盖 60 种语言,并支持自动持续语言检测。Microsoft 的下限更高;Google 的上限更广,而这 25 种语言的差距主要存在于单语言流式模型完全无法使用的语言上。
• 会话形态——Gemini 3.5 Transcribe Live,而这一点是把双刃剑。Live API 是一个上限为 10 分钟的 WebSocket 会话,这对语音代理的一轮交互来说没问题,但用于长达一小时的会议就很别扭;微软没有为其流式模型公布同等的会话上限,如果你的工作单元是一次通话,而不是一轮对话,这一点就很重要。
• 准入门槛——Gemini 3.5 Transcribe Live。它提供免费层级,而在基于 token 的计价方式下,Google 的综合费率约为每分钟 0.009 美元。微软每音频小时 0.54 美元的定价是微软所称将持续到年底的优惠价,且未披露标准价格——这与其 9 月批量发布时的结构如出一辙。

为什么准确率的差距比表面上看起来更大
1.5 个百分点的词错误率差距听起来像是四舍五入的差异,直到你算清它的成本。在 4.00% 的流式 WER 下,Gemini 3.5 Transcribe Live 每 1,000 个词大约错 40 个;在微软声称的 2.5% 下,MAI-Transcribe-2-Streaming 错 25 个。以实时流水线产生的规模来看——一个支持组织每月处理 5,000 小时通话,即 300,000 分钟,按对话语速计算超过 4,500 万个词——这一差距意味着每年数百万个错误词,而且集中在下游系统所依赖的实体上:账户名称、工单编号、剂量、地址。
延迟差异是更难推销的那一个。语音结束后 0.13 秒对 0.40 秒,在实时字幕流中是可以感知的——大约 0.2 秒以下会被读作同步,而三分之一秒则会被读作转写文本在追赶说话人——但在以人类时间尺度刷新的坐席辅助面板中,它却感知不到。如果你的消费方是跟着阅读的人,微软的延迟优势就是产品本身。如果你的消费方是在话轮结束时获取最终转写文本的模型,那它就只是一个数字。
这两个数字都带有同样的限定条件,而且值得说明一次:这些是单次运行得出的数值,来自一个覆盖 37 个模型的追踪榜单,而该榜单上第一名与第三名之间的差距不到一分。重新运行可能会打乱流式排行榜顶部的排名,而批量榜单上两分的差距则不会如此。微软的 2.5% 也尚未出现在该榜单上——它是按追踪器的方法论衡量的厂商声明,这与追踪器发布的一行数据是两回事。
限制正是决定真正所在之处
功能限制比基准测试更快地将这两者区分开来,而它们又朝着相反的方向发展。
Gemini 3.5 Transcribe Live 有三项已记录在案的限制:Live API 的 10 分钟会话上限、不支持说话人分离,以及没有词级时间戳。第一项是架构性的——通过 WebSocket 会话进行流式传输在设计上就有上限——这意味着长篇实时转写必须跨会话拼接,而接缝处理则留给你自己。后两项则是绝对的:如果你的产品需要将语音归属到某个说话人,或者需要把词放到时间戳上以便搜索或字幕同步,那么 Gemini 3.5 Transcribe Live 无论花多少钱都做不到。
MAI-Transcribe-2-Streaming 的约束条件记录较少,这本身就是一种信息。微软没有为流式模型宣称说话人分离能力,也没有宣称词级时间戳能力;批处理版 MAI-Transcribe-2 捆绑了说话人分离功能,并返回词级时间戳,但那是批处理产品,假设流式 SKU 会继承这些功能,正是发布材料旨在防止的那类推断。微软确实宣称的是:支持 60 种语言、具备连续语言检测,并在准确率与延迟的权衡上处于帕累托前沿——这两项厂商声明都与跟踪器的数据一致。
所以,实话实说的功能解读是:这两个流式模型都没有公布说话人分离或词级时间戳。Gemini 3.5 Transcribe Live 有已公布的会话上限和免费层;MAI-Transcribe-2-Streaming 公布了支持的语言数量,但没有公布上限。如果你的需求包含说话人分离,那么这两个都不是答案,你面对的是在前面硬加了一层流式能力的批量转写。
价格平价到底在告诉你什么
两家供应商从相反方向得出相同的每 1,000 分钟 9 美元,是这一比较中最有趣的事实。Google 是通过 Live API 会话中基于 token 的定价做到的:音频输入为每百万 token 3.50 美元,文本输出为每百万 token 21 美元,并且大约每分钟消耗 175 个文本 token,综合下来约为每分钟 0.009 美元。Microsoft 则是通过为某一系列中的一款模型标出每音频小时 0.54 美元的固定价格做到的,而该系列的批处理同类产品价格为 0.10 美元。一个是按使用量计费的实时会话;另一个是带有推广折扣的固定每分钟费率。
这些结构在规模扩展时表现各异。固定费率可预测,且易于制定预算;按 token 计费的会话则随模型回复的多少和会话闲置时长而变化。对于高吞吐量的管道,固定费率是更友好的账单形式;对于原型或低流量功能,免费套餐和按 token 计费则是更友好的入门方式。

两种结构都无法改变的是转录层之上的那一层。无论由哪个模型生成,实时转录都是摘要、分类、脱敏和路由的输入,而这些步骤有着各自的成本与质量曲线——通常要跨多个模型运行,而不是只跑一个。这正是 OrcaRouter 所覆盖的层面:一个 API 打通 200 多个模型,按 0% 加价透传各提供商标价,自动故障转移,以及一套路由 DSL,可以按不同工作负载把转录分流到不同模型。MAI-Transcribe-2-Streaming 和 Gemini 3.5 Transcribe Live 都不在这份名单上——它们分别通过微软和谷歌自家的语音技术栈提供服务——重点不在于对它们做路由,而在于让它们下游的一切保持可移植。

该选哪一个
当准确性和稳定时间本身就是产品时,选择 MAI-Transcribe-2-Streaming:由人阅读的实时字幕、实时合规或质量评分——听错一个实体就会带来代价——或者 Gemini 的 10 分钟上限会迫使你拼接的长会话。当覆盖范围本身就是产品时,选择 Gemini 3.5 Transcribe Live:面向你无法预先列举的语言进行全球部署、流中途切换语言,或者一个由免费套餐和按 token 计费消除承诺负担的原型。两者都需要的团队并不会被困住——它们是具有不同会话模型的两个不同 API,而诚实的架构是按工作负载路由,而不是统一采用其中一个。
从这次比较中值得吸取的结论并不是微软赢了,而是流式转写如今有了两个同样定价、都值得信赖的前沿选项,这意味着决策已经从“有什么可用”转变为“这个具体工作负载需要什么”。这是一个更好的问题。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
