已为 Voxtral Mini 4B Realtime Arabic 与 MAI-Transcribe-2-Streaming 的对比生成主视觉标题卡,副标题为“两个十月新品,两个证据问题”,徽章标注为“2026年10月,均为厂商报告”,并带有三个统计标签,分别显示:在 480 毫秒下 8.82% 的阿拉伯语字符错误率对比在 0.13 秒下 2.5% 的词错误率;16 种方言对比 60 种语言;以及 Apache 2.0 权重对比 Azure 预览版、每音频小时 0.54 美元,并且 OrcaRouter 徽标合成在右下角的白色条带中。
Guides & Insights

Voxtral Mini 4B Realtime Arabic 与 MAI-Transcribe-2-Streaming:两款十月新品,两个证据问题

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

这两个实时语音模型相隔七天问世,而它们登场的方式截然相反。MAI-Transcribe-2-Streaming 是 Microsoft AI 的首个流式转写模型,于 2026 年 10 月 1 日发布,配有发布博文、Azure 预览版上架信息,价格是每音频小时 0.54 美元的首发优惠价,持续到年底,并声称在 Artificial Analysis 的流式榜单上,最终转写和部分转写准确率均位列第一,词错误率为 2.5%,最终文本在语音结束后 0.13 秒即可就绪。Voxtral Mini 4B Realtime Arabic 是 Mistral AI 的阿拉伯语方言流式模型,于 2026 年 10 月 8 日发布到 Hugging Face,却完全没有公告——没有博文,没有价格,没有服务,只有 Apache 2.0 权重和一张模型卡,报告在 480 毫秒延迟下,七项阿拉伯语基准测试的平均字符错误率为 8.82%。微软的模型是一个成品,却带着无法验证的说法。Mistral 的模型是一个可验证的产物,却没有任何围绕它的产品。两者都值得了解,正是因为两者都把核心问题——它对阿拉伯语的处理效果究竟如何——交由厂商独自作答。

无论如何,这个比较都值得一做,因为这两个模型从相反的两端框定了同一个工程决策。微软卖的是广度和托管服务:60 种语言,自动持续语言检测,运行在 Azure AI Speech 之内,按小时计费,尚处于预览阶段。Mistral 给出的则是深度:十六种具名的阿拉伯语变体,小到可以跑在单个加速器上,还附带一个规范化脚本,让你能自行审查评分过程。如果你这个月就要搭建一条阿拉伯语转写流水线,你就是在两种立场之间做选择,而无论选哪一边,这个选择都取决于你目前尚不具备的证据。

每家供应商实际上说了什么,以及各董事会是怎么说的

证据差距是这场对决最重要的特征,所以它排在第一位。

• MAI-Transcribe-2-Streaming — 语音结束后 0.13 秒时最终转写词错误率为 2.5%,首个部分结果在 0.12 秒时同样为 2.5%,两者在 Artificial Analysis 的 AA-WER Streaming 方法论上均被列为准确率第一。这是微软自己的说法。截至本文撰写时,该追踪器的流式榜单尚未为该模型绘制一行数据,因此这一说法所依赖的是追踪器的方法论,背后却没有追踪器发布的数字支撑。

• Voxtral Mini 4B Realtime Arabic — 在配置延迟为 480 毫秒的情况下,七个阿拉伯语基准测试的平均字符错误率为 8.82%。这是 Mistral 自己的模型卡,并附有评估代码。尚无第三方复现,而且该模型才发布两天。

所以,本文中的两个头条数字,分别是用别人的尺子量出的厂商说法,以及自带尺子的厂商说法。两者都不是独立测量。不同之处在于,Mistral 的数字附带了重新推导它所需的归一化脚本,而 Microsoft 的数字则附带了一个尚未把它列入图表的榜单。如果你正在做采购决策,这一区别比 2.5 对 8.82 的差距更重要,而后者本来就毫无意义——词错误率和字符错误率无法相互换算,阿拉伯语正字法还会显著拉大二者的差距。

Mistral 的卡片中唯一真正有说服力的比较,是与它自己的离线同门型号之间的比较:Voxtral Transcribe Arabic 在同样的七项基准测试上、采用同样的归一化后,CER 为 7.91%,因此流式处理让这个模型付出了 0.91 个百分点的代价。微软在 2026 年 9 月 3 日发布批处理版 MAI-Transcribe-2 时,也为其自家系列公布了一个对等数字:词错误率为 2.0%——流式变体相比批处理模型让出半个百分点,同时增加了实时交付能力。把这两个厂商内部的差值并排来看,你就得到了本文中唯一真正同类可比的陈述:在各自的基准测试上,每个实验室的流式 SKU 都落后于其批处理同门,一个案例中大约落后一个百分点,另一个案例中落后半个百分点,而且两者测量的是不同语言。

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

语言覆盖:60 对 16,双方存在同样未命名的差距

• MAI-Transcribe-2-Streaming — 支持 60 种语言,并具备自动连续语言检测能力,因此对于会在流式传输过程中切换语言的会话,无需事先声明所用语言。微软的发布材料只给出了数量,并未提供清单;MAI-Transcribe 系列的语言覆盖范围在 Azure 语言支持文档中逐项列出,该文档也将阿拉伯语列为该系列支持的语言之一。

• Voxtral Mini 4B Realtime Arabic — 十六种阿拉伯语变体,逐一命名:现代标准阿拉伯语、摩洛哥阿拉伯语、利比亚阿拉伯语、突尼斯阿拉伯语、阿尔及利亚阿拉伯语和哈桑尼亚阿拉伯语、海湾阿拉伯语、纳吉迪阿拉伯语、阿曼阿拉伯语和萨那阿拉伯语、埃及阿拉伯语和苏丹阿拉伯语、美索不达米亚阿拉伯语以及南黎凡特和北黎凡特阿拉伯语,还有乍得阿拉伯语。在该集合之外,该模型在文档中被列为超出范围,并附有指向通用 Voxtral Mini 4B Realtime 的指引。

{{1}}这两个数字都无法告诉你真正需要的信息。{{/1}}{{2}}微软的60是一个广度计数,包含阿拉伯语,却没有描述阿拉伯语的性能表现;发布文章只陈述了一次语言总数,然后就一带而过。{{/2}}{{3}}Mistral的16是训练目标的枚举,附带了跨越七个基准集的单一总体错误率,这意味着方言级别的细分——也就是真正决定你的摩洛哥通话音频能否被转录的因素——同样没有公布。{{/3}}{{4}}两个模型,两家供应商,而在两种情况下,对“它在海湾阿拉伯语上具体表现如何”的诚实回答都是:{{/4}}{{5}}未说明。{{/5}}

这种枚举确实能给你的是一个先验。一个以乍得阿拉伯语和哈桑尼亚阿拉伯语作为具名目标的模型,是针对北非数据分布进行调优的;Mistral 与摩洛哥数字转型与行政改革部共同开发了它,并与该部一起构建了七个基准中的两个——ISMA 和 Darija in the Wild——专门用来衡量那些困难案例。一个通用的 60 语种模型首先会改善现代标准阿拉伯语,因为训练信号的大部分都在那里。如果你的音频是 Darija 或海湾阿拉伯语,那是不同的问题,而这两家供应商中只有一家对其中任何一种给出了数字。

延迟与延迟的形态

• MAI-Transcribe-2-Streaming — 从语音结束到最终转录仅需 0.13 秒,而首批部分结果在 0.12 秒时出现,这一速度足以让部分结果与最终结果的延迟实际上相同。这是 Microsoft 的说法,依据该追踪器的方法论测得。

• Voxtral Mini 4B Realtime Arabic —— 在公布的准确率点上,配置延迟为 480 毫秒,且该延迟可调。这大约是 Microsoft 数值的三倍半,而且它是操作者所选择的参数,而非固定属性。

0.3 秒对于需要在话语中间做出响应的语音代理来说是一个实实在在的差别,而对阅读字幕的人类来说则几乎不可见。这也是旋钮与数字之间的差别。Mistral 的延迟参数意味着你可以调得更紧、接受更多错误,或者调得更松、把准确率拿回来——这个检查点所微调自的基础模型宣称的范围是从 240 毫秒到 2.4 秒——而 Microsoft 的工作点则是 Azure 实际交付的。这让 Microsoft 的数字更容易理解,而 Mistral 的更容易调优,并且这意味着对这两个准确率数字的任何比较,实际上都是在比较一条曲线上的两个选定点与另一条曲线上的一个固定点。

功能面的差异同样悬殊,在准确率讨论变得有意思之前,值得对照你的流水线需求检查一下。

• MAI-Transcribe-2-Streaming — 通过 Azure AI Speech 交付,具备该系列已记录的功能集:说话人分离、词级时间戳、关键词和短语偏置、逐字与简洁两种输出风格,以及自动语言识别。该流式 SKU 自身关于说话人分离和时间戳的文档比批处理模型的更简略,因此请针对各终结点逐一确认,而不要想当然地认为二者功能对等。

Screenshot of the Microsoft Learn documentation page 'Use a MAI-Transcribe model' in Azure AI Speech, captured 10 October 2026, showing the public preview notice that the feature is provided without a service-level agreement and is not recommended for production workloads, alongside the statement that MAI-Transcribe is a next-generation speech-to-text model built in-house by the Microsoft AI team covering 60 languages.

• Voxtral Mini 4B Realtime 的模型卡记录了使用因果音频编码器进行的转录、在 /v1/realtime 通过 WebSocket 提供的 vLLM 服务、自 5.2.0 版本起对 Transformers 的原生支持,以及一项规范化功能。该模型卡未记录此检查点的说话人分离或词级时间戳。

交付模式:提供预览服务,而非可下载的权重

• MAI-Transcribe-2-Streaming — Azure 预览版,这意味着没有 SLA,且供应商建议不要将其用于生产环境。其定价为每音频小时 0.54 美元,这是持续到 2026 年底的 introductory rate(优惠价),标准费率尚未公布;批量版 MAI-Transcribe-2 同样以限时优惠方式推出,价格为每音频小时 0.10 美元。流式处理的费用是批处理费率的 5.4 倍。

• Voxtral Mini 4B Realtime Arabic — Apache 2.0,约 44 亿个参数,采用 BF16,可下载、可微调,并可在单个加速器上提供服务。没有价格、没有 SLA,也没有支持承诺,因为它背后没有服务。

那两句话里藏着决定。一个有着优惠价却未披露标准价格的预览服务,是一种会到期的承诺;5.4 倍的流式溢价和持续到 2026 年的窗口,都由微软说了算,而当标准价格落地时,批处理与流式的比例才是值得关注的数字。未作任何公告的 Apache 2.0 权重则恰恰相反:一件谁也无法收回的产物,系于一段无人描述过的供应商关系。该检查点是否会得到维护无从得知,但你今天手里的文件无论如何都仍能继续使用。

在实践中,通常是特定行业的约束决定了这类问题。受监管机构内部的阿拉伯语呼叫中心部署,可能完全无法将音频发送到预览版云端终结点;已经统一采用 Azure AI Speech 的团队,也可能不愿为某一个语系再引入一套本地部署栈。这两种约束都合情合理,而且都与两次发布中作为头条宣传的 2.5% 和 8.82% 这两个数字毫无关系。

在转录之上,同一点对两者都适用。OrcaRouter 并不路由这两个语音系统——这是对我们并不提供服务的两个系统所做的比较——但消费转录结果的摘要器、分类器或 agent 是可路由的:超过 200 个模型通过一个 API 提供,按提供商标价、0% 加价,因此供应商调价当天就能传到我们这边,而且当提供商性能下降时会自动故障转移。这一点在这里特别有用的地方是试用阶段:让两个转录候选方案都指向同一个下游流水线、共用一把密钥,这正是无需搭建两套集成即可进行正面对比的方式。

能解决这个问题的测试

两家供应商均未公布针对阿拉伯语的性能数据,也都未在方言音频上接受过独立评估。因此,这一比较只能归结为三项事实和一项建议。

事实:微软的流式模型以 0.13 秒的速度更快,并声称在一个尚未将其标出的排行榜上具有更好的总体准确率;Mistral 的模型以 480 毫秒发布了方言列表、阿拉伯语错误率,以及用于重新推导该错误率的归一化代码;而这两个准确率数字无法比较,因为一个是词错误率,另一个是在不同语料库上的字符错误率。

建议:做这个决定的人,都应该用自己的音频把两者各跑一遍,因为这是两家厂商唯一都没有给出答案的衡量指标。用真实录音来构建评测集——你实际接收到的方言组合、你实际使用的编解码器、你实际需要的领域词汇——再用 Mistral 的归一化处理,对照一个你信任的参考基准为两者打分。在自己的录音上做两小时测试,得到的信息会比两篇发布博文加起来还多,而且这是唯一能弄清以下问题的办法:0.13 秒的优势是否值得换来一个预览版依赖和 5.4 倍的流式溢价,还是说一个可下载的 4.4B 模型在 480 毫秒下已经足以胜任这项工作。

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and MAI-Transcribe-2-Streaming across six shared rows: price none published and self-host only against $0.54 per audio-hour introductory through the end of 2026; accuracy 8.82% Arabic character error rate at 480ms against a claimed 2.5% final word error rate at 0.13s; board status none because the model is days old against claimed first but not yet plotted; languages 16 named Arabic varieties against 60 with the list unpublished; delivery Apache 2.0 self-hosted weights against Azure preview with no SLA; and diarization and timestamps not documented against family documentation that requires per-SKU confirmation. A footer reads that both accuracy figures are vendor-reported and that no independent Arabic evaluation of either model exists. The OrcaRouter logo sits in a white strip at the bottom right.

OrcaRouter 并不提供这两款语音模型,本文也无意暗示相反——它真正涉及的是读取转录文本的语言层:一把密钥即可调用 200 多个模型,按供应商标价计费、0% 加价,因此当下游模型的供应商调整价格时,公布当天就会传导到你这里。

自动故障转移让两个转录候选方案共用一个下游管道,而不是分别做两次集成,这也是运行这项正面测试最经济的方式。