为 Voxtral Mini 4B Realtime Arabic 与 Grok Voice Transcribe 2.0 的对比生成了主视觉标题卡,副标题为“榜单领跑者遇上精通 16 种方言的阿拉伯语专家”,角标为“Mistral 仓库,2026 年 10 月 8 日”,带有三个数据标签,分别显示 480ms 下 8.82% 的阿拉伯语字符错误率对比 0.49s 下 2.7% 的词错误率、16 种具名方言对比 38+ 种未记录语言,以及 Apache 2.0 权重对比每音频小时 $0.20,并将 OrcaRouter 徽标合成在右下角的白色条带中。
Guides & Insights

Voxtral Mini 4B Realtime Arabic 对决 Grok Voice Transcribe 2.0:排行榜领先者遇上方言专家

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

这个比较最诚实的起点在于:Voxtral Mini 4B Realtime Arabic 和 x​AI 的 G​rok Voice Transcribe 2.0 并不是在争同一份差事,而看清这一点最快的办法,就是看看两家厂商各自愿意公开些什么。Mistral AI 在 2026 年 10 月 8 日把 Voxtral Mini 4B Realtime Arabic 放上了 Hugging Face,却没有任何公告——Apache 2.0 权重、一份点名十六种阿拉伯语变体的模型卡,以及一个单一的准确率数字:在 480 毫秒延迟下,七个阿拉伯语基准测试的平均字符错误率为 8.82%。x​AI 的 G​rok Voice Transcribe 2.0 于 2026 年 9 月 18 日发布,配有发布博文、定价,以及一项第三方排行榜成绩:最终转写稿的词错误率为 2.7%,说话人停下后 0.49 秒文本即定稿,上线时位居 Artificial Analysis 流式语音转文字榜单第一。一个模型会明确告诉你它处理哪些方言,并拒绝在这些方言之外做任何猜测。另一个则声称覆盖 38 种以上语言,却连一种都没有逐一列出。

这种不对称正是整个比较的关键。如果你要为混合语言音频批量购买转录能力,那么 xAI 模型是完整得多的产品,而且优势很大。如果你的音频是阿拉伯语——具体说,是方言阿拉伯语,而不是广播用现代标准阿拉伯语——那么 Mistral 检查点所针对的问题,是 xAI 模型登顶的那个排行榜并不衡量的;而它在该榜上排第二、而非第一,若把这当作定论,就会是个误判。

价格计算,因为这里异常清晰

xAI 会公布费率。Mistral 则提供下载。这一差异决定了下游的一切,所以先从那个确实存在的数字入手。

• Grok Voice Transcribe 2.0 — 对于录制文件,通过 REST 为每音频小时 $0.10;通过流式 WebSocket 为每音频小时 $0.20。批量约为每千分钟 $1.67,流式约为每千分钟 $3.33,与相同价位的 Grok Voice Transcribe 1.0 保持不变。

• Voxtral Mini 4B Realtime Arabic —— 没有公布价格,因为没有已发布的服务。其权重采用 Apache 2.0,参数量约为 44 亿,以 BF16 表示,这意味着成本就是你为它接入的 GPU,以及你从中获得的利用率。在持续有使用量的情况下,这很便宜;而在零使用量的情况下,它是本文中最昂贵的选择,因为你是在为闲置硬件付费。

盈亏平衡点一点也不微妙。每小时 0.20 美元的流式传输费率约为每分钟三分之一美分。任何你用来运行 4.4B 模型的加速器,每小时成本都高于这个数——除非你让它持续承载稳定流量。这意味着开放权重路线只有在你有足够的阿拉伯语业务量让一台机器保持忙碌之后,才会在成本上胜出——而在你达到这一点之前,它在其他所有方面都处于劣势,因为 API 没有资本支出、没有容量规划,也没有运维负担。

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

算术权衡最早发生反转的唯一环节就是合规。Mistral 检查点在你掌控的硬件上处理音频,因此没有任何数据会离开你的网络,而且该卡片还附带一个归一化模块,所以阿拉伯语评分流水线可供你自行审计。Grok Voice Transcribe 2.0 在 xAI 的区域中运行,并且根据其文档,它会实时处理音频,但不会保留音频,也不会将其用于训练,并有 SOC 2 Type II 和 HIPAA 适用资格作为支撑。两种说法都站得住脚;但只有其中一种能让监管者检查代码路径。

每小时 0.20 美元实际能买到什么,以及 Mistral 模型并未发布

这里的功能差距比准确率差距更大,而且被讨论得少得多。Grok Voice Transcribe 2.0 是一个带有界面的产品;Voxtral Mini 4B Realtime Arabic 则是一个输出文本的检查点。

• 说话人分离(diarization)——Grok Voice Transcribe 2.0 已内置该功能,此外还支持最多八个独立通道的多通道转写。Mistral 的卡片未列出说话人分离能力;该模型生成的只是一份转写文本,而非带说话人归属的文本。

• 词级时间戳——Grok 会附带置信度分数,因此你可以对低置信度片段设置阈值,而不是同等信任整份转录文本。Mistral 的说明卡并未声称此检查点具备时间戳功能。

• 关键术语偏置——在 Grok 端点上,每个请求最多可设置 100 个领域术语,借此无需微调就能让模型正确处理产品名称、账户代码和地名。Mistral 实现同样效果的途径是在你自己的数据上进行微调,Apache 2.0 允许这样做,而托管端点则不允许。

• 逆向文本规范化——Grok 能将数字、日期、货币、电话号码和电子邮件地址转换为书面形式,覆盖 25 种语言。Mistral 卡片包含一个规范化脚本,但其声明的用途是为阿拉伯语基准评分,而不是为显示格式化输出。

• 接口层面——REST 用于最大 500 MB 的文件,WebSocket 流式传输位于 wss://api.x.ai/v1/stt,大约每 500 毫秒返回一次临时结果,有文档说明的限制为每秒 10 个请求和 100 个并发流式会话,并且目前仅支持单一区域。在 Mistral 这边,可使用 vLLM 提供服务并通过 /v1/realtime 进行 WebSocket 连接,或从 5.2.0 版本开始使用原生 Transformers,除硬件限制外没有速率限制。

如果你需要说话人分离和时间戳,那么还没轮到准确性,比较就已经结束了。这并不是在贬低 Mistral 模型——一个为生成准确方言文本而训练的 4B 阿拉伯语专用模型,与通用转录服务属于不同的工程目标——但这确实意味着,只有当你的流水线把转录文本当作自己后处理的原材料时,两者才能互换。

语言列表问题

两家供应商从相反的方向描述语言支持,但方式都让同一个问题悬而未决。

• Grok Voice Transcribe 2.0 — 支持 38 种以上语言,具备自动语言检测功能,可在单次录制中途切换语言,并且一次处理即可完成;支持从 8 kHz 到 48 kHz 的 12 种音频格式。文档只给出了数量,没有提供清单。材料中没有任何地方单独提及阿拉伯语,这意味着对阿拉伯语的支持是由数量推断而来,并未得到供应商确认。

• Voxtral Mini 4B Realtime Arabic — 明确列出了十六种阿拉伯语变体:现代标准阿拉伯语;来自马格里布的摩洛哥、利比亚、突尼斯、阿尔及利亚和哈桑尼亚阿拉伯语;来自海湾地区的海湾、内志、阿曼和萨那阿拉伯语;来自尼罗河谷的埃及和苏丹阿拉伯语;美索不达米亚阿拉伯语以及南黎凡特和北黎凡特阿拉伯语;还有乍得阿拉伯语。该集合之外的一切都不在范围内,模型卡上说明应改用通用实时模型。

所以,“这两者中哪一个能更好地处理阿拉伯语”这个问题有着奇怪的结构。Mistral 模型是有明确记录的阿拉伯语专家,公布了阿拉伯语错误率,却没有独立验证。xAI 模型是有明确记录的排行榜领先者,其供应商却根本没有确认阿拉伯语在适用范围之内。一个包含阿拉伯语的 38 种语言计数,和一份只包含阿拉伯语的十六种方言列表,都在回答“它会阿拉伯语吗”这个问题——但只有其中一个在回答“它会达里贾吗”。

Screenshot of the xAI documentation page for the grok-voice-transcribe-2.0 model, captured 10 October 2026, showing the Speech to Text entry in the Voice documentation navigation, the model page slug grok-voice-transcribe-2.0, its audio-to-text modality, and the us-east-1 region listing with rate-limit sections.

排行榜在这里帮不上忙。Artificial Analysis 的语音转文字评测采用固定配比,偏重英语座席通话,这对于通用转写排名而言是正确的设计,对于凸显方言阿拉伯语的优异表现而言却是错误的设计。一个模型可能在海湾阿拉伯语和摩洛哥阿拉伯语上确实更出色,却在那张榜上只显得表现不错。这并不是对榜单的批评;而是不应把它作为区域部署唯一依据的一个理由。

准确度,以不换算的单位表示

• Grok Voice Transcribe 2.0 — 最终转写的词错误率为 2.7%,达到最终结果耗时 0.49 秒;首次部分转写的错误率为 3.4%。这两项均在 Artificial Analysis 的 AA-WER v2 指数上测得,该指数将私有的智能体对话集与 VoxPopuli 和 Earnings22 混合在一起。首次部分转写的数字尤为值得注意:它从 Grok Voice Transcribe 1.0 的 18.3% 降了下来,而这正是可用于路由的部分转写与只能用于显示的部分转写之间的区别。

• Voxtral Mini 4B Realtime Arabic——在 480 毫秒延迟下,于七项阿拉伯语基准测试中取得 8.82% 的平均字符错误率;该结果出自厂商自身的评测,并附有配套提供的归一化脚本。Mistral 表示,这与字符错误率 7.91% 的 Voxtral Transcribe Arabic 仅相差 0.91 个百分点,而后者是同一实验室推出的离线阿拉伯语模型——由于双方的基准测试、归一化方式和测量方法完全相同,这一比较比跨厂商的比较更有价值。

把 2.7% 和 8.82% 并列,并不是在做比较;这是一种范畴错误。词错误率是相对于参考文本统计错误词数,字符错误率统计的是错误字符数,而阿拉伯文正字法——同一个词允许多种合法拼写、附着词可以自由附着——使这两个指标之间的差距远超拉丁字母语言所显示的差距。语料库不同,归一化方式不同,而且只有一个数字来自第三方。这两个数字能够合理告诉你的是,xAI 模型是一个经过实测、排名靠前的通用转写器,而 Mistral 模型则是一个声称的、面向阿拉伯语的转写器。它们无法告诉你哪一个能更好地转写你的音频。

真正有说服力的对比,是Mistral自家模型卡片里的那一组:流式8.82%,离线7.91%,同样的七个基准、同样的归一化方式、同一个实验室。相对于批处理模型,流式在阿拉伯语上大约要付出一个百分点的准确率代价。这笔交易划不划算由你判断,而现在你的判断是有依据的。

小模型在哪里胜出,而它并不在记分牌上

关于 Mistral 检查点,有三件事比数字所体现的更有价值,而它们没有一个出现在任何排行榜上。

首先是方言分类体系本身。把十六种变体列为各自独立的训练目标——其中包括哈桑尼亚语和乍得阿拉伯语——这本身就是一种表态,说明该模型的错误是在哪里被测量的。一个将阿拉伯语列为38种语言之一的通用多语言模型,首先改进的是现代标准阿拉伯语,因为训练信号和基准权重的大头都在那里。而为摩洛哥合作项目、与北非某部委共同打造的模型,则是在针对另一种分布做优化,并且它与两个基准——ISMA 和 Darija in the Wild——共同开发,这两个基准正是为衡量该分布而专门构建的。

第二点是可配置的延迟。8.82% 这个数字是在 480 毫秒下得出的,而延迟是可调节的,并非固定不变,这就把准确率变成了由操作者自行选择的一条曲线上的某个点。对于实时字幕任务,你可以缩短延迟并接受更多错误;对于通话录音流水线,你可以延长延迟,把准确率换回来。Grok Voice Transcribe 2.0 呈现的是一个固定的工作点,而厂商自己的升级路径说明了为什么这会带来后果——从 1.0 升级到 2.0,首次部分结果和最终结果的延迟都增加了约三分之一秒,而你能采用的补救办法是固定使用旧模型,而不是调节某个旋钮。

第三点是,Apache 2.0 的授权对你所持有的权重是无条件的。无论上游的检查点发生什么——无论它被公告、定价、弃用,还是从此不再被提及——该产物始终可以下载、微调,并放入你自己的产品中交付。托管端点的价目表和模型退役计划都由供应商说了算,而 xAI 已经释放出信号:它打算让 Grok Voice Transcribe 2.0 成为默认版本并弃用 1.0,这将使所有从未传入模型参数的集成一次性迁移到新的延迟表现上。

关于转录文本之上的路由层,有一点实用说明:这两个模型都不是我们自托管的语音转文字模型,本文也没有声称如此。OrcaRouter 覆盖的是消费该数据流的语言模型层——摘要器、分类器、智能体——只需一个 API key,即可在 200 多个模型间调用,按供应商挂牌价、0% 加价,因此供应商一旦调价,当天就会同步到这里。为了语言覆盖而同时使用两家语音供应商的团队,已经在承担两份合同和两条认证路径;把下游那一半收敛到同一个 key 上,是性价比最高的收益。

这个该怎么办

如果你的音频是多语言的,如果你需要开箱即用的说话人分离、时间戳或关键术语偏置,或者你希望今天就获得一项有公开费率和支持途径的服务,那就基于 Grok Voice Transcribe 2.0 来构建。它是更完整的产品,由第三方进行评测,而且每音频小时 $0.0 的流式费率足够低,以至于在你真正跑起大规模用量之前,开放权重的成本论据都不会起作用。

如果你的音频是阿拉伯语,而且具体来说是方言阿拉伯语;如果你出于合规原因需要将模型部署在自己的网络内;或者如果你打算进行微调——那就基于 Voxtral Mini 4B Realtime Arabic 来构建,因为其中只有一项允许这样做。首先要接受三件事:没有说话人分离,没有时间戳,也没有任何人发布的独立评估。在权重发布两天后,最后这一点并不是危险信号;它只是证据目前所处的位置。

最快能改变这种比较的,是针对真实方言音频的阿拉伯语专项评估,由两家供应商之外的一方进行,并对两个系统应用相同的归一化。在此之前,决策只能依据一家供应商自己列出的方言清单,去对照另一家供应商未明说的清单,而唯一可靠的测试就是你的录音。

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Grok Voice Transcribe 2.0 across six shared rows: price none published and self-host only against $0.10 per audio-hour over REST and $0.20 streaming; accuracy 8.82% Arabic character error rate vendor-reported against 2.7% final word error rate per Artificial Analysis; delay configurable with 480ms quoted against 0.49s to final and 0.49s to first partial; languages 16 named Arabic varieties against 38+ with none itemised by the vendor; diarization and timestamps not documented against included with confidence scores; and distribution Apache 2.0 weights on Hugging Face against API only. A footer reads that Mistral figures are vendor-reported and unverified while Grok figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

这两个端点都不是我们提供的服务——这是一次针对我们目录之外的两套系统的比较——但使用转写文本的模型是可路由的:用一个 API 密钥即可调用 200 多个模型,按提供商标价、0% 加价,因此摘要器或分类器的费率变动在公布当天即可生效。

自动故障转移正是防止双供应商语音配置将两个单点故障带入依赖它的语言层的关键所在。