
Voxtral Mini 4B Realtime Arabic 与 Gemini 3.5 Transcribe Live 对比:方言与广度
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
两个流式语音转文本模型,对于转录的难点究竟在哪里,给出了两种截然不同的押注。Voxtral Mini 4B Realtime Arabic 是一个 44 亿参数的微调模型,Mistral AI 于 2026 年 10 月 8 日将其推送到一个公开代码库,既没有发布帖、博客文章,也没有在公司新闻索引里占上一行;它专门针对现代标准阿拉伯语和十五种具名方言训练,以 Apache 2.0 许可发布,并提供可下载的 BF16 权重。Gemini 3.5 Transcribe Live 是 Gogle 的 Gemini 3.5 Transcribe 的流式端点,于 2026 年 8 月发布,带着平台级发布的整套阵仗,覆盖 85 种以上语言区域,而且是闭源的——一个预览 API,没有权重,单次会话上限为十分钟。一个模型深耕单一语系,并在自己的局限性说明中直言这一点;另一个则广撒网,却对重音层面的保证闭口不谈。你想要哪一款,取决于一个两家厂商的营销都未置于首位的维度:你的音频实际听起来是什么样。
这并不是一个对称的比较,这点值得一开始就说明,而不是把它埋在后面。截至撰写本文时,Mistral模型才发布了48小时,没有厂商公告,没有独立评估,也没有公布价格。Google的模型自8月底以来一直处于公开预览阶段,并且由第三方追踪器进行测评。将Mistral这一方视为来自模型卡的一组声明,将Google那一方视为一组测评结果加上一组声明,这样比较才诚实。
在数字之前,先说说每个模型是什么
• Voxtral Mini 4B Realtime Arabic — 一个流式 ASR 模型,基于 Voxtral-Mini-4B-Realtime-2602 微调而来,BF16 精度下约有 4.4B 参数,通过因果音频编码器和语言解码器接收 16 kHz 音频。它会在音频到达时输出文本,并具有可配置的转写延迟;采用 Apache 2.0 许可,权重托管在 Hugging Face 上。Mistral 与摩洛哥数字转型与行政改革部(Ministère de la Transition Numérique et de la Réforme Administrative)根据 2026 年 1 月签署的伙伴关系共同开发了该模型,并将其描述为主权 AI 资产。
• Gemini 3.5 Transcribe Live——双模型发布中的流式部分。Live API 端点通过 WebSocket 传输连续的麦克风音频,在说话人仍在讲话时返回部分转录文本,并在每段话语结束后不久确定最终转录文本。其批量版本 gemini-3.5-transcribe 可处理长达一小时的预录文件。两者均处于公开预览阶段,均为纯 API 形式,且均未公开模型权重。
第一个结构性差异不是准确性。而是在于,其中一个是今晚就能下载的文件,另一个则是你必须先获得许可才能使用的服务。

语言覆盖:16 种对 85 种以上,而差距并不是重点
统计语言数量会让 Mistral 模型显得范围狭窄,而让 Google 模型显得庞大无比。这些计数衡量的东西并不相同,若不加以说明就把它们并排比较,是这种对比最容易引发的常见错误。
• Voxtral Mini 4B Realtime Arabic — 16 种阿拉伯语变体,在模型卡上按方言家族逐一列出:现代标准阿拉伯语,以及马格里布地区的摩洛哥、利比亚、突尼斯、阿尔及利亚和哈桑尼亚阿拉伯语;海湾地区的海湾、纳吉迪、阿曼和萨那阿拉伯语;尼罗河谷的埃及和苏丹阿拉伯语;美索不达米亚以及南、北黎凡特阿拉伯语;还有乍得阿拉伯语。模型卡自身的定位是:该模型以阿拉伯语转写为目标,而语码转换——即说话者在对话过程中交替使用不同语言——是它旨在做好的能力,而非附带效果。
• Gemini 3.5 Transcribe Live — 在 85 多个语言区域中自动检测语言,支持句内和跨句语码转换。Google 的文档将阿拉伯语列入该集合;语言区域表将 Arabic (Egypt) 列为阿拉伯语条目,而更广泛的阿拉伯语语言区域覆盖范围并未在模型自身的文档中逐项列出。
诚实地读一读,这笔取舍的轮廓就显现了。Google 的 85+ 是一种广度主张:如果你的音频所用语言不是阿拉伯语,Google 端点能覆盖它,而 Mistral 模型会拒绝处理它——卡片明确说,对于其他语言,你应使用原始版 Voxtral Mini 4B Realtime,而不是这个检查点。Mistral 的 16 是一种深度主张。它并不是在声称转写阿拉伯语;它声称的是转写摩洛哥达里贾语、海湾阿拉伯语、埃及阿拉伯语和乍得阿拉伯语,并把这些当作彼此不同的目标,这比转写现代标准阿拉伯语、再指望方言从中自然显现要实质困难得多。一个偏重英语、广度优先的基准测试永远不会向你展示这种差异,因为方言数据集并不在其中。
对于一个摩洛哥呼叫中心或一条海湾地区客户支持热线来说,一个仅能处理 16 种方言的模型,可以胜过一款以未说明的每种方言准确率处理 85 个语言区域的模型。而对于一家用五种语言转写会议记录的欧洲公司来说,这个等式会立刻反转。两家供应商都没有错;他们只是选择了不同的客户。

你能比较的数字,以及不能比较的数字
不对称性正是在这里造成麻烦。这两个模型报告的是不同的计量单位,基于不同的语料库,背后有不同的证据支持,而且没有第三方让它们相互进行过对比测试。
• Voxtral Mini 4B Realtime Arabic — 在七个阿拉伯语基准测试中,平均字符错误率为 8.82%,配置的转写延迟为 480 毫秒。根据 Mistral 自己的模型卡,且未经独立复现。
• 它正在追赶的模型——Voxtral Transcribe Arabic,在相同的七个基准测试上、以相同的测量方式,CER 为 7.91%,因此这个实时模型落后同一厂商的离线阿拉伯语模型 0.91 个百分点。这个差距是 Mistral 自己做的比较,因此信息量格外大:厂商在告诉你,在这一语系上,流式处理在准确率上要付出什么代价。
• Gemini 3.5 Transcribe Live — 4.0% 流式词错误率,由 Artificial Analysis 测得并被 Google 引用,最终转录文本在语音结束后 0.40 秒到达。另有测量结果:在同一追踪机构的非流式榜单上为 2.6%,以及根据 Google 自己的报告,在 FLEURS 上的流式结果为 5.50%。
不要把 8.82% 的 CER 和 4.0% 的 WER 并列在一起,然后据此得出任何结论。字符错误率与词错误率的分母不同——阿拉伯文正字法使这两者之间的差距比拉丁字母语言中更大——而且语料库并不相同,归一化方式也不相同,一个数字附有可复现的脚本,另一个则来自某个追踪器的固定混合内容,而该混合内容偏向英语坐席对话。
更有用的比较是 Mistral 自家卡片中的那一组:在完全相同的基准和完全相同的归一化条件下,流式为 8.82%,离线为 7.91%。这清晰地衡量了低延迟在阿拉伯语上具体带来了什么、又付出了什么代价,其价值超过任何跨厂商的百分比。目前还没有人公开发布过 Google 和 Mistral 模型在同一段音频上的同条件阿拉伯语测试。在有人做这件事之前,“阿拉伯语中哪个更准确”仍是一个未解的问题,而唯一站得住脚的答案是:在你的录音上把两者都试一遍。
Mistral 的模型卡中有一个细节值得提一句,因为它与厂商自身利益相悖。它指出,Gemini 的安全过滤器会阻止转录某些 FLEURS 音频样本。这是关于竞争对手流水线的一项真实且可核查的观察,而且这也恰恰是永远不会出现在排行榜上的那类事情——一个拒绝转录样本的模型会被计为失败或缺失,而这两种解读都不公平。如果你的音频包含内容过滤器可能拦截的材料,那就是任何 WER 数值都无法暴露的部署风险。
延迟:对照固定数值的调节旋钮
流式模型通常依据单一的延迟指标进行比较。而这两个模型却没有一个共同的指标。
• Voxtral Mini 4B Realtime Arabic — 可配置的转写延迟。8.82% 的 CER 数值是在 480 毫秒下给出的,而延迟可调,这意味着该准确率数字是操作者所选曲线上的一点,而不是模型本身的属性。其基础模型宣称支持从 240 毫秒到 2.4 秒的范围。
• Gemini 3.5 Transcribe Live — 从语音结束到获得最终转写结果仅需 0.40 秒,由 Artificial Analysis 测量,且语音过程中会持续返回中间转写结果。谷歌另行声称,与 Chirp 3 相比,最终转写时间缩短了 70%,但这是厂商数据,且未经复现。
两者的延迟都落在同一区间——大约半秒——但工程含义不同。Mistral 模型把延迟与准确率之间的权衡作为参数交给你,因此当亚秒级字幕比最后几个百分点的准确率更重要时,你可以以 240 毫秒运行;而当情况并非如此时,则可以把延迟推后。Google 端点呈现的是一个固定的工作点,并附带 Google 自身的内容过滤行为。对于语音智能体而言,一个可调节的旋钮比一个略好的固定数值更有价值,因为合适的设置取决于你的音频和你的用户,而两家供应商都无法替你选定。
真正的分界线:开放权重对阵预览端点
在这一比较中,许可与分发方面的差异比任何基准差距都更显著,而且在讨论准确率之前,它就已经决定了大多数实际部署的走向。
• Voxtral Mini 4B Realtime Arabic — Apache 2.0 许可,BF16 权重托管在 Hugging Face 上,可通过 WebSocket 在 /v1/realtime 上使用 vLLM 提供服务,并从 5.2.0 版起在 Transformers 中获得原生支持。模型卡附带了 Python 示例和一个归一化模块,因此你可以自行复现阿拉伯语 CER 计算。整个流程无需依赖 Mistral 的服务器,而且该模型足够小,所以运营层面的问题是要用哪块 GPU,而不是你是否负担得起一块。
• Gemini 3.5 Transcribe Live — 仅提供 API,公共预览,除标价外未公布价格承诺,而且十分钟的会话上限意味着任何更长的内容都必须由你自己的代码进行分块、重连和拼接。随发布一同报道的三项限制对阿拉伯语部署尤为重要:流式端点不返回说话人分离,也不返回词级时间戳,而这两者在批量端点上都有,但此端点没有。如果你的阿拉伯语转写需要知道谁说了什么,或需要与音频进行时间对齐,那么无论使用哪种语言,Live 端点都无法生成。
这两项约束是真实阿拉伯语部署中选用小型开源模型的最有力理由,而且它们与准确率毫无关系。呼叫中心流水线需要说话人归属,合规流水线需要时间戳,而一个带有你可控的规范化脚本的阿拉伯语模型能同时满足这两者,无需与端点契约扯皮。Mistral 的模型卡也将其列为一项局限而非特性——它的目标是转录,它是对一个通用实时模型的微调,并且坦诚地说明,如果你需要,上游存在一个更通用的模型。
每项要花多少钱,以及哪些是未知的
• Gemini 3.5 Transcribe Live — 混合计价约为每分钟音频 0.009 美元,依据的是每百万输入 token 3.50 美元和每百万输出 token 21 美元的标价,其中音频按每秒 25 个 token 计算,转录文本按每分钟约 175 个 token 计算。批处理端点约为每分钟 0.005 美元。这两个数字都是根据 Google 假定的分词方式估算的,因此如果计费方式发生变化,它们也会变动。目前有免费层级。
• Voxtral Mini 4B Realtime Arabic —— 没有公布价格,因为并没有已发布的服务。成本就是你硬件的成本。一个 44 亿参数的 BF16 模型可以装进一块现代加速器,因此每音频小时的边际成本是电费和利用率,固定成本则是机器本身。在规模化使用时,这比任何按分钟计费的 API 都便宜;在零用量时,则比任何按分钟计费的 API 都贵——这正是开放权重交易通常的形态。
在 Mistral 方面,最关键的未知因素不是价格,而是这个代码库究竟是一条产品线的开端,还是针对摩洛哥合作的一次性交付成果。一个悄无声息地发布、没有公告、没有定价、也没有服务的模型,就是一个背后没有支持承诺的模型。Apache 2.0 意味着,对于你已经获得的权重,许可证不能被撤销,但它并未说明该检查点是否会得到维护,而模型卡自身的基础模型指向表明,通用实时模型仍是受支持的那条产品线。
对于转录文本之上的那一层,路由层体现自身价值的方式与转录毫无关系。这两个模型都不是我们托管的语音转文字服务——OrcaRouter 不路由其中任何一个端点——但摘要器、意图分类器或消费该流的智能体,都是你可以路由的模型:一个 API 密钥即可访问 200 多个模型,按提供商标价,0% 加价,因此供应商降价当天就会落到我们这边,并且如果提供商服务降级,还能自动故障转移。如果你已经在为方言覆盖而将两家语音供应商拼接在一起,那么把下游语言模型置于一个密钥之后,而不是两份合同之下,就是集成中便宜的那一半。
应该基于哪一个来构建
如果你的音频是阿拉伯语——一种方言、多种方言,或在阿拉伯语与其他语言之间进行语码转换——那么 Mistral 模型是更值得认真考虑的候选方案,原因在于结构而非数值。它明确说明了自己是为哪些方言而构建的,小到足以在你自己的硬件上运行,返回的是原始文本,你可以用自己的规范化流程进行后处理,并且它不受十分钟会话时长上限的限制,也不在你无法检查的内容过滤器之后。代价在于它只处理一个语系而拒绝其他语系,并且尚无人发表过对它的独立评估。
如果你的音频跨多种语言,或者你今天就需要一项有支持渠道和已公布价目表的服务,那么 Gemini 3.5 Transcribe Live 现在就可调用,已在第三方追踪器上得到衡量,并且覆盖 Mistral 检查点会拒绝的那些语言。代价是会话上限、流式端点缺少说话人分离和时间戳,以及阿拉伯语专项准确率仍是一个你必须自行测试的说法——其语言环境列表列出了埃及,而方言表现并未逐项列出。
值得关注的不是某个基准测试,而是 Mistral 究竟会不会宣布这款模型;如果会,又以什么价格和什么语言路线图来宣布。一个悄无声息、采用 Apache 2.0 许可证的仓库,是有用的产物,却是微弱的承诺。如果随后出现阿拉伯语方言路线图——黎凡特、海湾、埃及作为各自独立的检查点——那么小模型路线就会成为该地区真正完整的答案,而广度这一论点也就更难成立了。

这两个都不是我们托管的语音模型,但转录之上的那一层是可路由的——一个 API 密钥背后有 200 多个模型按提供商标价、0% 加价,因此供应商对你转录下游推理模型的价格调整当天即可生效。
自动故障转移意味着拼接式语音流水线的故障域少了一个,因为消费转录文本的摘要生成器或意图分类器可以被重新路由,而不必随提供商一起宕机。
