为 Voxtral Mini 4B Realtime Arabic 与 Voxtral 4B TTS 的对比生成的主视觉标题卡,副标题为“同一阿拉伯语语音闭环的两端,两种不同的许可证”,徽章标注为“语音输入 对比 语音输出”,带有三个统计标签,分别显示:480ms 下阿拉伯语字符错误率为 8.82%,对比 70ms 的首个音频输出时间;16 种阿拉伯语方言,对比 9 种语言(包括阿拉伯语);Apache 2.0 权重,对比 CC BY-NC 4.0 权重;OrcaRouter 标志合成在右下角的白色条带中。
Engineering & Research

Voxtral Mini 4B Realtime Arabic 对比 Voxtral 4B TTS:同一场对话的两端

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

这两个模型共用一个名字、一个参数量,以及一个行为方式不同的许可证文件,而相似之处也就到此为止。Voxtral Mini 4B Realtime Arabic 于 2026 年 10 月 8 日被推送到 Hugging Face,没有任何随附公告,它接收音频并生成阿拉伯语文本——这是 Voxtral-Mini-4B-Realtime-2602 的流式微调版本,面向现代标准阿拉伯语和十五种具名方言打造,采用 Apache 2.0 许可,在 480 毫秒延迟下的平均字符错误率为 8.82%。Mistral AI 于 2026 年 3 月发布的 Voxtral 4B TTS 则反其道而行:输入文本,输出语音,二十种预设音色,外加基于一段简短参考音频的适配,支持包括阿拉伯语在内的九种语言,还有一个许可证——CC BY-NC 4.0——禁止将权重本身用于商业用途。它们不是彼此的替代方案,也不是彼此的变体。它们是一个语音闭环的两半,而之所以值得把它们放在一起看,是因为你对其中的一个所做的决定,会以超出大多数团队预期的方式约束另一个。

大多数对比页面会告诉你这些模型毫无关联,因为一个是 ASR,一个是 TTS,然后就到此为止。这没错,但没什么用。真正值得知道的是它们在何处交汇:语音代理两者都需要,两个许可证指向相反方向,两者硬件占用相近,而吞吐量特征却不同,并且阿拉伯语覆盖范围的说法形态完全不同。下面所有内容都围绕这四个交汇点展开。

用对流水线有意义的术语来说,每个模型是什么

• Voxtral Mini 4B Realtime Arabic —— 流式自动语音识别。输入 16 kHz 音频,输出文本,BF16 精度下约 44 亿参数,通过 vLLM 在 /v1/realtime 提供 WebSocket 服务,或从 5.2.0 版本起在 Transformers 中原生支持。一个因果音频编码器和一个语言解码器,可配置的转录延迟在公布的准确率数据中为 480 毫秒,并附带一个归一化模块,以便重新推导阿拉伯语字符错误率。Apache 2.0。

Voxtral 4B TTS — 流式与批量文本转语音。输入文本,输出 24 kHz 音频,格式为 WAV、PCM、FLAC、MP3、AAC 或 Opus,约 40 亿参数,内置 20 种预设音色,并可从短至三秒的参考音频片段进行声音适配。Mistral 在单块 H200 上使用 vLLM-Omni 0.18.0 运行的自有基准测试显示,在 500 字符输入和十秒参考音频下,并发为 1 时延迟为 70 毫秒,实时因子为 0.103;并发为 16 时升至 331 毫秒和 0.237;并发为 32 时为 552 毫秒。可通过 API 调用,价格为每千字符 0.016 美元。

从这两段中首先可以观察到的是,这对模型规模很小。两个模型都处于 40 亿参数级别,并且都能以 BF16 在单个加速器上运行,这意味着一个完全基于开放权重构建的阿拉伯语语音智能体最多只需两块 GPU 部署,而且在两侧都进行量化的情况下,很可能只需一块 GPU 部署。这就是从实际角度应把它们作为一个整体、而不是两项独立产品决策来看待的原因。

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

许可不对称本身就是研究发现,而不是脚注。

有这样一件事,会让那些以为来自同一实验室、采用相同命名规范的模型都适用相同条款的人感到惊讶。

• Voxtral Mini 4B Realtime Arabic — Apache 2.0。允许商业使用、修改、再分发和微调,但须遵守禁止侵犯第三方权利的标准限制。

• Voxtral 4B TTS — CC BY-NC 4.0,继承自其背后的参考语音数据集。非商业用途。Mistral 的模型卡明确指出,该模型继承其语音参考的许可证,这些参考来自包括 EARS、CML-TTS、IndicVoices-R 和一个阿拉伯语自然音频集在内的来源。权重可下载,而该许可证并非商业许可证。

这是一个针对所有人首先会想到的那套具体架构的硬性约束。如果你构建一个阿拉伯语语音智能体,其语音转文字环节使用 Voxtral Mini 4B Realtime Arabic,而文本转语音环节使用 Voxtral 4B TTS,那么你的流水线中就有一半组件可自由商用、一半不可,而具有限制性的那一半决定了整个产品。ASR 模型采用 Apache 2.0 并不能拯救 TTS 环节。在本地运行这一组合不会改变许可证,不发布权重也同样不会——该约束附随于使用行为,而非分发行为。

Screenshot of the Hugging Face model card for mistralai/Voxtral-4B-TTS-2603, captured 10 October 2026, showing the model name, the mistralai organisation, the Text-to-Speech pipeline tag, 922 likes, a language badge, and the CC BY-NC 4.0 licence inherited from the reference-voice datasets.

Mistral 为语音方面提供的商业途径是托管 API,价格为每千字符 0.016 美元,这属于服务协议而非许可授权。对于产品团队来说,实际的后果是,循环中可自由商业化的那一半是负责听的那一半,而负责说的那一半要么是 API 依赖,要么是一场许可谈判。这颠覆了大多数团队在着手构建开放语音栈时的假设,而且这一点值得在编写集成之前就发现,而不是之后。

阿拉伯语中的说法对不上,而且其中只有一项是承保承诺。

两个模型都列出了阿拉伯语。这些列表的含义并不相同。

• Voxtral Mini 4B Realtime Arabic — 阿拉伯语就是整个范围。列举了十六种变体作为训练目标:现代标准阿拉伯语、摩洛哥阿拉伯语、利比亚阿拉伯语、突尼斯阿拉伯语、阿尔及利亚阿拉伯语和哈桑尼亚阿拉伯语、海湾阿拉伯语、内志阿拉伯语、阿曼阿拉伯语和萨那阿拉伯语、埃及阿拉伯语和苏丹阿拉伯语、美索不达米亚阿拉伯语以及南黎凡特和北黎凡特阿拉伯语,还有乍得阿拉伯语。该集合之外的任何内容都被记录为超出范围。一个汇总指标为 8.82% CER,是对七个阿拉伯语基准取平均得出的。

• Voxtral 4B TTS — 阿拉伯语是九种受支持语言之一,与英语、法语、西班牙语、德语、意大利语、葡萄牙语、荷兰语和印地语并列。该模型卡将这一支持描述为涵盖“多种方言”,但未逐一列举,且无论是阿拉伯语还是其他八种语言,均未发布各语言的质量数据。

把这两者放在一起读,这对组合会详细说明你的系统能多好地听懂阿拉伯语,却几乎完全没有说明它能把阿拉伯语说得多好。这种不对称对达里贾或海湾阿拉伯语语音代理有实际影响:输入侧有已发布的基准和可供对照评估的方言列表,输出侧则只有一个语言徽章和一份音色名册。没有人发布过 Voxtral 4B TTS 的方言阿拉伯语可懂度测量结果,而语音适配功能也无法解决这个问题——适配音色改变的是语音听起来像谁,而不是它产出的是哪种方言。

还有第二个更微妙的点,关乎 ASR 模型自身的准确率指标,并且同样适用于 TTS 侧。Mistral 报告称,在同样的七个基准测试和同样的归一化条件下,流式处理的 CER 为 8.82%,而离线 Voxtral Transcribe Arabic 为 7.91%,因此流式处理大约要付出一个百分点的代价。TTS 侧相应的取舍——流式推理相对于批处理在输出质量上要付出多少代价——在材料中完全没有量化。延迟数据是有的;质量差异却没有。

吞吐量:一款模型生来就是用来被推向极限的,另一款则不是

Mistral 恰好为其中一款模型公布了吞吐量数据,而这些数字解释了原因。

• Voxtral 4B TTS —— 在单张 H200 上使用 vLLM-Omni 测得:输入 500 字符、音频参考时长 10 秒时,吞吐量从并发为 1 时的约 119 字符/GPU 秒,提升到并发为 16 时的约 879,再到并发为 32 时的约 1,431;延迟则从 70 毫秒升至 331,再升至 552。这是一条可用于容量规划的吞吐量曲线,也正是你期望一个为生产语音服务而设计的模型所呈现的形态。

• Voxtral Mini 4B Realtime Arabic——该卡片未报告吞吐量数据,也未说明并发行为,更没有硬件基准测试。它所陈述的是架构:编码器采用因果编码器,编码器和解码器均采用滑动窗口注意力机制;在基础模型上,该机制被描述为支持实际上无界的流式处理。准确率数据是在 480 毫秒延迟下给出的,这意味着该模型在适当的硬件上能够跟上实时音频,而这就是已公布性能范围的极限。

这一差距与其说是对任一模型的批评,不如说是对成熟度的说明。TTS 模型有已发布的 SLO 表,因为它是作为产品发布的,配有博客文章、演示、API 和定价。阿拉伯语 ASR 模型没有已发布的性能范围,因为它是作为一个带有模型卡的仓库出现的。如果你今天要为阿拉伯语转录集群做容量规划,你所需的吞吐量数字尚不存在,而获取它的唯一方式就是在你自己的硬件上、用你自己的音频运行 vLLM 服务路径。

这也正是路由层改变部署形态、而不只是改变账单的地方。OrcaRouter 并不路由这两个模型中的任何一个——我们既不托管 Mistral 的语音端点,本文也没有声称相反的情况——但它们之间的语言模型层,恰恰是最能受益于路由的一层:一个 API 密钥即可调用 200 多个模型,按提供商标价、0% 加价,因此厂商的价格变动在公布当天就会落到我们这边;再加上自动故障转移,让单个上游提供商的一个糟糕午后就只是一次重路由,而不是你的语音链路中的一次中断。由两个自托管的 Mistral 模型加上一个托管的推理模型组装而成的语音智能体有三个故障域;而路由层正是让中间那个变得平淡无奇的东西。

成本,并排对比,但需说明的是,其中一方没有价格。

• Voxtral 4B TTS——通过 Mistral 的 API 每千字符 $0.016,若在允许你使用场景的条款下自行托管,则只需承担 GPU 成本。粗略感受一下规模:一千字符大约是几百个单词,因此按标价,一分钟语音输出的成本仅为零点几美分,这还没有算上自行运行所带来的任何并发优势。

• Voxtral Mini 4B Realtime Arabic——没有公布价格,没有托管服务,也没有费率表。成本在于硬件和利用率。一个 4.4B BF16 模型运行在一台现代加速器上,是一项固定的月度成本,你可以把它摊销到该机器所能处理的尽可能多的音频上;在持续处理量下这很便宜,在偶尔处理量下则纯属浪费。

可能更重要的比较,是与你会转而选择的替代方案之间的比较。在听写一侧,这个阿拉伯语检查点面对的是按小时计费的流式 API,其价格公开且低廉——微软的 MAI-Transcribe-2-Streaming 为每音频小时 0.54 美元的推广价,xAI 的 Grok Voice Transcribe 2.0 为每音频小时 0.20 美元的流式价格——这意味着阿拉伯语转写服务每分钟只需十分之几美分,而开源权重方案的主张就必须建立在方言准确性、数据驻留或微调之上,而非单位成本。在语音合成一侧,零边际成本的自托管 TTS 模型在大规模使用下相比按字符计费的 API 具有真正的优势,这正是为什么制约因素在于 CC BY-NC 许可证,而不是价格。

给任何要为基于价格的切换做预算的人一条结构性提醒:一个按 0% 加价原样传导供应商目录价的路由器,正是厂商费率变动在公布当天就显现出来、而非等到下一个重新定价周期的那个层面。这一点在“听”这一侧比在“说”这一侧更重要,因为转写是按音频小时计价的,而这是厂商会变动的数字。

如何考虑在它们之间进行选择

你不是要在它们之间做选择。问题在于,这个循环的哪一半能够建立在开放权重之上,而许可证给出了答案。

如果你的需求是一个自包含的阿拉伯语语音代理,且音频永远不会离开你的基础设施,那么“听”这一环节可以无条件供你使用:Apache 2.0、可下载、可微调,并附有可供测试的方言列表和已发布的阿拉伯语错误率。约束落在“说”这一环节,你有两个坦诚的选择——将语音合成迁移到商业协议下的托管服务,或者从架构中移除 Voxtral 4B TTS,并寻找一个许可宽松的阿拉伯语合成模型。

如果你的需求是生产级转录服务,且语言是阿拉伯语,那么要做的抉择是:一边是可下载的 4.4B 检查点,附带已发布的方言分类体系和一个总体错误率;另一边是托管式流式 API,附带已公布的价格、已公布的延迟和一个第三方榜单。开放模型在控制权、数据驻留和微调上胜出;托管方案则在证据、支持和运维简便性上胜出。权重发布两天后,Mistral 之外还没有人对其做过评测,而这是你应该自己跑基准测试的理由,而不是否定这个检查点的理由。

最能改变这一局面的是阿拉伯语语音合成的发布,且条款允许商业使用——这正是“听”的那一侧早已遵循的模式。在它出现之前,这个闭环始终半开着,而实际要做的,就是决定你愿意租下哪一半。

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Voxtral 4B TTS across six shared rows: task speech to text against text to speech with 24 kHz audio output; Arabic claim 16 named dialects at 8.82% character error rate against 1 of 9 languages with no quality figure; licence Apache 2.0 permitting commercial use against CC BY-NC 4.0 non-commercial weights; service price none published against $0.016 per 1,000 characters; published throughput none against 119 to 1,431 characters per second per GPU; and hardware roughly 4.4B in BF16 on a single accelerator against roughly 4B in BF16 on a single accelerator. A footer reads that all figures are Mistral's own and unreproduced, and that the two models are complementary rather than competing. The OrcaRouter logo sits in a white strip at the bottom right.

这两个 Mistral 语音模型我们都不托管,本文也从未如此声称;在它们之上,语音循环真正需要的是语言层,而这一层是可以路由的——一个 API 密钥即可调用 200 多个模型,按供应商标价计费、零加价,因此供应商一旦调整价格,我们这边在公告当天即同步生效。

自动故障转移可确保三组件语音代理的中间环节——位于两个自托管 Mistral 模型之间的一个上游推理模型——不会成为拖垮整个产品的那一环。