Carte de titre héro générée pour une comparaison de Voxtral Mini 4B Realtime Arabic et Voxtral 4B TTS, sous-titrée « deux extrémités de la même boucle vocale arabe, deux licences différentes », avec le badge « parole en entrée contre parole en sortie », trois pastilles de statistiques affichant 8,82 % de taux d'erreur sur les caractères arabes à 480 ms contre 70 ms de temps jusqu'au premier audio, 16 dialectes arabes contre 9 langues, dont l'arabe, et des poids Apache 2.0 contre des poids CC BY-NC 4.0, et le logo OrcaRouter incrusté dans une bande blanche en bas à droite.
Engineering & Research

Voxtral Mini 4B Realtime Arabic vs Voxtral 4B TTS : Deux extrémités d’une même conversation

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Ces deux modèles partagent un nom, un nombre de paramètres et un fichier de licence qui se comporte différemment, et c'est là que la ressemblance s'arrête. Voxtral Mini 4B Realtime Arabic, mis en ligne sur Hugging Face le 8 octobre 2026 sans annonce l'accompagnant, prend de l'audio en entrée et produit du texte arabe — un fine-tune en streaming de Voxtral-Mini-4B-Realtime-2602 conçu pour l'arabe standard moderne et quinze dialectes nommés, Apache 2.0, 8,82 % de taux d'erreur de caractères moyen à un délai de 480 millisecondes. Voxtral 4B T​TS, annoncé par Mistral AI en mars 2026, fait l'inverse : du texte en entrée, de la parole en sortie, vingt voix prédéfinies ainsi qu'une adaptation à partir d'un court extrait de référence, neuf langues dont l'arabe, et une licence — CC BY-NC 4.0 — qui interdit l'utilisation commerciale des poids eux-mêmes. Ce ne sont pas des alternatives et ce ne sont pas des variantes. Ce sont les deux moitiés d'une boucle vocale, et la raison de les examiner ensemble est que les décisions que vous prenez à propos de l'un d'eux contraignent l'autre plus que la plupart des équipes ne s'y attendent.

La plupart des pages de comparaison vous diront que ces modèles n'ont aucun rapport parce que l'un est un ASR et l'autre un TTS, puis s'arrêteront là. C'est vrai et inutile. Ce qui vaut réellement la peine de savoir, c'est là où ils se rejoignent : un agent vocal a besoin des deux, les deux licences pointent dans des directions opposées, les deux empreintes matérielles sont similaires alors que les caractéristiques de débit ne le sont pas, et les affirmations de couverture de l'arabe sont de formes complètement différentes. Tout ce qui suit porte sur ces quatre points de rencontre.

Ce qu’est chaque modèle, dans les termes qui comptent pour un pipeline

• Voxtral Mini 4B Realtime Arabic — reconnaissance automatique de la parole en streaming. Entrée audio à 16 kHz, sortie texte, environ 4,4 milliards de paramètres en BF16, servi via vLLM avec un WebSocket à /v1/realtime ou nativement dans Transformers à partir de la version 5.2.0. Un encodeur audio causal et un décodeur linguistique, un délai de transcription configurable annoncé à 480 millisecondes pour le chiffre de précision publié, et un module de normalisation fourni avec, afin que le taux d'erreur sur les caractères arabes puisse être recalculé. Apache 2.0.

• Voxtral 4B TTS — synthèse vocale en streaming et par lots. Texte en entrée, audio 24 kHz en sortie aux formats WAV, PCM, FLAC, MP3, AAC ou Opus, environ 4 milliards de paramètres, avec un ensemble de 20 voix prédéfinies et une adaptation de la voix à partir d’un clip de référence aussi court que trois secondes. Le benchmark interne de Mistral sur un seul H200 exécutant vLLM-Omni 0.18.0 avec une entrée de 500 caractères et une référence de dix secondes rapporte 70 millisecondes de latence et un facteur temps réel de 0,103 à une concurrence de 1, passant à 331 millisecondes et 0,237 à une concurrence de 16, et à 552 millisecondes à une concurrence de 32. Utilisé via une API au tarif de 0,016 $ les mille caractères.

La première observation qui ressort de ces deux paragraphes est que le duo est petit. Les deux modèles se situent dans la plage des 4 milliards de paramètres et tiennent tous les deux sur un seul accélérateur en BF16, ce qui signifie qu’un agent vocal arabe entièrement construit sur des poids ouverts représente un déploiement sur deux GPU au maximum, et vraisemblablement un déploiement sur un seul GPU avec quantification des deux côtés. C’est la raison pratique de les considérer comme un ensemble plutôt que comme deux décisions de produit distinctes.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

L'asymétrie des licences est le constat, et non une note de bas de page.

Voici ce qui surprend les personnes qui supposent que des modèles issus du même laboratoire, avec la même convention de nommage, ont les mêmes conditions.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0. L'usage commercial, la modification, la redistribution et l'ajustement fin sont tous autorisés, sous réserve de la restriction standard contre la violation des droits de tiers.

• Voxtral 4B TTS — CC BY-NC 4.0, hérité des jeux de données de voix de référence qui le sous-tendent. Non commercial. La fiche de Mistral précise explicitement que le modèle hérite de la licence de ses références vocales, issues de sources comprenant EARS, CML-TTS, IndicVoices-R et un ensemble d’audio naturel arabe. Les poids sont téléchargeables et la licence n’est pas commerciale.

Il s’agit d’une contrainte stricte qui pèse sur l’architecture précise vers laquelle tout le monde se tourne en premier. Si vous construisez un agent vocal arabe dont la branche parole-vers-texte est Voxtral Mini 4B Realtime Arabic et dont la branche texte-vers-parole est Voxtral 4B TTS, vous obtenez un pipeline où la moitié des composants sont librement exploitables à des fins commerciales et l’autre moitié ne l’est pas, et où la moitié restrictive régit le produit. Le fait que le modèle ASR soit sous Apache 2.0 ne sauve pas la branche TTS. Exécuter la paire localement ne change pas la licence, et le fait de ne pas diffuser les poids non plus — la contrainte s’attache à l’usage, pas à la distribution.

Screenshot of the Hugging Face model card for mistralai/Voxtral-4B-TTS-2603, captured 10 October 2026, showing the model name, the mistralai organisation, the Text-to-Speech pipeline tag, 922 likes, a language badge, and the CC BY-NC 4.0 licence inherited from the reference-voice datasets.

La voie commerciale que Mistral propose pour le volet vocal est l’API hébergée à 0,016 $ pour mille caractères, qui relève d’un contrat de service plutôt que d’une concession de licence. Pour une équipe produit, la conséquence pratique est que la moitié librement commercialisable de la boucle est celle qui écoute, et la moitié qui parle est soit une dépendance à une API, soit une discussion de licence. Cela inverse ce que la plupart des équipes supposent lorsqu’elles entreprennent de construire une pile vocale ouverte, et il vaut mieux le découvrir avant d’avoir écrit l’intégration plutôt qu’après.

Les affirmations arabes ne concordent pas, et une seule d’entre elles est une promesse de couverture.

Les deux modèles mentionnent l’arabe. Les listes signifient des choses différentes.

• Voxtral Mini 4B Realtime Arabic — L’arabe constitue l’intégralité du périmètre. Seize variétés sont énumérées comme cibles d’entraînement : arabe standard moderne, arabe marocain, libyen, tunisien, algérien et hassaniya, arabe du Golfe, najdi, omanais et sanaani, arabe égyptien et soudanais, arabe mésopotamien et arabe levantin du Sud et du Nord, et arabe tchadien. Tout ce qui se situe en dehors de cet ensemble est documenté comme hors périmètre. Un chiffre de précision agrégé, 8,82 % de CER, moyenné sur sept benchmarks arabes.

• Voxtral 4B TTS — L’arabe est l’une des neuf langues prises en charge, aux côtés de l’anglais, du français, de l’espagnol, de l’allemand, de l’italien, du portugais, du néerlandais et de l’hindi. La fiche décrit des « dialectes variés » au sein de ce support, sans les énumérer, et aucune donnée de qualité par langue n’est publiée pour l’arabe ni pour aucune des huit autres.

Lus ensemble, ces deux documents vous donnent un énoncé détaillé sur la qualité avec laquelle votre système entendra l'arabe, et quasiment aucun énoncé sur la qualité avec laquelle il le parlera. Cette asymétrie a une conséquence bien réelle pour un agent vocal en darija ou en arabe du Golfe : du côté de l'entrée, il y a un benchmark publié et une liste de dialectes sur lesquels vous pouvez vous évaluer, et du côté de la sortie, il y a un badge de langue et un catalogue de voix. Personne n'a publié de mesure d'intelligibilité de l'arabe dialectal pour le TTS Voxtral 4B, et la fonctionnalité d'adaptation de voix ne résout pas ce problème : adapter une voix change la personne à qui la parole ressemble, pas le dialecte qu'elle produit.

Il y a un deuxième point, plus subtil, concernant le chiffre de précision propre au modèle ASR, qui vaut aussi du côté TTS. Mistral rapporte 8,82 % de CER en streaming contre 7,91 % pour le Voxtral Transcribe Arabic hors ligne sur les mêmes sept benchmarks avec la même normalisation, donc le streaming coûte environ un point. Le compromis équivalent du côté TTS — ce que l’inférence en streaming coûte en qualité de sortie par rapport au traitement par lots — n’est pas quantifié du tout dans la documentation. Les chiffres de latence existent ; le delta de qualité, non.

Débit : un modèle est conçu pour être poussé, l'autre non

Mistral a publié des données de débit pour exactement l’un de ces modèles, et les chiffres expliquent pourquoi.

• Voxtral 4B TTS — mesuré sur un H200 avec vLLM-Omni, avec une entrée de 500 caractères et une référence audio de dix secondes, le débit va d’environ 119 caractères par seconde de temps GPU à une concurrence de 1 à environ 879 à une concurrence de 16, et à environ 1 431 à une concurrence de 32, la latence passant de 70 millisecondes à 331, puis à 552. C’est une courbe de débit sur laquelle vous pouvez planifier votre capacité, et c’est la forme que l’on attend d’un modèle conçu comme un service vocal de production.

• Voxtral Mini 4B Realtime Arabic — la fiche ne rapporte aucun chiffre de débit, aucun comportement en concurrence et aucun benchmark matériel. Ce qu’elle indique, en revanche, c’est l’architecture : un encodeur causal et un mécanisme d’attention à fenêtre glissante à la fois sur l’encodeur et sur le décodeur, décrits sur le modèle de base comme prenant en charge un streaming pratiquement illimité. Le point d’exactitude est donné à 480 millisecondes de latence, ce qui implique que le modèle tient le rythme de l’audio en temps réel sur du matériel approprié, et c’est là toute l’étendue de l’enveloppe de performances publiée.

L'écart n'est pas tant une critique de l'un ou l'autre modèle qu'un constat sur leur maturité. Le modèle TTS dispose d'un tableau de SLO publié parce qu'il a été lancé comme un produit avec un article de blog, une démo, une API et un prix. Le modèle ASR arabe n'a pas d'enveloppe de performance publiée parce qu'il est arrivé sous la forme d'un dépôt avec une fiche. Si vous dimensionnez aujourd'hui une flotte de transcription en arabe, le chiffre de débit dont vous avez besoin n'existe pas encore, et le seul moyen de l'obtenir est d'exécuter le chemin de service vLLM sur votre propre matériel avec vos propres fichiers audio.

C'est aussi là qu'une couche de routage modifie la forme du déploiement, et pas seulement la facturation. OrcaRouter ne route aucun de ces modèles — nous n'hébergeons pas non plus de point de terminaison vocal Mistral, et cet article ne prétend pas le contraire —, mais la couche de modèles de langage entre eux est exactement la couche qui gagne à être routée : une seule clé API pour plus de 200 modèles au prix catalogue du fournisseur, avec 0 % de marge, afin qu'un changement de prix d'un fournisseur se répercute de notre côté le jour même de son annonce, et un basculement automatique pour qu'un après-midi difficile d'un seul fournisseur en amont soit un reroutage plutôt qu'une panne dans votre boucle vocale. Un agent vocal composé de deux modèles Mistral auto-hébergés plus un modèle de raisonnement hébergé comporte trois domaines de défaillance ; la couche de routage est ce qui rend celui du milieu anodin.

Coût, côte à côte, avec la réserve que l’un des côtés n’a pas de prix

• Voxtral 4B TTS — 0,016 $ pour mille caractères via l’API de Mistral, ou le coût du GPU si vous l’auto-hébergez selon des conditions qui autorisent votre cas d’usage. Pour vous donner un ordre de grandeur approximatif, mille caractères représentent environ deux cents mots, donc une minute de sortie parlée se situe dans les fractions basses d’un centime au prix catalogue, avant même tout avantage de concurrence lié au fait de l’exécuter vous-même.

• Voxtral Mini 4B Realtime Arabic — aucun prix publié, aucun service hébergé, aucun tarif. Le coût, c’est le matériel et l’utilisation. Un modèle 4,4B BF16 sur un accélérateur moderne représente un coût mensuel fixe que vous amortissez sur tout l’audio que la machine peut traiter, ce qui est économique à volume soutenu et un pur gaspillage à volume occasionnel.

La comparaison qui compte probablement davantage est celle avec les alternatives vers lesquelles on se tournerait à la place. Du côté de l'écoute, le checkpoint arabe est en concurrence avec des API de streaming facturées à l'heure, dont les tarifs sont publiés et bas — MAI-Transcribe-2-Streaming de Microsoft à 0,54 $ par heure audio en tarif d'introduction, Grok Voice Transcribe 2.0 de xAI à 0,20 $ par heure audio en streaming — ce qui signifie qu'un service de transcription en arabe peut s'acheter pour quelques dixièmes de cent par minute, et l'argument en faveur des poids ouverts doit être fondé sur la précision dialectale, la résidence des données ou le fine-tuning plutôt que sur le coût unitaire. Du côté de la synthèse vocale, un modèle TTS auto-hébergé à coût marginal nul constitue un véritable avantage par rapport aux API facturées au caractère à volume, c'est pourquoi la licence CC BY-NC est le facteur contraignant plutôt que le prix.

Une remarque structurelle pour quiconque budgétise un basculement fondé sur le prix : un routeur qui répercute le prix catalogue du fournisseur à 0 % de marge est la surface où un changement de tarif d’un fournisseur apparaît le jour même de son annonce plutôt qu’au prochain cycle de révision tarifaire. Cela compte davantage du côté de l’écoute que du côté de la parole, car la transcription est facturée à l’heure d’audio, et c’est un chiffre que les fournisseurs font bouger.

Comment réfléchir au choix entre eux

Vous ne choisissez pas entre eux. La question est de savoir quelle moitié de la boucle vous pouvez construire sur des poids ouverts, et c’est la licence qui y répond.

Si votre besoin est un agent vocal arabe autonome où l’audio ne quitte jamais votre infrastructure, le volet écoute est disponible sans condition : Apache 2.0, téléchargeable, affinable, avec une liste de dialectes sur laquelle vous pouvez tester et un taux d’erreur en arabe publié. C’est sur le volet parole que se situe la contrainte, et vous avez deux options honnêtes — déplacer la synthèse vocale vers un service hébergé dans le cadre d’un accord commercial, ou retirer Voxtral 4B TTS de l’architecture et trouver un modèle de synthèse sous licence permissive pour l’arabe.

Si votre besoin est un service de transcription en production et que la langue est l’arabe, la décision se situe entre un point de contrôle téléchargeable de 4,4 B avec une taxonomie de dialectes publiée et un seul taux d’erreur agrégé, et une API de streaming hébergée avec un tarif publié, une latence publiée et un classement tiers. Le modèle ouvert l’emporte sur le contrôle, la résidence des données et le fine-tuning ; les options hébergées l’emportent sur les preuves, le support et la simplicité opérationnelle. Deux jours après l’apparition des poids, personne en dehors de Mistral ne les a mesurés, et c’est une raison de lancer votre propre benchmark plutôt qu’une raison de rejeter le point de contrôle.

Ce qui changerait le plus ce tableau, c’est une publication de synthèse en arabe sous des conditions autorisant l’usage commercial — le même schéma que celui déjà suivi du côté de l’écoute. Tant que cela n’existe pas, la boucle reste à moitié ouverte, et le travail pratique consiste à décider quelle moitié vous êtes prêt à louer.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Voxtral 4B TTS across six shared rows: task speech to text against text to speech with 24 kHz audio output; Arabic claim 16 named dialects at 8.82% character error rate against 1 of 9 languages with no quality figure; licence Apache 2.0 permitting commercial use against CC BY-NC 4.0 non-commercial weights; service price none published against $0.016 per 1,000 characters; published throughput none against 119 to 1,431 characters per second per GPU; and hardware roughly 4.4B in BF16 on a single accelerator against roughly 4B in BF16 on a single accelerator. A footer reads that all figures are Mistral's own and unreproduced, and that the two models are complementary rather than competing. The OrcaRouter logo sits in a white strip at the bottom right.

Nous n'hébergeons aucun de ces deux modèles vocaux Mistral et cet article ne prétend pas le contraire ; ce dont la boucle vocale a besoin au-dessus d'eux, c'est la couche linguistique, et celle-ci est routable - une seule clé API pour plus de 200 modèles au prix catalogue du fournisseur, avec 0 % de marge, de sorte qu'un changement de tarif d'un fournisseur arrive de notre côté le jour même de son annonce.

Basculement automatique empêche le maillon central d'un agent vocal à trois composants — un modèle de raisonnement en amont entre deux modèles Mistral auto-hébergés — d'être la partie qui fait tomber le produit.