
Voxtral Mini 4B Realtime Arabic vs Grok Voice Transcribe 2.0 : Un leader du classement rencontre un spécialiste des dialectes
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Le point de départ honnête de cette comparaison est que Voxtral Mini 4B Realtime Arabic et Grok Voice Transcribe 2.0 ne sont pas en concurrence pour le même usage, et le moyen le plus rapide de s'en rendre compte est de regarder ce que chaque fournisseur était prêt à publier. Mistral AI a mis Voxtral Mini 4B Realtime Arabic sur Hugging Face le 8 octobre 2026, sans annonce — des poids Apache 2.0, une fiche modèle nommant seize variétés d'arabe, et un seul chiffre de performance : 8,82 % de taux d'erreur moyen sur les caractères, sur sept benchmarks arabes, avec un délai de 480 millisecondes. Grok Voice Transcribe 2.0 de xAI est sorti le 18 septembre 2026 avec un article de lancement, un prix et un résultat de classement tiers : 2,7 % de taux d'erreur sur les mots dans les transcriptions finales, le texte étant stabilisé 0,49 seconde après l'arrêt du locuteur, premier au classement streaming speech-to-text d'Artificial Analysis lors de son lancement. Un modèle vous dit exactement quels dialectes il traite et refuse de deviner en dehors. L'autre vous dit qu'il couvre plus de 38 langues et n'en détaille pas une seule.
Cette asymétrie, c’est toute la comparaison. Si vous achetez de la capacité de transcription en volume pour de l’audio multilingue, le modèle xAI est le produit le plus complet, et de loin. Si votre audio est en arabe — et plus précisément s’il s’agit d’arabe dialectal, et non d’arabe standard moderne de radiodiffusion —, le checkpoint Mistral cible un problème que le classement que le modèle xAI domine ne mesure pas, et le fait qu’il soit deuxième à ce classement plutôt que premier serait une erreur à interpréter comme un verdict.
L'arithmétique des prix, parce qu'elle est inhabituellement propre ici
xAI publie un tarif. Mistral publie un téléchargement. Cette différence conditionne tout en aval, alors commencez par le nombre qui existe.
• Grok Voice Transcribe 2.0 — 0,10 $ par heure audio via REST pour les fichiers enregistrés, 0,20 $ par heure audio via le WebSocket en streaming. Soit environ 1,67 $ par millier de minutes pour le traitement par lots et 3,33 $ par millier de minutes en streaming, inchangé par rapport à Grok Voice Transcribe 1.0 aux mêmes tarifs.
• Voxtral Mini 4B Realtime Arabic — aucun prix publié, car il n'existe aucun service publié. Les poids sont sous Apache 2.0 et comptent environ 4,4 milliards de paramètres en BF16, ce qui signifie que le coût correspond au GPU que vous y attachez et à l'utilisation que vous en tirez. À volume soutenu, c'est bon marché ; à volume nul, c'est l'option la plus coûteuse de cet article, car vous payez pour du matériel inutilisé.
Le seuil de rentabilité n'a rien de subtil. Un tarif de streaming de 0,20 $ par heure représente environ un tiers de cent par minute. Tout accélérateur sur lequel vous feriez tourner un modèle 4,4B coûte plus que cela par heure, à moins que vous ne fassiez passer un trafic soutenu à travers, ce qui signifie que la voie open-weights n'est avantageuse en coût qu'une fois que vous avez assez de volume arabe pour garder une machine occupée — et elle perd sur tous les autres axes pendant que vous y arrivez, car l'API n'a ni capex, ni planification de capacité, ni charge opérationnelle.

Le seul point où l’arithmétique bascule tôt, c’est la conformité. Le checkpoint Mistral traite l’audio sur du matériel que vous contrôlez, donc rien ne quitte votre réseau, et la carte est livrée avec un module de normalisation : c’est donc à vous d’auditer le pipeline de notation en arabe. Grok Voice Transcribe 2.0 s’exécute dans les régions de xAI et, selon sa documentation, traite l’audio en temps réel sans le conserver ni l’utiliser pour l’entraînement, avec à l’appui SOC 2 Type II et l’éligibilité HIPAA. Les deux récits sont défendables ; un seul permet à un régulateur d’inspecter le chemin de code.
Ce que 0,20 $ de l’heure permet réellement d’acheter, et le modèle Mistral n’est pas livré
L’écart de fonctionnalités est ici plus grand que l’écart de précision, et il fait l’objet de bien moins de discussions. Grok Voice Transcribe 2.0 est un produit avec une interface ; Voxtral Mini 4B Realtime Arabic est un checkpoint qui émet du texte.
• Diarisation des locuteurs — incluse dans Grok Voice Transcribe 2.0, ainsi que la transcription multicanale sur jusqu'à huit canaux indépendants. La fiche Mistral ne mentionne aucune capacité de diarisation ; le modèle produit une transcription, et non une transcription attribuée.
• Horodatages au niveau du mot — Grok les fournit avec des scores de confiance associés, ce qui vous permet d’appliquer un seuil aux segments à faible confiance plutôt que de faire également confiance à l’ensemble d’une transcription. La fiche de Mistral ne revendique pas d’horodatages pour ce checkpoint.
• Biais de termes clés — jusqu'à 100 termes de domaine par requête sur le point de terminaison Grok, c'est ainsi que vous faites en sorte qu'un modèle reproduise correctement les noms de produits, les codes de compte et les noms de lieux sans fine-tuning. La voie Mistral vers le même résultat est le fine-tuning sur vos propres données, ce qu'Apache 2.0 permet et que le point de terminaison hébergé ne permet pas.
• Normalisation inverse du texte — Grok met en forme les nombres, les dates, les devises, les numéros de téléphone et les adresses e-mail sous forme écrite dans 25 langues. La fiche Mistral inclut un script de normalisation, mais son objectif déclaré est de noter des benchmarks arabes, et non de formater la sortie pour l’affichage.
• Surface d’interface — REST pour les fichiers jusqu’à 500 Mo, streaming WebSocket à wss://api.x.ai/v1/stt avec des résultats intermédiaires environ toutes les 500 ms, une limite documentée de 10 requêtes par seconde et de 100 sessions de streaming simultanées, et une seule région pour l’instant. Côté Mistral, service vLLM avec un WebSocket à /v1/realtime, ou Transformers natif à partir de la version 5.2.0, sans autre limite de débit que votre matériel.
Si vous avez besoin de diarisation et d'horodatages, la comparaison est terminée avant même que la précision n'entre en jeu. Ce n'est pas un reproche au modèle Mistral — un spécialiste arabe de 4B entraîné à produire un texte dialectal précis est une cible d'ingénierie différente de celle d'un service de transcription généraliste — mais cela signifie que les deux ne deviennent interchangeables que si votre pipeline traite la transcription comme une matière première pour votre propre post-traitement.
Le problème de la liste des langues
Les deux fournisseurs décrivent la prise en charge linguistique d'une manière qui laisse la même question sans réponse, et ce sous des angles opposés.
• Grok Voice Transcribe 2.0 — plus de 38 langues, détection automatique de la langue avec changement de langue en cours d’enregistrement en une seule passe, sur 12 formats audio allant de 8 kHz à 48 kHz. La documentation donne le nombre et non la liste. L’arabe n’est nommé individuellement nulle part dans le matériel, ce qui signifie que la prise en charge de l’arabe est sous-entendue par le nombre et non confirmée par le fournisseur.
• Voxtral Mini 4B Realtime Arabic — seize variétés d'arabe nommées explicitement : l'arabe standard moderne ; le marocain, le libyen, le tunisien, l'algérien et le hassaniya du Maghreb ; le golfe, le najdi, l'omani et le sanaani du Golfe ; l'égyptien et le soudanais de la vallée du Nil ; le mésopotamien et le levantin sud et nord ; et l'arabe tchadien. Tout ce qui se trouve en dehors de cet ensemble est hors périmètre, et la fiche indique d'utiliser le modèle temps réel général à la place.
Donc la question « lequel de ceux-ci gère mieux l’arabe » a une structure étrange. Le modèle Mistral est un spécialiste de l’arabe documenté, avec un taux d’erreur en arabe publié et aucune vérification indépendante. Le modèle xAI est un leader de classement documenté dont l’éditeur n’a pas du tout confirmé que l’arabe fasse partie du périmètre. Un décompte de 38 langues qui inclut l’arabe et une liste de seize dialectes qui n’inclut que l’arabe répondent tous les deux à la question « prend-il en charge l’arabe » — mais un seul d’entre eux répond à « prend-il en charge la darija ».

Le classement n’aide pas ici. L’évaluation de la transcription vocale d’Artificial Analysis est un mélange fixe pondéré en faveur des conversations d’agents en anglais, ce qui est le bon choix pour classer la transcription générale et le mauvais pour faire ressortir une réussite en arabe dialectal. Un modèle pourrait être réellement meilleur en arabe du Golfe et en arabe marocain et n’apparaître que comme simplement bon sur ce tableau. Ce n’est pas une critique du tableau ; c’est une raison de ne pas l’utiliser comme seule source pour un déploiement régional.
Précision, en unités qui ne se convertissent pas
• Grok Voice Transcribe 2.0 — taux d'erreur de mots de 2,7 % sur la transcription finale, avec 0,49 seconde pour l'obtenir, et de 3,4 % sur les premiers partiels, tous deux mesurés sur l'indice AA-WER v2 d'Artificial Analysis, qui combine un ensemble privé de conversations d'agents avec VoxPopuli et Earnings22. Le chiffre du premier partiel est celui qui est notable : il est passé de 18,3 % dans Grok Voice Transcribe 1.0, ce qui fait la différence entre une transcription partielle sur laquelle on peut router et une que l'on peut seulement afficher.
• Voxtral Mini 4B Realtime Arabic — 8,82 % de taux d'erreur de caractères moyen sur sept benchmarks arabes à 480 millisecondes de latence, selon l'évaluation du fournisseur lui-même, avec un script de normalisation fourni en accompagnement. Mistral indique que ce résultat se situe à 0,91 point de pourcentage de Voxtral Transcribe Arabic à 7,91 % de CER, qui est le modèle arabe hors ligne du même laboratoire — une comparaison qui vaut davantage qu'une comparaison entre fournisseurs, car les benchmarks, la normalisation et la mesure sont identiques des deux côtés.
Mettre 2,7 % à côté de 8,82 % n'est pas une comparaison ; c'est une erreur de catégorie. Le taux d'erreur sur les mots compte les mots erronés par rapport à une référence, le taux d'erreur sur les caractères compte les caractères erronés, et l'orthographe arabe — où un même mot tolère plusieurs graphies légitimes et où les clitiques s'attachent librement — creuse l'écart entre les deux métriques bien au-delà de ce que montrent les langues à alphabet latin. Les corpus sont différents, la normalisation est différente, et un seul chiffre provient d'un tiers. Ce que les deux nombres peuvent légitimement vous dire, c'est que le modèle xAI est un transcripteur général mesuré et bien classé, et que le modèle Mistral est un modèle revendiqué, spécifique à l'arabe. Ils ne peuvent pas vous dire lequel transcrit mieux votre audio.
La comparaison qui convertit vraiment est celle qui figure dans la fiche de Mistral elle-même : 8,82 % en streaming contre 7,91 % hors ligne, les mêmes sept benchmarks, la même normalisation, le même laboratoire. Le streaming coûte environ un point de précision en arabe par rapport à un modèle par lots. Savoir si c'est un bon compromis, c'est à vous de décider, et votre décision est désormais éclairée.
Là où le petit modèle gagne, et ce n’est pas sur le tableau d’affichage
Trois choses concernant le checkpoint Mistral valent plus que les chiffres ne le suggèrent, et aucune d’elles n’apparaît dans un classement.
Le premier est la taxonomie des dialectes elle-même. Nommer seize variétés comme cibles d'entraînement distinctes, y compris le hassaniya et l'arabe tchadien, revient à affirmer où les erreurs du modèle ont été mesurées. Un modèle multilingue général qui inclut l'arabe parmi 38 langues s'améliore d'abord sur l'arabe standard moderne, car c'est là que se trouvent l'essentiel du signal d'entraînement et du poids du benchmark. Un modèle conçu pour le partenariat marocain aux côtés d'un ministère nord-africain optimise pour une distribution différente, et il a été co-développé avec deux benchmarks — ISMA et Darija in the Wild — conçus spécifiquement pour la mesurer.
Le second est le délai configurable. Le chiffre de 8,82 % est annoncé à 480 millisecondes, et le délai est ajustable plutôt que fixe, ce qui transforme le chiffre de précision en un point sur une courbe que l'opérateur choisit. Pour une tâche de sous-titrage en direct, vous pouvez le raccourcir et accepter davantage d'erreurs ; pour un pipeline d'enregistrement d'appels, vous pouvez l'allonger et récupérer la précision. Grok Voice Transcribe 2.0 présente un point de fonctionnement fixe, et le propre parcours de mise à niveau du fournisseur montre pourquoi cela a des conséquences — passer de 1.0 à 2.0 a coûté environ un tiers de seconde en latence, à la fois pour le premier partiel et pour le résultat final, et la solution à votre disposition est d'épingler l'ancien modèle, pas de tourner un bouton.
Le troisième point est que l’octroi de la licence Apache 2.0 est inconditionnel pour les poids dont vous disposez. Quoi qu’il arrive au checkpoint en amont — qu’il soit annoncé, tarifé, déprécié ou jamais mentionné à nouveau —, l’artefact reste téléchargeable, affinable et livrable dans votre propre produit. La grille tarifaire d’un point de terminaison hébergé et son calendrier de mise hors service d’un modèle sont tous deux modifiables par le fournisseur, et xAI a déjà signalé son intention de faire de Grok Voice Transcribe 2.0 le modèle par défaut et de déprécier la version 1.0, ce qui fera basculer d’un seul coup vers le nouveau profil de latence toutes les intégrations qui n’ont jamais transmis de paramètre de modèle.
Sur la couche de routage au-dessus de la transcription, une remarque pratique : aucun des deux modèles n’est un service de transcription vocale que nous hébergeons, et cet article ne prétend pas le contraire. Ce qu’OrcaRouter couvre, c’est la couche de modèles de langage qui consomme le flux — le résumeur, le classifieur, l’agent — derrière une seule clé API, sur plus de 200 modèles au prix catalogue du fournisseur avec 0 % de majoration, de sorte qu’un changement de tarif d’un fournisseur est répercuté ici le jour même. Les équipes qui utilisent deux fournisseurs de reconnaissance vocale pour couvrir les langues portent déjà deux contrats et deux chemins d’authentification ; faire converger la moitié en aval vers une seule clé est le gain facile.
Que faire de ceci
Appuyez-vous sur Grok Voice Transcribe 2.0 si votre audio est multilingue, si vous avez besoin de diarisation, d’horodatages ou de biais par termes clés dès le départ, ou si vous voulez un service avec un tarif publié et un canal de support dès aujourd’hui. C’est le produit le plus complet, il est évalué par un tiers, et le tarif de streaming de 0,20 $ par heure d’audio est suffisamment bas pour que l’argument du coût des modèles à poids ouverts ne pèse pas tant que vous n’atteignez pas un volume sérieux.
Basez-vous sur Voxtral Mini 4B Realtime Arabic si votre audio est en arabe et spécifiquement dialectal, si vous avez besoin du modèle au sein de votre propre réseau pour des raisons de conformité, ou si vous avez l’intention de l’affiner — car une seule de ces situations le permet. Acceptez d’abord trois choses : pas de diarisation, pas d’horodatage, et aucune évaluation indépendante publiée par qui que ce soit. Deux jours après l’apparition des poids, ce dernier point n’est pas un signal d’alarme ; c’est simplement où en sont les preuves.
Ce qui ferait le plus vite évoluer cette comparaison, c’est une évaluation spécifique à l’arabe sur de véritables enregistrements audio dialectaux, menée en dehors des deux fournisseurs, avec la même normalisation appliquée aux deux systèmes. Tant que celle-ci n’existe pas, la décision repose sur la liste de dialectes affichée par un fournisseur face à celle, non déclarée, d’un autre fournisseur, et le seul test fiable reste vos enregistrements.

Aucun des deux points de terminaison n’est l’un de ceux que nous servons — il s’agit d’une comparaison de deux systèmes hors de notre catalogue — mais les modèles qui consomment la transcription sont routables : plus de 200 modèles sur une seule clé API au prix catalogue du fournisseur avec 0 % de marge, de sorte qu’un changement de tarif sur le résumeur ou le classifieur est appliqué le jour même de son annonce.
Le basculement automatique est ce qui empêche une configuration vocale à deux fournisseurs de transporter deux points de défaillance uniques dans la couche linguistique qui en dépend.
