Carte de titre principale générée pour une comparaison entre Voxtral Mini 4B Realtime Arabic et MAI-Transcribe-2-Streaming, sous-titrée « deux arrivées d'octobre, deux problèmes de preuves », avec le badge « octobre 2026, les deux déclarés par le fournisseur », comportant trois pastilles de statistiques indiquant 8,82 % de taux d'erreur sur les caractères arabes à 480 ms contre 2,5 % de taux d'erreur sur les mots à 0,13 s, 16 dialectes contre 60 langues, et des poids Apache 2.0 contre Azure Preview à 0,54 $ par heure d'audio, ainsi que le logo OrcaRouter intégré dans une bande blanche en bas à droite.
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs MAI-Transcribe-2-Streaming : deux arrivées d'octobre, deux problèmes de preuves

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Sept jours séparent ces deux modèles vocaux en temps réel, et ils sont arrivés de manières opposées. MAI-Transcribe-2-Streaming est le premier modèle de transcription streaming de Microsoft AI, annoncé le 1er octobre 2026 avec un article de lancement, une fiche d'aperçu Azure, un prix de 0,54 $ par heure d'audio en offre d'introduction jusqu'à la fin de l'année, et l'affirmation d'être premier au classement streaming d'Artificial Analysis pour la précision des transcriptions finales et partielles, avec un taux d'erreur de mots de 2,5 % et le texte final prêt 0,13 seconde après la fin de la parole. Voxtral Mini 4B Realtime Arabic est le modèle streaming de dialectes arabes de Mistral AI, publié sur Hugging Face le 8 octobre 2026 sans la moindre annonce — pas d'article de blog, pas de prix, pas de service, juste des poids Apache 2.0 et une fiche de modèle rapportant un taux d'erreur de caractères moyen de 8,82 % sur sept benchmarks arabes avec un délai de 480 millisecondes. Le modèle Microsoft est un produit fini avec un argument de vente invérifiable. Le modèle Mistral est un artefact vérifiable sans produit autour. Les deux méritent d'être compris précisément parce que tous deux laissent la question centrale — comment se comporte-t-il en arabe — à laquelle seul le fournisseur répond.

La comparaison mérite quand même d’être faite, car les deux modèles présentent la même décision d’ingénierie sous des angles opposés. Microsoft vend l’étendue et un service géré : 60 langues avec détection automatique et continue de la langue, exécuté dans Azure AI Speech, facturé à l’heure, en préversion. Mistral offre la profondeur : seize variétés d’arabe nommées, suffisamment petites pour tourner sur un seul accélérateur, avec un script de normalisation pour que vous puissiez auditer vous-même la notation. Si vous mettez en place un pipeline de transcription en arabe ce mois-ci, vous choisissez entre ces deux positions, et le choix dépend de preuves dont vous ne disposez pas encore dans un cas comme dans l’autre.

Ce que chaque fournisseur a réellement dit, et ce que disent les conseils d'administration

L’écart de preuves est la caractéristique la plus importante de cette confrontation, donc il passe en premier.

• MAI-Transcribe-2-Streaming — taux d’erreur sur les mots de 2,5 % pour la transcription finale, 0,13 seconde après la fin de la parole, et les mêmes 2,5 % sur les premiers résultats partiels, à 0,12 seconde, les deux étant présentés comme la première place pour l’exactitude selon la méthodologie AA-WER Streaming d’Artificial Analysis. C’est la présentation de Microsoft elle-même. Au moment de la rédaction de cet article, le tableau de streaming du tracker n’a pas tracé de ligne pour le modèle, donc l’affirmation repose sur la méthodologie du tracker sans qu’un chiffre publié par le tracker ne l’étaye.

• Voxtral Mini 4B Realtime Arabic — 8,82 % de taux d'erreur de caractères moyen sur sept benchmarks arabes à un délai configuré de 480 millisecondes. La fiche de Mistral elle-même, avec le code d'évaluation fourni. Aucun tiers ne l'a reproduit, et le modèle a deux jours.

Ainsi, les deux chiffres phares de cet article sont, respectivement, une affirmation de fournisseur obtenue avec la règle de quelqu’un d’autre et une affirmation de fournisseur assortie de sa propre règle. Aucun des deux n’est une mesure indépendante. Ce qui diffère, c’est que le chiffre de Mistral arrive avec le script de normalisation dont vous avez besoin pour le recalculer, tandis que celui de Microsoft arrive avec un tableau qui ne l’a pas encore inscrit sur le graphique. Si vous prenez une décision d’achat, cette distinction compte davantage que l’écart entre 2,5 et 8,82, qui n’a de toute façon aucun sens — le taux d’erreur sur les mots et le taux d’erreur sur les caractères ne se convertissent pas l’un en l’autre, et l’orthographe arabe creuse considérablement leur écart.

La seule comparaison, dans la fiche de Mistral, qui soit vraiment convaincante est celle avec son propre homologue hors ligne : Voxtral Transcribe Arabic, à 7,91 % de CER sur les mêmes sept benchmarks avec la même normalisation, ce qui signifie que le streaming coûte 0,91 point de pourcentage à ce modèle. Microsoft a publié un chiffre équivalent pour sa propre famille lorsqu’elle a livré le modèle batch MAI-Transcribe-2 le 3 septembre 2026, à 2,0 % de taux d’erreur sur les mots — la variante streaming perd un demi-point face au modèle batch tout en assurant une livraison en temps réel. Mettez ces deux écarts internes aux fournisseurs côte à côte et vous obtenez la seule affirmation de cet article où l’on compare ce qui est comparable : sur leurs propres benchmarks, le SKU streaming de chaque laboratoire traîne derrière son homologue batch, d’environ un point dans un cas et d’un demi-point dans l’autre, et les deux mesurent des langues différentes.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Couverture linguistique : 60 contre 16, et le même écart sans nom des deux côtés

• MAI-Transcribe-2-Streaming — 60 langues avec détection automatique et continue de la langue, de sorte qu’une session qui change de langue en cours de flux n’a pas besoin que la langue soit déclarée au préalable. Les supports de lancement de Microsoft donnent le nombre, mais pas la liste ; c’est la documentation Azure relative à la prise en charge des langues pour la famille MAI-Transcribe qui détaille la couverture, et elle documente l’arabe parmi les langues prises en charge pour cette famille.

• Voxtral Mini 4B Realtime Arabic — seize variétés d’arabe, nommées individuellement : arabe standard moderne, marocain, libyen, tunisien, algérien et hassaniya, arabe du Golfe, najdi, omanais et sanaani, arabe égyptien et soudanais, arabe mésopotamien et arabe levantin du Sud et du Nord, et arabe tchadien. En dehors de cet ensemble, le modèle est documenté comme hors périmètre, avec un renvoi vers le Voxtral Mini 4B Realtime général.

Aucun des deux chiffres ne vous dit ce dont vous avez besoin. Le 60 de Microsoft est un décompte de couverture qui inclut l’arabe sans décrire les performances en arabe ; l’article de lancement indique le total de langues une fois et passe à autre chose. Le 16 de Mistral est une énumération de cibles d’entraînement avec un seul taux d’erreur agrégé sur sept jeux de benchmarks, ce qui signifie que la répartition au niveau des dialectes — ce qui détermine réellement si votre audio d’appel marocain se transcrit — n’est pas publiée non plus. Deux modèles, deux fournisseurs, et dans les deux cas, la réponse honnête à « quel est son niveau en arabe du Golfe en particulier » est : non précisé.

Ce que l’énumération vous donne, elle, c’est un a priori. Un modèle dont les cibles nommées sont l’arabe tchadien et le hassaniya a été ajusté sur une distribution nord-africaine ; Mistral l’a codéveloppé avec le Ministère de la Transition Numérique et de la Réforme Administrative du Maroc et a construit deux des sept benchmarks avec ce ministère — ISMA et Darija in the Wild — précisément pour mesurer les cas difficiles. Un modèle général de 60 langues progresse d’abord sur l’arabe standard moderne, car c’est là que se concentre le volume de signal d’entraînement. Si votre audio est en darija ou en arabe du Golfe, ce sont des problèmes différents, et un seul de ces deux fournisseurs a publié un chiffre pour l’un ou l’autre.

Latence et la forme du délai

• MAI-Transcribe-2-Streaming — 0,13 seconde entre la fin de la parole et la transcription finale, et les premiers résultats partiels à 0,12 seconde, ce qui est suffisamment rapide pour que le résultat partiel et le résultat final aient effectivement la même latence. Affirmation de Microsoft, mesurée selon la méthodologie du tracker.

• Voxtral Mini 4B Realtime Arabic — 480 millisecondes de délai configuré au point de précision publié, le délai étant ajustable. Cela représente environ trois fois et demie le chiffre de Microsoft, et il s’agit du paramètre que l’opérateur choisit plutôt que d’une propriété fixe.

Trois dixièmes de seconde, c’est une vraie différence pour un agent vocal qui doit répondre en cours d’énoncé, et c’est presque invisible pour un humain qui lit des sous-titres. C’est aussi la différence entre un cadran et un nombre. Le paramètre de délai de Mistral signifie que vous pouvez régler plus serré et accepter plus d’erreurs, ou plus lâche et regagner de la précision — le modèle de base à partir duquel ce checkpoint a été affiné annonce une plage allant de 240 millisecondes à 2,4 secondes — tandis que le point de fonctionnement de Microsoft est ce qu’Azure déploie. Cela rend le chiffre de Microsoft plus facile à interpréter et celui de Mistral plus facile à régler, et cela signifie que toute comparaison des deux chiffres de précision est en réalité une comparaison entre deux points choisis sur une courbe et un point fixe sur une autre.

La surface fonctionnelle diffère tout aussi nettement, et il vaut la peine de la vérifier par rapport aux exigences de votre pipeline avant que la discussion sur la précision ne devienne intéressante.

• MAI-Transcribe-2-Streaming — fourni via Azure AI Speech avec l’ensemble des fonctionnalités documentées de la famille : diarisation, horodatages au niveau des mots, biais par mots clés et expressions, styles de sortie verbatim ou épuré, et identification automatique de la langue. La documentation propre au SKU de streaming pour la diarisation et les horodatages est plus limitée que celle du modèle par lots ; vérifiez donc ces éléments pour chaque point de terminaison plutôt que de supposer une parité.

Screenshot of the Microsoft Learn documentation page 'Use a MAI-Transcribe model' in Azure AI Speech, captured 10 October 2026, showing the public preview notice that the feature is provided without a service-level agreement and is not recommended for production workloads, alongside the statement that MAI-Transcribe is a next-generation speech-to-text model built in-house by the Microsoft AI team covering 60 languages.

• Voxtral Mini 4B Realtime Arabic — la fiche documente la transcription avec un encodeur audio causal, le service vLLM via un WebSocket à /v1/realtime, la prise en charge native de Transformers à partir de la version 5.2.0, et un module de normalisation. Elle ne documente pas la diarisation ni les horodatages au niveau des mots pour ce checkpoint.

Modèle de livraison : un service de prévisualisation face à des poids téléchargeables

• MAI-Transcribe-2-Streaming — Préversion Azure, ce qui signifie l'absence de SLA et une recommandation du fournisseur de ne pas en dépendre en production. Proposé à 0,54 $ par heure d'audio en tarif d'introduction en vigueur jusqu'à la fin de 2026, le tarif standard n'étant pas publié ; la version batch de MAI-Transcribe-2 a été lancée à 0,10 $ par heure d'audio, selon la même formule à durée limitée. Le streaming coûte 5,4 fois le tarif batch.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0, environ 4,4 milliards de paramètres en BF16, téléchargeable, affinable et exécutable sur un seul accélérateur. Aucun prix, aucun SLA et aucun engagement de support, car il n’y a aucun service derrière.

Ces deux phrases contiennent la décision. Un service en préversion avec un tarif d'introduction et un prix standard non divulgué est un engagement qui expire ; le surcoût de streaming de 5,4× et la fenêtre jusqu'en 2026 sont tous deux modifiables par Microsoft, et le ratio batch/streaming est le chiffre à surveiller quand le tarif standard entrera en vigueur. Des poids Apache 2.0 sans annonce, c'est l'inverse : un artefact que personne ne peut retirer, lié à une relation fournisseur que personne n'a décrite. On ne peut pas savoir si le checkpoint sera maintenu, mais le fichier que vous avez aujourd'hui continue de fonctionner quoi qu'il arrive.

La contrainte propre au secteur est celle qui, en pratique, tranche généralement ces questions. Un déploiement de centre d’appels en arabe au sein d’une institution réglementée peut ne pas pouvoir envoyer d’audio du tout vers un point de terminaison cloud de préversion ; une équipe déjà standardisée sur Azure AI Speech peut ne pas vouloir d’une deuxième pile sur site pour une seule famille de langues. Ces deux contraintes sont légitimes, et aucune n’a de lien avec les chiffres de 2,5 % et 8,82 % qui font la une des deux lancements.

Au-dessus de la couche de transcription, le même point s’applique aux deux. OrcaRouter n’achemine aucun de ces deux modèles vocaux — il s’agit d’une comparaison de deux systèmes que nous ne servons pas —, mais le résumeur, le classifieur ou l’agent qui consomme la transcription est routable : plus de 200 modèles sur une seule clé API, au prix catalogue du fournisseur et avec 0 % de marge, de sorte qu’une modification tarifaire d’un fournisseur est répercutée de notre côté le jour même, avec un basculement automatique en cas de dégradation d’un fournisseur. Là où cela aide spécifiquement ici, c’est pour la phase d’essai : diriger les deux candidats de transcription vers un même pipeline en aval, derrière une seule clé, voilà comment mener la comparaison directe sans mettre en place deux intégrations.

Le test qui trancherait la question

Aucun des deux fournisseurs n'a publié de performances spécifiques à l'arabe, et aucun n'a été évalué indépendamment sur de l'audio dialectal. La comparaison se réduit donc à trois faits et une recommandation.

Les faits : le modèle de streaming de Microsoft est plus rapide, à 0,13 seconde, et revendique une meilleure précision agrégée sur un tableau qui ne l’a pas encore tracé ; le modèle de Mistral publie une liste de dialectes, un taux d’erreur en arabe et le code de normalisation permettant de le recalculer, à 480 millisecondes ; et les deux chiffres de précision ne peuvent pas être comparés, car l’un est un taux d’erreur sur les mots et l’autre un taux d’erreur sur les caractères sur un corpus différent.

La recommandation : quiconque prend cette décision devrait tester les deux sur ses propres enregistrements audio, car c'est la seule mesure que l'un ou l'autre des fournisseurs ait laissée ouverte. Constituez le jeu d'évaluation à partir d'enregistrements réels — le mélange de dialectes que vous recevez réellement, le codec que vous utilisez réellement, le vocabulaire métier dont vous avez réellement besoin — et évaluez les deux avec la normalisation de Mistral par rapport à une référence fiable. Un test de deux heures sur vos propres enregistrements vous en apprendra plus que les deux articles de lancement réunis, et c'est le seul moyen de savoir si l'avantage de 0,13 seconde justifie un aperçu et un surcoût de streaming de 5,4×, ou si un modèle téléchargeable de 4,4B à 480 millisecondes est déjà suffisant pour la tâche.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and MAI-Transcribe-2-Streaming across six shared rows: price none published and self-host only against $0.54 per audio-hour introductory through the end of 2026; accuracy 8.82% Arabic character error rate at 480ms against a claimed 2.5% final word error rate at 0.13s; board status none because the model is days old against claimed first but not yet plotted; languages 16 named Arabic varieties against 60 with the list unpublished; delivery Apache 2.0 self-hosted weights against Azure preview with no SLA; and diarization and timestamps not documented against family documentation that requires per-SKU confirmation. A footer reads that both accuracy figures are vendor-reported and that no independent Arabic evaluation of either model exists. The OrcaRouter logo sits in a white strip at the bottom right.

OrcaRouter ne sert aucun de ces modèles vocaux, et cet article ne suggère pas le contraire — ce qu'il couvre, c'est la couche linguistique qui lit la transcription : plus de 200 modèles derrière une seule clé au prix catalogue des fournisseurs, avec 0 % de marge, de sorte qu'un changement de prix chez un fournisseur sur le modèle en aval vous parvient le jour même de son annonce.

Basculement automatique permet aux deux candidats de transcription d'alimenter un seul pipeline en aval au lieu de deux intégrations, ce qui est aussi la façon la moins coûteuse de réaliser la comparaison en face à face.