Carte héros d'article affichant « Voxtral Mini 4B Realtime Arabic vs Gemini 3.5 Transcribe Live », avec le sous-titre « 15 dialectes arabes en poids ouverts face à 85+ locales sur une API fermée », un badge signalant le modèle Mistral comme une publication de dépôt non annoncée datée du 8 octobre 2026, et trois puces statistiques : 16 variantes arabes contre 85+ locales ; 8,82 % de taux d'erreur de caractères à 480 ms contre 4,0 % de taux d'erreur de mots en streaming à 0,40 s ; poids ouverts Apache 2.0 contre API uniquement. Le logo OrcaRouter se trouve dans une bande blanche en bas à droite.
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs Gemini 3.5 Transcribe Live : dialectes vs étendue

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux modèles de transcription vocale en flux, deux paris totalement différents sur ce qui constitue la partie difficile de la transcription. Voxtral Mini 4B Realtime Arabic est un fine-tune de 4,4 milliards de paramètres que Mistral AI a poussé vers un dépôt public le 8 octobre 2026, sans billet de lancement, sans article de blog ni une ligne dans l'index d'actualités de l'entreprise, entraîné spécifiquement sur l'arabe standard moderne et quinze dialectes nommés, publié sous Apache 2.0 avec des poids BF16 téléchargeables. Gem​ini 3.5 Transcribe Live est le point de terminaison en flux de Gem​ini 3.5 Transcribe de G​oogle, annoncé en août 2026 avec tout l'appareil d'une sortie de plateforme, couvrant plus de 85 locales, et fermé — une API de préversion sans poids et avec un plafond de session de dix minutes. Un modèle est allé en profondeur sur une seule famille de langues et l'a dit dans sa propre section sur les limites ; l'autre est allé en largeur et a laissé implicites les garanties au niveau de l'accent. Celui que vous voulez dépend d'un axe qu'aucun marketing des deux fournisseurs ne met en premier : ce à quoi ressemble réellement votre audio.

Ce n'est pas une comparaison symétrique, et il vaut la peine de le dire d'emblée plutôt que de l'enfouir. Le modèle Mistral a 48 heures au moment de la rédaction, il n'a fait l'objet d'aucune annonce de fournisseur, d'aucune évaluation indépendante et d'aucun prix publié. Le modèle Google est en aperçu public depuis fin août et est mesuré par un outil de suivi tiers. Considérez le côté Mistral comme un ensemble d'affirmations issues d'une fiche de modèle et le côté Google comme un ensemble de mesures plus un ensemble d'affirmations, et la comparaison reste honnête.

Ce qu’est chaque modèle, avant les chiffres

• Voxtral Mini 4B Realtime Arabic — un modèle ASR en streaming affiné à partir de Voxtral-Mini-4B-Realtime-2602, d'environ 4,4 milliards de paramètres en BF16, prenant de l'audio à 16 kHz en entrée via un encodeur audio causal et un décodeur de langage. Il émet du texte au fur et à mesure que l'audio arrive, avec un délai de transcription configurable, et il est sous licence Apache 2.0, avec les poids sur Hugging Face. Mistral l'a co-développé avec le Ministère de la Transition Numérique et de la Réforme Administrative du Maroc dans le cadre d'un partenariat signé en janvier 2026, et décrit le modèle comme un actif d'IA souveraine.

• Gemini 3.5 Transcribe Live — la moitié streaming d'une sortie de deux modèles. Le point de terminaison de la Live API transporte l'audio continu du microphone via un WebSocket, renvoie des transcriptions partielles pendant que la personne parle encore, puis se fixe sur une transcription finale peu après la fin de chaque énoncé. Son pendant par lots, gemini-3.5-transcribe, traite des fichiers préenregistrés allant jusqu'à une heure. Les deux sont en aperçu public, tous deux sont disponibles uniquement via API, et aucun n'a publié ses poids.

La première différence structurelle n’est pas une question de précision. C’est que l’un est un fichier que vous pouvez télécharger ce soir, et l’autre est un service auquel il faut être admis pour pouvoir l’utiliser.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Couverture linguistique : 16 contre plus de 85, et l’écart n’est pas l’essentiel

Le décompte des langues fait paraître le modèle Mistral limité et le modèle Google gigantesque. Ces chiffres mesurent des réalités différentes, et les comparer côte à côte sans cette mise en garde est l’erreur la plus fréquente que cette comparaison suscite.

• Voxtral Mini 4B Realtime Arabic — 16 variétés d'arabe, nommées individuellement sur la fiche du modèle par famille dialectale : l'arabe standard moderne, plus l'arabe marocain, libyen, tunisien, algérien et hassaniya du Maghreb ; l'arabe du Golfe, le najdi, l'omani et le sanaani du Golfe ; l'égyptien et le soudanais de la vallée du Nil ; le mésopotamien et le levantin sud et le levantin nord ; et l'arabe tchadien. La présentation de la fiche est que le modèle cible la transcription de l'arabe, et que l'alternance codique — les locuteurs alternant les langues en pleine conversation — est la capacité qu'il a été conçu pour maîtriser, plutôt qu'un effet secondaire.

• Gemini 3.5 Transcribe Live — détection automatique de la langue sur plus de 85 locales, avec alternance de code intra-phrase et inter-phrases. La documentation de Google répertorie l’arabe dans cet ensemble ; le tableau des locales désigne l’arabe (Égypte) comme entrée pour l’arabe, et la couverture plus étendue des locales arabes n’est pas détaillée dans la documentation propre du modèle.

Lisez cela honnêtement et la nature du compromis apparaît. Le 85 et plus de Google est une revendication d’étendue : si votre audio est dans une langue autre que l’arabe, le point de terminaison Google le prend en charge et le modèle Mistral le refusera — la fiche dit sans détour que pour les autres langues, vous devez utiliser le Voxtral Mini 4B Realtime d’origine, pas ce point de contrôle. Le 16 de Mistral est une revendication de profondeur. Il ne prétend pas transcrire l’arabe ; il prétend transcrire le darija marocain, l’arabe du Golfe, l’arabe égyptien et l’arabe tchadien comme des cibles distinctes, ce qui est un problème nettement plus difficile que de transcrire l’arabe standard moderne en espérant que le dialecte en découle. Un benchmark pondéré en faveur de l’anglais et privilégiant l’étendue ne vous montrera jamais cette différence, parce que les ensembles de dialectes n’y figurent pas.

Pour un centre d'appels marocain ou une ligne de support client du Golfe, un modèle qui gère 16 dialectes et rien d'autre peut battre un modèle qui gère 85 locales à une précision par dialecte non précisée. Pour une entreprise européenne qui transcrit des réunions en cinq langues, l'équation s'inverse instantanément. Aucun des deux fournisseurs n'a tort ; ils ont choisi des clients différents.

Screenshot of Google's Gemini API model documentation for Gemini 3.5 Transcribe, captured 10 October 2026, showing the model code gemini-3.5-transcribe, audio input up to one hour per request dropping to 30 minutes when speaker diarization or word-level timestamps are enabled, and the supported capability list including speaker diarization, word-level timestamps, Smart transcription and custom vocabulary.

Les nombres que vous pouvez comparer, et ceux que vous ne pouvez pas.

C'est ici que l'asymétrie fait mal. Les deux modèles rapportent des unités différentes, sur des corpus différents, avec des preuves différentes à l'appui, et aucun tiers ne les a fait s'affronter.

• Voxtral Mini 4B Realtime Arabic — taux d'erreur de caractères moyen de 8,82 % sur sept benchmarks arabes, avec un délai de transcription configuré de 480 millisecondes. D'après la fiche de Mistral elle-même, et non reproduit indépendamment.

• Le modèle qu'il cherche à rattraper — Voxtral Transcribe Arabic, à 7,91 % de CER sur les mêmes sept benchmarks et selon la même mesure —, si bien que le modèle temps réel se situe 0,91 point de pourcentage derrière un modèle arabe hors ligne du même fournisseur. Cet écart provient de la propre comparaison de Mistral, ce qui le rend exceptionnellement instructif : le fournisseur vous dit ce que le streaming coûte en précision sur cette famille de langues.

• Gemini 3.5 Transcribe Live — taux d'erreur de mots en streaming de 4,0 %, mesuré par Artificial Analysis et cité par Google, avec une transcription finale qui arrive 0,40 seconde après la fin de la parole. Également mesuré : 2,6 % sur le classement non-streaming du même outil de suivi, et 5,50 % en streaming sur FLEURS selon les propres rapports de Google.

Ne mettez pas 8,82 % de CER à côté de 4,0 % de WER pour en conclure quoi que ce soit. Le taux d'erreur sur les caractères et le taux d'erreur sur les mots ont des dénominateurs différents — l'orthographe arabe rend l'écart entre eux plus grand qu'il ne l'est pour les langues à écriture latine — et les corpus ne sont pas les mêmes, la normalisation n'est pas la même, et un chiffre s'accompagne d'un script reproductible tandis que l'autre provient d'un mélange fixe propre à un tracker, pondéré en faveur de conversations d'agents en anglais.

La comparaison la plus utile est celle qui figure dans la propre fiche de Mistral : 8,82 % en streaming contre 7,91 % hors ligne, sur des benchmarks identiques avec une normalisation identique. C’est une mesure propre de ce que la faible latence apporte et coûte spécifiquement en arabe, et elle vaut plus que n’importe quel pourcentage inter-fournisseurs. Ce que personne n’a publié, c’est une évaluation en arabe à conditions comparables des modèles Google et Mistral sur le même audio. Tant que personne ne l’aura fait, « lequel est le plus précis en arabe » reste une question ouverte, et la seule réponse défendable est : essayez les deux sur vos enregistrements.

Un détail dans la fiche de Mistral mérite d’être mentionné, car il va à l’encontre de l’intérêt même du fournisseur. Elle signale que les filtres de sécurité de Gemini bloquent la transcription de certains échantillons audio FLEURS. C’est une observation réelle et vérifiable concernant le pipeline d’un concurrent, et c’est aussi exactement le genre de chose qui n’apparaît jamais dans un classement — un modèle qui refuse de transcrire un échantillon est comptabilisé comme un échec ou comme absent, et aucune de ces interprétations n’est équitable. Si votre audio contient des éléments qu’un filtre de contenu pourrait intercepter, il s’agit d’un risque de déploiement qu’aucun chiffre de WER ne fera apparaître.

Latence : un cadran contre un nombre fixe

Les modèles de streaming sont généralement comparés sur une seule valeur de latence. Ces deux-ci n’en ont aucune en commun.

• Voxtral Mini 4B Realtime Arabic — délai de transcription configurable. Le chiffre de 8,82 % de CER est cité à 480 millisecondes, et le délai est réglable, ce qui signifie que le chiffre de précision est un point sur une courbe choisie par l’opérateur plutôt qu’une propriété du modèle. Son modèle de base annonce une plage allant de 240 millisecondes à 2,4 secondes.

• Gemini 3.5 Transcribe Live — 0,40 seconde entre la fin de la parole et une transcription finale, mesurée par Artificial Analysis, avec des partiels arrivant en continu pendant la parole. Google revendique séparément une amélioration de 70 % du délai d’obtention de la transcription finale par rapport à Chirp 3, un chiffre fourni par le fournisseur et non reproduit.

Les deux se situent dans le même ordre de grandeur — environ une demi-seconde —, mais leur signification technique diffère. Le modèle Mistral vous confie le compromis latence-précision sous forme de paramètre : vous pouvez donc fonctionner à 240 ms lorsque des sous-titres inférieurs à la seconde comptent plus que les derniers points de précision, et allonger le délai lorsque ce n’est pas le cas. Le point de terminaison Google présente un point de fonctionnement fixe, assorti du comportement de filtrage de contenu propre à Google. Pour un agent vocal, un réglage vaut mieux qu’un chiffre fixe légèrement meilleur, car le bon paramètre dépend de votre audio et de vos utilisateurs, et aucun des deux fournisseurs ne peut le choisir pour vous.

Le vrai clivage : les poids ouverts contre un endpoint de prévisualisation

Dans cette comparaison, la différence de licence et de distribution est plus importante que n'importe quel écart de benchmark, et elle décide de la plupart des déploiements réels avant même que l'on parle de précision.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0, poids BF16 sur Hugging Face, servable avec vLLM via un WebSocket à /v1/realtime, et pris en charge nativement dans Transformers à partir de la version 5.2.0. La fiche inclut un exemple Python et un module de normalisation pour que vous puissiez reproduire vous-même le calcul du CER arabe. Rien dans le pipeline n'exige les serveurs de Mistral, et le modèle est suffisamment petit pour que la question opérationnelle soit de savoir quel GPU, et non si vous pouvez vous en offrir un.

• Gemini 3.5 Transcribe Live — API uniquement, préversion publique, aucun engagement de prix publié au-delà des tarifs catalogue, et un plafond de session de dix minutes, ce qui signifie que toute durée supérieure doit être découpée, reconnectée et recousue par votre propre code. Trois contraintes signalées en marge du lancement sont particulièrement importantes pour les déploiements en arabe : le point de terminaison de streaming ne renvoie ni diarisation des locuteurs ni horodatages au niveau des mots, deux éléments qui existent sur le point de terminaison par lots mais pas sur celui-ci. Si votre transcription en arabe doit savoir qui a dit quoi, ou doit être alignée temporellement sur l'audio, le point de terminaison Live ne peut pas le produire, quelle que soit la langue.

Ces deux contraintes sont l'argument le plus fort en faveur du petit modèle ouvert dans un déploiement arabe réel, et elles n'ont rien à voir avec la précision. Un pipeline de centre d'appels veut une attribution des locuteurs, un pipeline de conformité veut des horodatages, et un modèle arabe hors ligne avec un script de normalisation que vous contrôlez vous donne les deux sans avoir à se battre avec un contrat de point de terminaison. La fiche modèle de Mistral mentionne aussi cela comme une limitation plutôt qu'une fonctionnalité — il cible la transcription, c'est un fine-tune d'un modèle temps réel général, et elle reconnaît honnêtement qu'un modèle plus large existe en amont si vous en avez besoin.

Combien coûte chacun, et ce qui est inconnu

• Gemini 3.5 Transcribe Live — environ 0,009 $ par minute d’audio en tarif combiné, calculé à partir des tarifs catalogue de 3,50 $ par million de jetons d’entrée et de 21 $ par million de jetons de sortie, l’audio étant comptabilisé à 25 jetons par seconde et la transcription à environ 175 jetons par minute. Le point de terminaison par lots coûte environ 0,005 $ par minute. Ces deux chiffres sont des estimations fondées sur l’hypothèse de tokenisation de Google, ils changent donc si la comptabilisation change. Un palier gratuit est disponible aujourd’hui.

• Voxtral Mini 4B Realtime Arabic — aucun prix publié, car il n’existe aucun service publié. Le coût est celui que coûte votre matériel. Un modèle BF16 de 4,4 milliards de paramètres tient sur un seul accélérateur moderne, donc le coût marginal par heure d’audio correspond à l’électricité et au taux d’utilisation, et le coût fixe est la machine. C’est moins cher que n’importe quelle API facturée à la minute à fort volume, et plus cher que n’importe quelle API facturée à la minute à volume nul, ce qui est la forme ordinaire du compromis propre aux modèles à poids ouverts.

L'inconnue qui compte le plus du côté de Mistral n'est pas le prix. C'est de savoir si ce dépôt marque le début d'une gamme de produits ou s'il s'agit d'un livrable ponctuel dans le cadre du partenariat avec le Maroc. Un modèle qui sort discrètement, sans annonce, sans tarification et sans service, est un modèle sans engagement de support derrière lui. Apache 2.0 signifie que la licence ne peut pas être révoquée pour les poids que vous détenez déjà, mais elle ne dit rien sur le fait que le checkpoint sera maintenu ou non, et la référence au modèle de base dans la fiche du modèle elle-même suggère que le modèle temps réel généraliste reste la gamme prise en charge.

Pour la couche située au-dessus de la transcription, une couche de routage justifie son existence d’une manière qui n’a rien à voir avec la transcription. Aucun de ces modèles n’est un service de transcription vocale que nous hébergeons — OrcaRouter ne route ni l’un ni l’autre de ces points de terminaison — mais le résumeur, le classificateur d’intention ou l’agent qui consomme le flux est un modèle que vous pouvez router : une seule clé API pour plus de 200 modèles au prix catalogue des fournisseurs, avec 0 % de marge, de sorte qu’une baisse de prix d’un fournisseur se répercute chez nous le jour même, plus un basculement automatique en cas de dégradation d’un fournisseur. Si vous assemblez déjà deux fournisseurs de reconnaissance vocale pour couvrir les dialectes, placer les modèles linguistiques en aval derrière une seule clé plutôt que deux contrats constitue la moitié la moins coûteuse de l’intégration.

Sur lequel construire

Si votre audio est en arabe — un dialecte, plusieurs, ou en alternance codique entre l’arabe et autre chose — le modèle Mistral est le candidat le plus sérieux, et la raison est structurelle plutôt que numérique. Il nomme les dialectes pour lesquels il a été conçu, il est assez petit pour tourner sur votre propre matériel, il renvoie du texte brut que vous pouvez post-traiter avec votre propre normalisation, et il n’est pas enfermé derrière une limite de session de dix minutes ni un filtre de contenu que vous ne pouvez pas inspecter. Le revers de la médaille, c’est qu’il ne traite qu’une seule famille de langues et refuse les autres, et que personne n’a encore publié d’évaluation indépendante à son sujet.

Si votre audio couvre plusieurs langues, ou si vous avez besoin dès aujourd'hui d'un service disposant d'un canal de support et d'une grille tarifaire publiée, Gemini 3.5 Transcribe Live est appelable dès maintenant, évalué sur un tracker tiers, et couvre les langues que le checkpoint Mistral rejettera. Les contreparties sont le plafond de session, l'absence de diarisation et d'horodatages sur le point de terminaison de streaming, et le fait que la précision propre à l'arabe est une affirmation que vous devrez tester vous-même — la liste des locales mentionne l'Égypte, et les performances dialectales ne sont pas détaillées.

Ce qu’il faut surveiller n’est pas un benchmark. C’est de savoir si Mistral annonce bel et bien ce modèle, et si oui, à quel prix et avec quelle feuille de route linguistique. Un dépôt discret avec une licence Apache 2.0 est un artefact utile et un engagement faible. Si une feuille de route des dialectes arabes suit — levantin, du Golfe, égyptien en tant que checkpoints distincts —, la voie du petit modèle devient une réponse véritablement complète pour la région, et l’argument de l’étendue devient beaucoup plus difficile à défendre.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Gemini 3.5 Transcribe Live across six shared rows: coverage 16 named Arabic varieties against 85+ locales that list Arabic as Egypt only; reported accuracy 8.82% Arabic character error rate at 480ms against 4.0% streaming word error rate at 0.40s; evidence vendor card unreproduced against Artificial Analysis cited by Google; delay configurable with 480ms quoted against 0.40s fixed to final transcript; weights Apache 2.0 and downloadable against API only in public preview; and diarization and timestamps not documented against absent on the Live endpoint. A footer reads that Mistral figures are vendor-reported while Gemini figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

Aucun de ces deux n'est un modèle vocal que nous hébergeons, mais la couche au-dessus de la transcription est routable - plus de 200 modèles derrière une seule clé API au prix catalogue du fournisseur avec 0 % de marge, donc une baisse de prix d'un fournisseur sur le modèle de raisonnement en aval de votre transcription est effective le jour même.

Basculement automatique signifie qu'un pipeline vocal assemblé comporte un domaine de défaillance de moins, car le module de résumé ou le classificateur d'intention qui consomme la transcription peut être redirigé au lieu de tomber en panne avec un fournisseur.