
Grok Voice Transcribe 2.0 vs MAI Transcribe 2 : deux voies, pas deux rivaux
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ces deux modèles sont sortis à quinze jours d'intervalle et affichent exactement le même prix au centime près, et ils ne feront presque jamais partie de la même décision d'achat. Grok Voice Transcribe 2.0, livré par SpaceXAI le 18 septembre 2026, est le modèle que vous appelez lorsque l'audio est encore en cours d'arrivée — il diffuse en streaming via WebSocket, émet des résultats intermédiaires environ toutes les 500 ms, et arrive en tête du classement AA-WER Streaming d'Artificial Analysis avec un taux d'erreur de mots de 2,7 % pour les transcriptions finales et de 3,4 % pour les premiers résultats partiels. MAI-Transcribe-2, publié par Microsoft AI le 3 septembre 2026, est le modèle que vous appelez lorsque l'audio est déjà un fichier — il fonctionne uniquement par lots, et sur le classement non-streaming d'Artificial Analysis, c'est le modèle managé le plus précis mesuré, à 2,04 % d'AA-WER, devant les 2,29 % de Grok Voice Transcribe 2.0, et environ 2 fois plus rapide en débit. Les deux sont au tarif de 0,10 $ par heure d'audio, soit environ 1,67 $ pour 1 000 minutes. Si votre besoin est le temps réel, il n'y a pas de comparaison à faire. Si votre besoin est un fichier, il y en a une.
La ligne qu’aucun des deux fournisseurs ne tracera pour vous.
La prise en charge du streaming n’est pas une simple option activable. Grok Voice Transcribe 2.0 sert le même modèle via REST pour les fichiers enregistrés et via `wss://api.x.ai/v1/stt` pour l’audio en direct, de sorte que la précision que vous mesurez sur votre archive est celle que vous obtenez lors d’un appel en direct. MAI-Transcribe-2 ne dispose d’aucun SKU de streaming : les documents de lancement de Microsoft le positionnent explicitement pour l’audio long format et par lots, et bien que la fiche du modèle mentionne le sous-titrage en temps réel parmi ses scénarios d’application, la voie pour y parvenir consiste à segmenter l’audio et à envoyer chaque segment via l’API par lots — un pipeline que vous construisez et exploitez, pas une garantie de latence que vous achetez. Le débit annoncé par Microsoft, d’environ 411× le temps réel, est un chiffre de vitesse de traitement, et non de temps de réponse, et les deux sont constamment confondus dans les articles sur cette version.
La conséquence pratique : si vous développez des agents vocaux qui gèrent les tours de parole, du sous-titrage en direct, ou quoi que ce soit où un humain ou un modèle réagit à la parole en cours, MAI-Transcribe-2 n’est pas un candidat, aussi bonne soit sa précision. Si vous transcrivez des réunions a posteriori, des enregistrements de centres de contact pendant la nuit, des archives médiatiques ou des arriérés de conformité, le streaming est un poids mort et seuls les chiffres du traitement par lots comptent.
Là où MAI-Transcribe-2 est véritablement en avance
D'abord, la précision sur les fichiers. L'écart entre 2,04 % et 2,29 % est mesuré sur le même banc d'essai indépendant — AA-WER v2 d'Artificial Analysis, composé à 50 % d'AA-AgentTalk et à 25 % chacun de VoxPopuli et d'Earnings22 — ce qui en fait l'élément le plus net de cette comparaison. C'est une différence de 0,25 point, soit environ deux erreurs et demie de moins pour mille mots. Savoir si cela compte dépend de ce que vous faites de la transcription ; pour une archive consultable, non, et pour un dossier juridique ou médical, peut-être.
Débit, deuxièmement, et par une marge supérieure à l’écart de précision : 333× le temps réel contre 162× pour Grok Voice Transcribe 2.0. Ces deux chiffres sont des mesures d’Artificial Analysis des secondes d’audio en entrée transcrites par seconde, et non des affirmations de fournisseurs. À ce rythme, une archive de mille heures se termine en environ trois heures de calcul sur le modèle Microsoft et environ six sur celui de SpaceXAI. Pour une migration ponctuelle, cela n’a pas d’importance ; pour un pipeline qui ingère en continu, le temps d’exécution réduit de moitié constitue une véritable différence de capacité.
Couverture linguistique, troisième point. Microsoft annonce 60 langues avec détection automatique, alternance codique au sein d'un même enregistrement, et un taux d'erreur de mots moyen de 5,2 % sur l'ensemble de ces langues pour FLEURS — un chiffre déclaré par le fournisseur, non reproduit de manière indépendante, mais qui décrit au moins le cas multilingue sur une liste de langues énoncée. SpaceXAI documente des dizaines de langues avec changement en cours d'enregistrement et mise en forme de la forme écrite sur 25. Si votre audio sort de l'ensemble bien couvert de l'anglais et des principales langues européennes, le chiffre FLEURS est plus informatif qu'un classement pondéré vers l'anglais et saturé de conversations d'agents.
Deux autres différences qui comptent sur le plan opérationnel. MAI-Transcribe-2 propose des styles de transcription configurables — verbatim, qui préserve les disfluences, versus épuré, qui les supprime — là où Grok Voice Transcribe 2.0 règle le même problème avec un indicateur de suppression des mots de remplissage. Et le modèle de Microsoft est en préversion publique sur Microsoft Foundry, ce qui signifie aucune SLA et une recommandation constante de ne pas l'utiliser en production avant son passage en GA ; le modèle de SpaceXAI, lui, est en disponibilité générale, avec des limites de débit publiées de 10 requêtes par seconde et 100 sessions de streaming simultanées par équipe.

Là où Grok Voice Transcribe 2.0 est véritablement en avance
• Diffusion en temps réel — un point de terminaison WebSocket avec des résultats intermédiaires toutes les ~500 ms, par opposition à un traitement par lots uniquement sans SKU temps réel annoncé
• Précision du premier transcript partiel — 3,4 % de WER à 0,49 s sur AA-WER Streaming, une catégorie à laquelle MAI-Transcribe-2 ne participe pas
• Précision par lots sur l’audio de dialogue d’agents — 2,29 % au total, mais sur le sous-ensemble AA-AgentTalk du tableau non-streaming, le classement est plus serré que ne le suggère le titre, et sur le mélange à forte composante d’agents du tableau streaming, Grok arrive en tête sans conteste
• Plomberie des agents vocaux — la détection de fin de tour Smart Turn et la suppression des mots de remplissage sont intégrées au modèle, alors que MAI-Transcribe-2 laisse la logique de tour à l'appelant
• Audio multicanal — jusqu’à 8 canaux indépendants transcrits en une seule passe, ce qui est important pour les enregistrements d’appels stéréo ou à plusieurs branches
• Confiance au niveau du mot — les horodatages comportent un score de confiance par mot, ce qui permet de signaler les segments à faible confiance plutôt que de les considérer comme tout aussi fiables.
• Conditions de disponibilité — disponibilité générale avec des limites de concurrence publiées, par opposition à une préversion publique sans SLA
• Pérennité des prix — 0,10 $ l’heure est le tarif permanent à la fois pour le traitement par lots et pour la base du palier de streaming à 0,20 $, tandis que le 0,10 $ identique de Microsoft est une offre de lancement à durée limitée, sans tarif standard annoncé pour 2027
Ce dernier point est celui que la plupart des comparaisons passent sous silence. Les deux modèles coûtent le même prix aujourd’hui, et l’un de ces prix a une date d’expiration que l’autre n’a pas. Microsoft n’a pas publié de tarif après promotion, et les informations disponibles ne concordent pas sur la question de savoir si l’offre court jusqu’à la fin de 2026 ou si elle n’a aucune date de fin indiquée. Si vous modélisez un budget de transcription sur trois ans à partir de 1,67 $ pour 1 000 minutes chez Microsoft, vous modélisez un chiffre que le fournisseur n’a pas garanti.

Le chevauchement est bien réel, et il représente la majeure partie de la liste des fonctionnalités.
Si l’on met de côté la question du streaming, les deux produits convergent fortement. Tous deux font de la diarisation des locuteurs. Tous deux renvoient des horodatages au niveau du mot. Tous deux gèrent la normalisation inverse du texte — nombres, dates, devises, coordonnées rendus sous forme écrite. Tous deux acceptent une terminologie de domaine, Grok Voice Transcribe 2.0 sous forme de jusqu’à 100 termes clés par requête et MAI-Transcribe-2 sous forme de listes de terminologie de domaine et d’abréviations. Tous deux détectent automatiquement la langue et suivent un locuteur qui change de langue en cours d’enregistrement. Tous deux gèrent l’audio téléphonique à 8 kHz, le cas sur lequel la plupart des modèles de transcription échouent discrètement et celui contre lequel SpaceXAI s’est le plus acharné à s’ajuster — son ensemble téléphonique interne est passé de 10,6 % à 7,1 % de WER entre les versions, un chiffre rapporté par l’entreprise sur de l’audio de l’entreprise.
Tous deux imposent également des limites d'entrée qui façonnent les architectures plutôt que de simples budgets. Grok Voice Transcribe 2.0 accepte des fichiers jusqu'à 500 Mo dans 12 formats audio, avec des taux d'échantillonnage allant de 8 kHz à 48 kHz. Les limites de MAI-Transcribe-2 sont définies par la voie Foundry plutôt que par le modèle, et les équipes devraient consulter la documentation de Microsoft elle-même pour connaître le plafond actuel plutôt que de présumer d'une parité avec un service STT dédié.
Ce que signifie cette convergence, c’est que la décision se réduit à trois questions, dans l’ordre : faut-il que ce soit en direct, combien de langues avez-vous réellement, et combien l’écart de précision vous coûte-t-il. La première question est binaire et élimine d’emblée une option. On peut généralement répondre à la deuxième à partir d’un échantillon de votre propre audio. La troisième est suffisamment faible pour que, dans la plupart des charges de travail basées sur des fichiers, elle ne décide de rien — l’écart de 0,25 point est réel, mais le fait que les deux modèles se situent à moins d’un demi-point du meilleur chiffre jamais mesuré l’est tout autant.

Que faire de ceci
Considérez-les comme une pile à deux voies plutôt que comme un duel. Un centre de contact qui exploite une assistance en direct aux agents et un archivage de conformité nocturne ne choisit pas entre Grok Voice Transcribe 2.0 et MAI-Transcribe-2 : il fait tourner les deux, et la seule question est de savoir si cela lui coûte deux relations fournisseurs, deux jeux d’identifiants, deux factures et deux limites de débit. Aucun des deux modèles ne figure aujourd’hui au catalogue d’OrcaRouter, donc les appels de transcription eux-mêmes passent par l’API propre à chaque fournisseur. Ce qu’une seule clé OrcaRouter couvre, en revanche, c’est tout ce qui se trouve en aval : le résumeur, le classifieur, l’agent qui raisonne sur la transcription et la tâche d’évaluation qui compare les sorties des deux fournisseurs sur le même enregistrement. C’est cette dernière qui justifie qu’on s’y intéresse — on ne peut pas trancher entre ces modèles à partir d’un classement, car le classement, ce sont huit heures de conversations d’agents en anglais, et votre audio n’en fait pas partie.
Surveillez deux choses. Premièrement, si Microsoft associe un tarif standard à MAI-Transcribe-2 lorsque l'offre de lancement prendra fin ; un tarif permanent de 1,67 $ par 1 000 minutes en ferait, sur le seul critère du coût, le choix par défaut pour le traitement par lots, tandis qu'un retour vers les 0,36 $ de l'heure de MAI-Transcribe-1 rendrait cette conversation bien plus courte. Deuxièmement, si Microsoft commercialise une référence SKU en streaming. La fiche du modèle désigne déjà le sous-titrage en temps réel comme scénario cible, et la seule chose qui sépare MAI-Transcribe-2 de la voie du streaming, c'est un point de terminaison : si cela se concrétise, ces deux modèles cesseront d'être des voies distinctes pour devenir des rivaux.
