
MAI-Transcribe-2-Streaming vs MAI-Transcribe-2 : Payez 5,4× pour la synchronisation au niveau des mots
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 221 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
MAI-Transcribe-2-Streaming et MAI-Transcribe-2 appartiennent à la même famille de modèles, répartie sur deux niveaux de tarification, et la séparation est suffisamment nette pour être prise en compte dans la planification. MAI-Transcribe-2 est sorti le 3 septembre 2026 en tant que modèle par lots : un taux d'erreur sur les mots de 2,0 % dans le tableau non-streaming d'Artificial Analysis, environ 411× le temps réel, et 0,10 $ par heure d'audio — soit environ 1,67 $ pour 1 000 minutes. MAI-Transcribe-2-Streaming est sorti le 1er octobre 2026 comme variante temps réel : un taux d'erreur sur les mots en streaming annoncé de 2,5 %, avec 0,13 seconde pour obtenir la transcription finale, ce que Microsoft présente comme une première en matière d'exactitude à la fois sur les transcriptions finales et partielles, mesuré selon la méthodologie streaming d'Artificial Analysis, et non encore représenté par une ligne dans le tableau du suivi. 0,54 $ par heure d'audio — soit environ 9,00 $ pour 1 000 minutes. Les mêmes 60 langues, la même distribution en API uniquement, aucun poids publié. Le streaming coûte 5,4× le tarif par lots et, selon les propres chiffres de Microsoft, 0,5 point d'exactitude. Qu'il s'agisse d'une bonne affaire ou d'une taxe dépend entièrement d'une question : quelque chose dans votre pipeline a-t-il besoin de la transcription avant la fin de la phrase ?
Comme les deux modèles proviennent d'un même fournisseur et d'une même documentation, la comparaison est inhabituellement limpide — aucune supposition sur la parité des fonctionnalités, aucun décalage de version de benchmark, aucun « leurs chiffres contre nos chiffres ». Il s'agit d'un seul fournisseur qui facture deux vitesses d'une même capacité, et le travail intéressant consiste à déterminer quelles charges de travail l'offre économique couvre réellement.
La famille, sur deux rangées
• MAI-Transcribe-2 — traitement par lots, audio préenregistré, publié le 3 septembre 2026. 2,0 % AA-WER, deuxième au classement non-streaming d’Artificial Analysis. Environ 411× le temps réel, également deuxième. 0,10 $ par heure d’audio, environ 1,67 $ par 1 000 minutes, en offre à durée limitée jusqu’à la fin de l’année, sans prix standard publié. Inclut la diarisation des locuteurs et renvoie des horodatages au niveau des mots. 60 langues avec identification automatique de la langue.
• MAI-Transcribe-2-Streaming — transcription continue en temps réel, de type WebSocket, disponible depuis le 1er octobre 2026. Microsoft rapporte un WER de 2,5 % sur la transcription finale à 0,13 seconde après la fin de la parole, et les mêmes 2,5 % sur le premier résultat partiel à 0,12 seconde, ce que la société décrit comme une première en matière d’exactitude sur les deux — une affirmation de fournisseur mesurée selon la méthodologie de streaming d’Artificial Analysis, même si, au moment de la rédaction, le tableau de bord propre du tracker (37 modèles) n’a pas encore positionné le modèle, et que son leader actuel est Grok Voice Transcribe 2.0 à 2,73 % et 0,49 seconde. 0,54 $ par heure d’audio, environ 9,00 $ par 1 000 minutes, tarif d’introduction jusqu’à la fin de l’année. 60 langues avec détection automatique et continue de la langue. Aucune affirmation publiée concernant la diarisation, aucune affirmation publiée concernant l’horodatage des mots.
La seule asymétrie qui ne porte ni sur la vitesse ni sur le prix est la capacité : la diarisation et les horodatages des mots du modèle par lots sont des fonctionnalités documentées, et celles du modèle en flux ne le sont pas. Cela compte plus que l’écart de précision de 0,5 point, et c’est la raison pour laquelle beaucoup d’équipes finiront par exécuter les deux.

Ce que 5,4× achète vraiment
À 1,67 $ les 1 000 minutes, la transcription par lots à ce niveau de précision est presque gratuite à la marge. À 9,00 $ les 1 000 minutes, le streaming est un véritable poste de coût — à peu près le coût de la transcription du même audio cinq fois de suite, plus un demi-point de précision. La question n’est donc pas de savoir si le temps réel vaut plus cher ; c’est de savoir quelles minutes précises en ont besoin.
Les charges de travail où c’est clairement le cas : les sous-titres en direct qu’une personne lit pendant que l’orateur parle, où 0,13 seconde contre la fin du fichier, c’est tout le produit ; l’assistance en temps réel aux agents et l’évaluation de conformité, où une intervention qui arrive après la fin de l’appel est sans valeur ; et les applications vocales interactives, où un tour ne peut s’achever tant que la transcription n’est pas disponible. Dans les trois cas, le modèle par lots n’est pas une option moins chère, c’est une non-option — il n’existe aucun prix auquel la transcription a posteriori devient du temps réel.
Les charges de travail où ce n'est clairement pas le cas : l'enregistrement de réunions et d'appels traité a posteriori, les archives multimédias, l'assurance qualité par lots en centre de contact, l'examen de conformité des appels terminés, le sous-titrage de podcasts et de vidéos. Ce sont exactement les pipelines pour lesquels le facteur 411× temps réel et le tarif de 1,67 $ du modèle par lots ont été conçus pour l'emporter, et payer 5,4× pour gagner quelques centaines de millisecondes sur une transcription que personne ne lira avant demain est un gaspillage pur et simple. Ajoutez les fonctionnalités de diarisation et d'horodatage des mots — le modèle par lots les documente, le modèle en continu non — et l'argument en faveur du traitement a posteriori se renforce, au lieu de faiblir.
Le juste milieu intéressant est celui où les deux sont véritablement complémentaires : recourir au streaming pour la surface en direct et au traitement par lots pour l'archivage. Un appel au support transcrit en temps réel pour alimenter un panneau d'assistance aux agents, puis retranscrit par lots pendant la nuit afin de produire la transcription d'archive avec diarisation et horodatages, coûte un léger supplément par rapport au traitement par lots seul et offre les deux comportements. Ce modèle n'est devenu possible qu'en septembre, et c'est la version d'octobre qui vient le parachever.
Là où la structure à deux divisions apparaît
Deux choses, dans cette famille, méritent d'être relevées, car elles sont structurelles plutôt qu'accidentelles.
D'abord, la hiérarchie de précision est inversée par rapport au schéma habituel. Les modèles de streaming paient normalement un lourd tribut de précision pour une sortie en temps réel ; ici, ce tribut est de 0,5 point, passant de 2,0 % au tableau batch à 2,5 % revendiqués sur celui en streaming. Microsoft a obtenu un modèle temps réel à moins d'un demi-point de son fleuron batch selon ses propres chiffres, ce qui constitue, si cela se confirme, la véritable prouesse d'ingénierie de la sortie d'octobre — et non le classement en tête de tableau, qu'une bonne nouvelle exécution pourrait faire bouger et que le tracker n'a pas encore confirmé.
Deuxièmement, la tarification est elle aussi inversée par rapport au schéma habituel. Les fournisseurs accordent généralement une remise sur le palier à volume plus élevé ; Microsoft a fixé le prix du streaming à 5,4 fois celui du batch et a laissé les deux à des tarifs introductifs qui expirent en même temps. Cela ressemble moins à une surprime délibérée pour le streaming qu’à deux lancements distincts, chacun assorti d’une remise de lancement, sans qu’aucun tarif standard ne soit publié pour l’un ou l’autre. Les équipes qui préparent un budget 2027 devraient considérer les deux chiffres comme provisoires — les 1,67 $ et 9,00 $ sont tous deux indiqués comme étant à durée limitée, et aucun prix successeur n’a été annoncé pour l’un ou l’autre.

Ce qui n'est pas encore prouvé
Les questions laissées en suspens en septembre à propos du modèle batch restent ouvertes : aucun taux d’erreur de diarisation publié, aucune ventilation par langue à l’appui de l’affirmation relative aux 60 langues, et un prix promotionnel sans successeur nommé. Le modèle streaming en ajoute une autre, propre au travail en temps réel — le WER streaming est mesuré sur de l’audio propre, et la qualité des transcriptions partielles dans un flux bruité en champ lointain est le mode de défaillance qui compte le plus en déploiement et qui est le moins couvert par les supports de lancement. Il hérite aussi de l’étroitesse du classement streaming : les trois premiers du classement de 37 modèles du tracker sont séparés par une fraction de point, donc « premier » est un état qu’une nouvelle exécution peut changer — et le premier de Microsoft est une affirmation plutôt qu’une ligne.
La question au niveau de la famille est toutefois celle à surveiller. Microsoft vend désormais la même capacité à deux prix séparés d’un facteur cinq, le niveau le plus cher étant dépourvu de deux fonctionnalités que documente le niveau le moins cher. Si la diarisation et les horodatages par mot arrivent sur le SKU de streaming, l’écart se réduit à un pur arbitrage latence-prix, une décision bien plus simple. Si elles n’arrivent pas, la structure à deux divisions est permanente et les architectures devraient être conçues autour d’elle.
Où cela laisse une pile de transcription

La conséquence pratique est que la transcription a cessé d'être un simple poste en septembre et est devenue une décision de routage en octobre. Un pipeline qui avait l'habitude de se standardiser sur une seule API veut désormais du streaming pour la surface en direct, du batch pour l'archivage, et une règle pour déterminer quel audio emprunte quel chemin — et cette règle est elle-même un problème de routage, ce qui représente une étrange quantité de complexité à faire atterrir dans le cycle de publication d'un seul fournisseur.
C'est sur ce qui se trouve au-dessus de la transcription que l'impact est le plus fort. Quel que soit le palier qui produit le texte, ce texte est ensuite résumé, classifié, expurgé et routé, et ces étapes s'exécutent sur des modèles de langage dotés de leurs propres profils de latence et de coût — une transcription en direct réclame un modèle rapide et bon marché, une transcription archivée peut se permettre un modèle plus puissant. OrcaRouter couvre exactement cette couche : une API unique pour plus de 200 modèles, les prix catalogue des fournisseurs répercutés sans marge, un basculement automatique, et un DSL de routage qui choisit un modèle par charge de travail plutôt que par pipeline. Ni MAI-Transcribe-2-Streaming ni MAI-Transcribe-2 ne figurent sur cette liste — tous deux sont servis via la propre pile vocale de Microsoft — mais une couche de transcription à deux divisions constitue l'argument le plus fort à ce jour pour maintenir la portabilité de tout ce qui se trouve en aval.
Le résumé honnête : le streaming n'est pas un meilleur MAI-Transcribe-2, c'est un second produit à un second prix. Achetez-le pour les minutes qui ont vraiment besoin d'être en temps réel, laissez le reste sur l'offre économique, et prévoyez que les deux tarifs seront réévalués à la fin de la période d'introduction.
