Carte hero d'article portant l'inscription « MAI-Transcribe-2-Streaming est en ligne », avec le badge « NOUVEAU MODÈLE · MICROSOFT AI » et le sous-titre « Microsoft décroche la couronne de la transcription en streaming à 2,5 % de WER », avec une bande de statistiques affichant un taux d'erreur de mots en streaming de 2,5 % à 0,13 s après la fin de la parole, mentionné sur la carte comme une revendication de Microsoft et une première à la fois pour les transcriptions finales et partielles ; 60 langues avec détection automatique et continue de la langue ; et 9,00 $ par 1 000 minutes, décrit comme 0,54 $ par heure d'audio en tarif d'introduction jusqu'en 2026 ; sur un dégradé du blanc au bleu avec le logo OrcaRouter en bas à droite.
Guides & Insights

MAI-Transcribe-2-Streaming est disponible : Microsoft s'empare de la couronne de la transcription en streaming avec un WER de 2,5 %

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

MAI-Transcribe-2-Streaming est la réponse de Microsoft AI à la seule question que sa sortie de septembre avait laissée ouverte, et il y a répondu en 28 jours. Sorti le 1er octobre 2026, MAI-Transcribe-2-Streaming est un modèle de transcription parole-texte en temps réel qui transcrit au fur et à mesure que les mots arrivent plutôt qu’une fois le fichier terminé. Microsoft affirme qu’il se classe premier pour l’exactitude, à la fois sur les transcriptions finales et partielles, dans l’évaluation AA-WER Streaming d’Artificial Analysis, avec un taux d’erreur de mots de 2,5 %, la transcription finale étant prête 0,13 seconde après la fin de la parole. Il s’agit d’une affirmation de fournisseur sur la méthodologie d’un organisme de suivi plutôt que d’une ligne publiée par cet organisme — au moment de la rédaction, les 37 modèles du tableau ne l’incluent pas, et le modèle qu’il détrônerait est Gro​k Voice Transcribe 2.0 (Streaming), à 2,73 % et 0,49 seconde. Le modèle sur lequel il est construit, MAI-Transcribe-2, est sorti le 3 septembre en tant que modèle par lots avec un WER de 2,0 %, sans SKU temps réel ; la variante streaming comble cet écart sans renoncer à une grande partie de l’exactitude qui a rendu la version par lots remarquable. Ce à quoi il renonce, en revanche, c’est le prix : le streaming coûte 5,4 fois le tarif par lots au lancement.

Le cadrage que Microsoft veut, c’est un grand chelem sur le tableau du streaming. Le cadrage que les chiffres étayent est plus étroit et plus intéressant — un modèle qui prétend être en tête à la fois sur la précision et sur la latence, sur un front où l’entrée la plus précise du classement met quatre fois plus de temps à se stabiliser que ses entrées les plus rapides, et où aucune de ces entrées rapides n’est sous les 3 % d’erreur de mot, le tout à un prix aligné sur celui de l’acteur en place plutôt qu’inférieur. Voici le lancement tel qu’il s’est produit, avec les affirmations des fournisseurs signalées.

Ce que Microsoft a livré le 1er octobre

MAI-Transcribe-2-Streaming est servi via la pile technologique vocale de Microsoft dans le service Azure AI Speech, avec une documentation sous le nom du modèle lui-même et le même modèle de distribution en API uniquement, sans poids, que la version par lots. Il transcrit 60 langues avec détection automatique et continue de la langue, de sorte qu'une session qui change de langue en cours de flux n'a pas besoin d'être déclarée à l'avance. Microsoft le positionne sur la frontière de Pareto précision-latence du graphique de streaming d'Artificial Analysis — la lecture du fournisseur des données du tracker, et la lecture que le graphique du tracker lui-même étaye.

Le modèle de streaming ne constituait pas l’intégralité de la sortie. Microsoft a livré deux modèles vocaux en plus : MAI-Voice-2.1, couvrant 23 langues réparties sur 26 paramètres régionaux, et MAI-Voice-2.1-Flash, qui traite jusqu’à 45 secondes d’audio avec une latence d’environ 150 ms. Lue comme un ensemble, la sortie du 1er octobre est une pile conversationnelle temps réel complète — entendre, comprendre, parler — plutôt que le lancement d’un seul modèle.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models as accurate, fast and low cost, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

Lecture du classement de streaming

AA-WER Streaming mesure deux choses par modèle : à quel point la transcription finale est erronée, et le temps qu'il faut, après l'arrêt du locuteur, pour qu'elle soit terminée. Microsoft affirme que MAI-Transcribe-2-Streaming est en tête sur les deux : 2,5 % de taux d'erreur de mots sur la transcription finale à 0,13 seconde après la fin de la parole, et les mêmes 2,5 % sur la première transcription partielle à 0,12 seconde, ce que Microsoft présente comme une première en matière d'exactitude sur les deux. À prendre comme un chiffre de fournisseur — au moment de la rédaction, le tableau de streaming du tracker lui-même n'a pas encore tracé le modèle, donc il n'y a pas de ligne MAI-Transcribe-2-Streaming indépendante à consulter. Ce que le tableau montre, en revanche, c'est le peloton qu'il prétend battre, et ce peloton est plus proche que ne le suggère une présentation en forme de « couronne » :

• Grok Voice Transcribe 2.0 — WER de la transcription finale de 2,73 % à 0,49 seconde après la fin de la parole, selon Artificial Analysis, et leader actuel du classement. Cela représente 0,23 point de retard sur les 2,5 % revendiqués par Microsoft, et environ quatre fois plus lent à se stabiliser — la différence entre un sous-titre qui suit le rythme et un sous-titre qui prend du retard.

• Muse Voice Transcribe — 3,06 % en 0,16 seconde, selon Artificial Analysis. Le concurrent le plus proche en latence : environ 30 millisecondes de retard, et 0,5 point de moins en précision que ce que revendique Microsoft.

• ElevenLabs Scribe v2 Realtime — 3,59 % à 0,14 seconde, selon Artificial Analysis. Pratiquement à égalité en vitesse, mais plus d’un point de retard en précision.

• Gemini 3.5 Transcribe Live — un WER en streaming de 4,00 % à 0,40 seconde, le chiffre publié par Artificial Analysis et cité par Google pour son propre modèle Live API. C’est un écart de 1,5 point, et c’est la comparaison que cette version vise.

La colonne des premiers partiels est l'endroit où l'affirmation ressemble le moins au reste du tableau de suivi. Sur le même tableau de suivi, les premiers partiels de Grok Voice Transcribe 2.0 se situent à 3,36 % et ceux de Gemini 3.5 Transcribe Live à 5,77 % — les partiels sont censés être moins bons que la transcription finale, souvent d'un point ou plus, parce que le modèle s'engage avant la fin de la phrase. Un premier partiel qui correspond au chiffre final est la partie véritablement inhabituelle du lancement de Microsoft, et c'est la partie que les données du tableau de suivi ne peuvent pas encore confirmer. Citez-le comme une affirmation tant qu'aucune ligne n'existe.

La réserve honnête, c’est que 0,13 seconde et 0,16 seconde représentent la même expérience produit pour un humain qui lit des sous-titres, et que 2,5 % contre les 2,73 % actuellement en tête du classement, cela représente environ 2 erreurs pour 1 000 mots. Une avance de cette ampleur est réelle mais faible, et savoir s’il s’agit d’une avance que quiconque peut ressentir dépend de la charge de travail. Là où cela fait vraiment mal, c’est dans la queue : un flux de centre de contact qui tourne huit heures par jour à 2,73 % contre 2,5 % représente des dizaines de milliers de mots erronés supplémentaires par an, et les erreurs de mots dans une transcription ne sont pas réparties uniformément — elles se concentrent précisément sur les noms propres et les chiffres qui rendent une transcription utile.

A generated comparison card titled 'The streaming field, by the numbers' with a left column for MAI-Transcribe-2-Streaming (final-transcript word error rate 2.5% flagged as Microsoft's claim, time to final transcript 0.13s after speech end, first-partial word error rate 2.5% at 0.12s flagged as claimed, $9.00 per 1,000 minutes introductory, 60 languages with automatic detection, and 'not yet plotted' for the tracker's board) and a right column headed 'The field it claims to beat' listing Grok Voice Transcribe 2.0 at 2.73% and 0.49s, Muse Voice Transcribe at 3.06% and 0.16s, ElevenLabs Scribe v2 Realtime at 3.59% and 0.14s, Qwen3 ASR Flash Realtime at 3.73% and 0.48s, Gemini 3.5 Transcribe Live at 4.00% and 0.40s, and a board size of 37 models, with a footer noting that Microsoft's figures are the vendor's own claim measured on Artificial Analysis's streaming methodology while the right-hand column is what Artificial Analysis currently publishes, all times being after detected end of speech, and the OrcaRouter logo bottom right.

Ce que 9,00 $ par 1 000 minutes permet d'acheter

Le streaming coûte plus cher que le traitement par lots, et Microsoft l’a tarifé au sommet du palier temps réel plutôt qu’en dessous. MAI-Transcribe-2-Streaming est affiché à 0,54 $ par heure d’audio, ce qui revient à 9,00 $ pour 1 000 minutes d’audio en streaming, présenté comme un tarif d’introduction valable jusqu’à la fin de l’année. À titre de comparaison, le MAI-Transcribe-2 par lots est à 0,10 $ par heure d’audio — 1,67 $ pour 1 000 minutes —, donc la transcription en temps réel coûte environ 5,4 × le tarif basé sur fichier pour la même famille sous-jacente et affiche un taux d’erreur de mot supérieur de 0,5 point. Ce n’est pas une majoration que Microsoft dissimule ; c’est le prix honnête d’une connexion persistante et d’une transcription partielle qui doit être correcte avant la fin de la phrase.

Face au reste de la catégorie des modèles de streaming, le tableau est contrasté. MAI-Transcribe-2-Streaming égale Gemini 3.5 Transcribe Live à environ 9 $ pour 1 000 minutes — plus précis, pour le même prix. Il se situe au-dessus d’ElevenLabs Scribe v2 Realtime et de Deepgram Flux, à environ 6,50 $ pour 1 000 minutes, au-dessus de Cartesia Ink-2 à environ 4 $, et à peu près trois fois le prix de Muse Voice Transcribe à environ 3 $. Le lancement mise donc sur la précision et la latence à prix équivalent, et non sur une guerre des prix ; les équipes qui utilisent déjà un modèle de streaming moins cher échangeront des dollars contre des points de WER.

Cet arbitrage mérite d’être nommé précisément, car c’est le même que le lancement par lots a inversé. En septembre, Microsoft a rendu la précision bon marché. En octobre, il a aligné le coût de la précision en temps réel sur celui de tous les autres. Si votre pipeline n’a besoin des transcriptions qu’à terme, rien de ce qui concerne le 1er octobre ne change votre facture. S’il en a besoin pendant que l’appel est encore en cours, le calcul vient de basculer vers la qualité.

A single-column scoreboard card titled 'MAI-Transcribe-2-Streaming — the launch scoreboard' listing 2.5% final-transcript WER at 0.13s, 2.5% first-partial WER at 0.12s, an accuracy rank claimed at #1 for final and partial transcripts, tracker status 'not yet plotted on the 37-model board', $9.00 per 1,000 minutes ($0.54 per audio-hour) introductory through 2026, 60 languages with automatic continuous detection, no published diarization or word-level timestamp claim for the streaming SKU, and the batch sibling MAI-Transcribe-2 at 2.0% AA-WER, roughly 411x real time and $1.67 per 1,000 minutes, with the OrcaRouter logo bottom right.

Construire sur une transcription est l'autre moitié de cette décision, et c'est là qu'une couche multi-modèles justifie son existence. Une transcription en temps réel est rarement le bout de la chaîne — elle est résumée, notée, recherchée, routée et escaladée, et ces étapes exigent des modèles différents à des coûts différents. OrcaRouter existe précisément pour cette couche : une seule API couvrant plus de 200 modèles, les tarifs publics des fournisseurs répercutés sans marge, un basculement automatique en cas de défaillance, et un DSL de routage capable d'envoyer une transcription en direct à un modèle pour un contrôle de conformité et à un autre pour le compte rendu de réunion, sans seconde intégration. MAI-Transcribe-2-Streaming ne figure pas lui-même sur cette liste — il est servi via la propre pile vocale de Microsoft — mais la transcription en flux qu'il produit est exactement le type d'entrée à fort volume et sensible à la latence qui plaide pour que la couche située au-dessus reste agnostique quant au modèle.

Ce qui n'est pas encore prouvé

Trois points restent véritablement en suspens. Premièrement, la diarisation : le modèle par lots regroupe l’attribution des locuteurs sans taux d’erreur de diarisation publié, et les éléments de streaming de Microsoft ne revendiquent pas du tout la diarisation — pour un modèle temps réel qui alimente l’assistance en direct aux agents ou le sous-titrage, savoir qui a dit quoi est souvent la fonctionnalité qui compte davantage que le WER brut. Deuxièmement, la ventilation multilingue : 60 langues avec détection automatique et continue de la langue constitue une vaste affirmation, et la latence par langue d’un modèle de streaming peut varier bien plus que celle de son homologue par lots, car la qualité des transcriptions partielles dépend de la rapidité avec laquelle le modèle se fixe sur une langue. Microsoft n’a publié aucun tableau de streaming par langue. Troisièmement, le WER en streaming est mesuré sur de l’audio de référence propre ; le mode de défaillance qui pénalise les déploiements réels est un flux bruité en champ lointain, et aucune comparaison indépendante de streaming en champ lointain n’existait le jour du lancement.

Où cela laisse votre stack

Ce qui est intéressant avec ce lancement, ce n'est pas que Microsoft dispose de la transcription en streaming la plus précise. C'est le rythme : traitement par lots en septembre, streaming en octobre, dans la même famille, sur la même surface de documentation, avec une structure tarifaire qui s'étend désormais de 1,67 $ à 9,00 $ par 1 000 minutes pour la même capacité sous-jacente. Cela offre pour la première fois aux équipes un véritable choix — payer le temps réel uniquement là où le temps réel compte, et traiter tout le reste par lots — mais cela signifie aussi que la couche de transcription est désormais quelque chose que l'on ajuste par charge de travail plutôt que de standardiser une fois pour toutes.

Lisez l’affirmation du titre au pied de la lettre et elle tient comme déclaration de fournisseur : Microsoft affirme que MAI-Transcribe-2-Streaming est premier à la fois sur la précision de la transcription finale et sur celle du premier résultat partiel, et qu’il se situe sur la frontière de Pareto. Les astérisques, c’est que le tableau du tracker n’a pas encore positionné le modèle, l’avance qu’il revendique sur le leader actuel est assez faible pour disparaître lors d’une nouvelle exécution, l’avantage de prix est nul, et l’histoire de la diarisation n’a pas été racontée. Voilà les choses à surveiller, pas la couronne.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement