
MAI-Transcribe-2 est en ligne : la tentative de Microsoft à 0,10 $ de l'heure pour dominer la reconnaissance vocale
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MAI-Transcribe-2 est le modèle sur lequel Microsoft AI mise pour faire de la transcription vocale un produit banalisé plutôt qu'une fonctionnalité premium, et les chiffres accompagnant son lancement sont conçus pour plaider en ce sens. Lancé en aperçu public le 3 septembre 2026 sur Microsoft Foundry, le MAI Playground et les interfaces API de Microsoft, MAI-Transcribe-2 est le troisième modèle de reconnaissance vocale de Microsoft en cinq mois — après MAI-Transcribe-1 en avril à 0,36 $ par heure audio et MAI-Transcribe-1.5 en juin — et le premier à surpasser tous les rivaux managés qu'il cite sur les deux indicateurs qui déterminent réellement le choix des équipes. Sur le classement d'Artificial Analysis consacré au taux d'erreur sur les mots en non-streaming, il se situe à un AA-WER de 2,0 % — en deuxième position — et à environ 411× le temps réel — également deuxième —, ce qui, combiné, le place sur la frontière de Pareto entre précision et vitesse : sur ce classement, aucun modèle n'est à la fois plus précis et plus rapide. Son prix de lancement est d'environ 72 % inférieur à celui de son prédécesseur.
« Le modèle de reconnaissance vocale le plus rapide, le plus précis et le moins cher au monde » : c'est le titre que Microsoft donne lui-même à cette sortie, et il mérite d'être lu en tenant compte des astérisques du document source. Voici l'histoire de ce lancement telle qu'elle s'est réellement déroulée, avec les affirmations du fournisseur clairement identifiées et les points qui restent encore à prouver mis à part.
Ce que Microsoft a réellement livré
MAI-Transcribe-2 est un modèle de transcription par lots, conçu pour l'audio préenregistré et spécifiquement orienté vers les contenus de longue durée — réunions, appels, archives médiatiques, enregistrements de centres de contact. Microsoft le positionne précisément pour les charges de travail où le débit et le coût par minute sont prédominants. Il transcrit en 60 langues avec identification automatique de la langue, inclut une diarisation des locuteurs qui attribue les paroles à la bonne personne, renvoie des horodatages au niveau du mot et prend en charge le biaisage de mots-clés pour les noms, abréviations et terminologies de domaine. Deux styles de transcription configurables couvrent la répartition habituelle : « verbatim », qui conserve les remplissages et faux départs pour les transcriptions conformes, et « clean », qui supprime les disfluences pour les sous-titres et les notes. Microsoft souligne également l'alternance codique dans les discours multilingues comme l'hinglish et l'espanglish, ainsi que la robustesse face à l'audio bruité du monde réel.

L'histoire de la disponibilité compte autant que la liste des fonctionnalités. Microsoft ne la cache pas derrière sa pile vocale d'entreprise : le modèle est démontrable dès aujourd'hui depuis le MAI Playground et servi via Microsoft Foundry en aperçu public, la documentation Foundry étant hébergée sous le service Azure AI Speech. C'est un choix de distribution délibéré — placer le modèle de pointe là où un développeur peut l'atteindre avec une clé, pas là où un cycle de vente d'entreprise doit d'abord l'approuver. Microsoft n'a pas publié les poids, et rien dans les documents de lancement ne suggère qu'il le fera.
Lire le titre littéralement
« Le plus rapide, le plus précis et le moins cher au monde » comporte trois affirmations de force inégale, et le post de lancement lui-même en atténue discrètement deux. Voici la version honnête de chacune :
• Précision — Sur le classement d’Artificial Analysis, MAI-Transcribe-2 se classe deuxième avec un AA-WER de 2,0 %, et non premier ; le corps du texte de Microsoft indique lui-même la deuxième place. La formulation « la plus précise » ne tient que si on la lit comme « parmi les API batch gérées qui se situent à ce niveau », et encore s’agit-il d’une affirmation portant sur un modèle vieux de quatre jours, pas d’une couronne solidement établie. Microsoft indique par ailleurs qu’il est premier sur le benchmark multilingue FLEURS, avec un WER moyen de 5,2 % sur ses 60 langues — ce chiffre provient du billet de lancement de Microsoft et n’a pas encore été recalculé indépendamment, langue par langue.
• Vitesse — Selon Artificial Analysis, MAI-Transcribe-2 tourne à environ 411× le temps réel, deuxième sur ce tableau. Curieusement, l’annonce de Microsoft elle-même n’affiche jamais le chiffre absolu ; elle mise plutôt sur des multiplicateurs relatifs plus accueillants — « traitement jusqu’à 10× plus rapide que les principaux concurrents, en particulier pour l’audio de longue durée », et plus précisément 10× plus rapide que GPT-Transcribe d’OpenAI, 7× plus rapide que Scribe v2 d’ElevenLabs, et 5× plus rapide que Gemini 3.5 Transcribe. Ces ratios correspondent à la façon dont Microsoft présente les mêmes données d’Artificial Analysis, et les taux de référence comptent : « 5× plus rapide que Gemini 3.5 Transcribe » semble un écart modeste jusqu’à ce qu’on le convertisse en minutes de calcul par heure d’audio.
• Le moins cher — Vrai uniquement à l'intérieur des deux limites que Microsoft énonce clairement. Le tarif de 0,10 $ est une « offre à durée limitée jusqu'à la fin de l'année », et aucun prix standard après promotion n'est divulgué dans les documents de lancement. Et c'est le moins cher parmi les API managées de haute précision ; un modèle open source auto-hébergé comme Whisper Large v3 Turbo transcrit toujours pour un coût qui revient essentiellement à celui de l'électricité. L'argument de la banalisation est réel — il est simplement plus restreint que ce que le titre laisse entendre.

Ce que 1,67 $ par 1 000 minutes permet d'acheter.
Facturé à 0,10 $ par heure audio, MAI-Transcribe-2 revient à environ 1,67 $ pour 1 000 minutes d’audio. La comparaison qui fait vraiment ressortir ce chiffre, c’est face aux autres API de transcription gérées qui rivalisent sur la précision. GPT-Transcribe est listé à 4,50 $ pour 1 000 minutes ; le niveau pré-enregistré de Gemini 3.5 Transcribe revient à environ 5 $ pour 1 000 minutes sur la tarification par tokens de Google ; ElevenLabs' Scribe v2 est listé encore plus cher. Sur 1 000 heures d’audio par mois — une charge de travail sérieuse mais pas énorme pour un centre de contact ou un média — l’écart entre MAI-Transcribe-2 au tarif de lancement et GPT-Transcribe au tarif catalogue est de l’ordre de 170 $ par mois, chaque mois, avant même toute différence de précision. C’est cet écart de prix qui fait que la transcription cesse d’être une ligne budgétaire que les équipes optimisent pour devenir une ligne budgétaire qu’elles ignorent.
Deux réserves méritent d'être formulées d'un même souffle. Premièrement, un prix promotionnel est une expérience tarifaire jusqu'à ce qu'il cesse d'en être une : les équipes qui bâtissent un produit sur le tarif de 0,10 $ doivent savoir que le tarif standard n'est pas divulgué, et le chiffre honnête pour planifier un budget 2027 se situe quelque part entre l'offre de lancement et ce que Microsoft annoncera à l'expiration de l'offre. Deuxièmement, « le moins cher de ce niveau de précision » ne dit rien du coût total de possession — le modèle n'est accessible que par API, la comparaison qui compte pour les équipes à fort volume est donc celle de 1,67 $ pour 1 000 minutes face au coût complet de l'exploitation de leur propre pile open-weights, et pas seulement face aux autres API.
Réduit à un tableau de bord, la position de lancement se présente ainsi — chaque chiffre ci-dessous porte l’étiquette de source qui lui est attachée dans le corps du texte ci-dessus.

Ce qui n'est pas encore prouvé
Pour toute la spécificité des affirmations de lancement, trois choses restent réellement ouvertes. La première concerne le streaming : MAI-Transcribe-2 est un modèle par lots, le discours de Microsoft sur la vitesse porte sur le débit de fichiers, et aucune référence commerciale en temps réel n'a été annoncée ni démontrée — le « 411× » n'est pas un chiffre de latence de transcription en direct. La deuxième concerne la qualité de la diarisation : l'attribution des locuteurs est incluse, mais Microsoft ne publie aucun taux d'erreur de diarisation, et c'est la fonctionnalité la plus susceptible de paraître moins bonne dans les tests indépendants que ne l'est le WER. La troisième concerne la répartition multilingue : une moyenne unique sur 60 langues dans FLEURS peut masquer une forte variance selon les langues, et Microsoft n'a pas publié le tableau détaillé par langue. Chacun de ces points est une raison pour laquelle l'histoire n'est pas terminée au quatrième jour.
Là où il quitte votre pile de transcription
Rien de tout cela n'exige de choisir MAI-Transcribe-2 dès aujourd'hui, et c'est précisément pour cela que son tarif mérite l'attention des équipes qui ne sont pas à la recherche d'un nouveau fournisseur. La transcription vocale n'est que rarement le bout de la chaîne — les transcriptions sont résumées, transformées en actions, recherchées et routées — et c'est dans cette couche aval qu'un dispositif multi-modèles trouve toute sa justification. Une plateforme comme OrcaRouter existe pour cette moitié de la pile : une API unique sur plus de 200 modèles, les prix catalogue des fournisseurs répercutés avec une marge de 0 %, un basculement automatique et un DSL de routage qui permet d'envoyer une transcription vers un modèle différent selon la charge de travail — les comptes rendus de réunion vers un résumeur, les revues de conformité vers un autre — sans seconde intégration. MAI-Transcribe-2 lui-même ne figure pas encore sur cette liste ; il vit sur l'API de Microsoft et les plateformes tierces listées par Microsoft. Mais le prix de commodité qu'il vient de fixer est le meilleur argument à ce jour pour bâtir, au-dessus de la transcription, une couche indépendante du modèle.
Le prix de lancement est révélateur. Microsoft ne cherche pas à gagner sur la conversion parole-texte par ses seules fonctionnalités — il cherche à rendre une grande précision si abordable que la catégorie cesse d'être une ligne budgétaire. MAI-Transcribe-2 mérite l'attention qu'il reçoit ; il suffit de lire « le plus rapide, le plus précis et le moins cher au monde » avec les trois astérisques qui l'accompagnent : deuxième sur AA-WER, prix promotionnels jusqu'à la fin de l'année, et une histoire de streaming qui n'a pas encore été racontée.
