
MAI-Transcribe-2 contre Muse Voice Transcribe : la même semaine, deux paris opposés sur l'audio
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0455Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0247Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0247Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0157Intelligence82Code
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2646Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligence75Code
- obsidianQwen3.8 27B2026-08-1541Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1251Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0547Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligence69Code
La semaine du 1er septembre 2026 a vu naître deux modèles vocaux issus de deux laboratoires de pointe, et MAI-Transcribe-2 et Muse Voice Transcribe se comprennent mieux comme deux réponses opposées à la question de savoir où doit vivre l’intelligence audio. Muse Voice Transcribe, publié par Meta Superintelligence Labs le 1er septembre, est un modèle de perception audio en temps réel : il transcrit, sépare plus de vingt locuteurs et détecte quand un locuteur a fini de parler, le tout en un seul passage en continu sur des segments de 80 millisecondes d’audio en direct, et il domine le classement de la reconnaissance vocale en continu sur lequel il a été évalué. MAI-Transcribe-2, publié par Microsoft deux jours plus tard, le 3 septembre, est le pari inverse : un moteur par lots qui ne cherche pas du tout la latence en direct, et qui met plutôt tout en œuvre pour transcrire des fichiers préenregistrés avec le meilleur taux d’erreur de mots sur le classement indépendant hors continu, environ 411× plus vite que le temps réel, pour environ 1,67 $ par 1 000 minutes. Les comparer directement en tant que « modèles de transcription » masque la véritable décision, qui porte sur le moment de la vie de l’audio où vous avez besoin des mots : pendant qu’il se produit, ou après qu’il est terminé.
Deux produits pointés à des moments différents
Muse Voice Transcribe est conçu pour le moment où l'audio est encore en cours. C'est un modèle multimodal autorégressif de la famille Muse de Meta qui regroupe trois tâches en une seule passe : la reconnaissance vocale automatique, la diarisation des locuteurs pour plus de vingt locuteurs, et l'endpointing, c'est-à-dire la détection qu'un locuteur a cessé de parler afin que le système puisse répondre. Meta rapporte que sa transcription finale arrive environ 0,16 seconde après que le locuteur s'est arrêté, avec un taux d'erreur de mots de 3,1 % sur ces transcriptions finales et de 3,6 % sur les premières transcriptions partielles — des chiffres publiés par Meta le jour du lancement, citant le classement de streaming d'Artificial Analysis, et qui n'avaient pas été reproduits de manière indépendante au moment de la rédaction. Il traite un audio de plus d'une heure en un seul flux, change de langue au milieu d'une phrase, et a été entraîné sur plus de 70 langues, dont 25 ont été vérifiées de manière approfondie au lancement. Son prix est de 3,00 $ pour 1 000 minutes d'audio, soit environ 0,18 $ de l'heure, via l'API Meta Model. Meta a confirmé que les poids ne seront pas ouverts.
MAI-Transcribe-2 est conçu pour le moment où l'audio est déjà un fichier. Le modèle de Microsoft affiche un AA-WER de 2,0 % sur le classement non-streaming d'Artificial Analysis — deuxième place, et le meilleur résultat parmi les API batch managées — et tourne à environ 411× le temps réel, ce qui est une mesure de débit, pas une promesse de latence. Il transcrit en 60 langues avec identification automatique de la langue, inclut la diarisation des locuteurs, les horodatages au niveau du mot, le biais de mots-clés et les styles « verbatim » et « épuré », et gère l'alternance codique comme l'hinglish et le spanglish. Il est disponible via Microsoft Foundry en aperçu public et sur le MAI Playground à 0,10 $ par heure audio dans le cadre d'une offre de lancement à durée limitée jusqu'à la fin de l'année, sans produit de streaming annoncé. Le billet de lancement de Microsoft le positionne explicitement pour l'audio de longue durée et par lots — les charges de travail où la faible latence d'un modèle de streaming est sans valeur, mais où son coût par minute ne l'est pas.

Pourquoi les deux chiffres de précision ne se contredisent pas
L’instinct naturel est de comparer 2,0 % à 3,1 % et de déclarer un vainqueur — et ce serait une erreur à double titre. D’abord, ces chiffres mesurent des tâches différentes : les 2,0 % de MAI-Transcribe-2 correspondent à la précision en mode non-streaming sur de l’audio préenregistré, où le modèle peut examiner l’intégralité du fichier ; les 3,1 % de Muse Voice Transcribe correspondent à la précision en mode streaming sur les transcriptions finales, produites sous la contrainte de transcrire au fur et à mesure que l’audio arrive. Le streaming est un problème plus difficile, c’est pourquoi le classement streaming et le classement non-streaming sont des classements séparés avec des scores séparés. Ensuite, les étiquettes n’ont pas le même poids : le chiffre de MAI-Transcribe-2 est une mesure Artificial Analysis du modèle, tandis que celui de Muse Voice Transcribe est le rapport du jour du lancement par Meta de ce qu’Artificial Analysis a mesuré — une donnée déclarée par le fournisseur et non reproduite. La formulation honnête est que les deux modèles constituent des prétentions crédibles en tête de leurs classements respectifs, et aucun de ces chiffres ne vous apprend quoi que ce soit sur l’autre catégorie.
La diarisation est là où se joue la véritable comparaison, car c'est la seule fonctionnalité que les deux produits embarquent et celle où leurs ambitions divergent visiblement. Muse Voice Transcribe sépare plus de vingt locuteurs en tant que capacité de streaming essentielle, Meta rapportant un taux d'erreur moyen de diarisation des locuteurs de 17,5 %, contre une fourchette de 21,1 % à 28,6 % qu'elle cite pour ses concurrents — là encore, des données fournies par Meta et non vérifiées. MAI-Transcribe-2 inclut aussi la diarisation, mais Microsoft ne publie ni plafond de locuteurs ni taux d'erreur de diarisation. Pour un appel entre deux personnes, les deux produits suffisent et la différence est sans importance. Pour un groupe de discussion de douze personnes ou l'enregistrement d'une table ronde, Muse Voice Transcribe est le seul des deux dont le plafond multi-locuteurs est même annoncé, et la diarisation non mesurée de MAI-Transcribe-2 est la principale raison de la tester avant de lui confier vos fichiers audio les plus difficiles.
La comparaison de prix qui a du sens
Côté prix, les deux sont plus proches que ne le laisse entendre le prisme batch-versus-streaming, car 1,67 $ pour 1 000 minutes (MAI-Transcribe-2, tarif de lancement) et 3,00 $ pour 1 000 minutes (Muse Voice Transcribe) se situent tous deux dans le bas de l'échelle des services de transcription gérés. La comparaison n'a de sens qu'au sein d'une même catégorie. Pour la transcription batch de fichiers préenregistrés, MAI-Transcribe-2 coûte moins de la moitié du prix du modèle natif streaming, tout en offrant le meilleur WER hors streaming — mais on ne routerait des fichiers enregistrés vers Muse Voice Transcribe que si l'on voulait précisément son pipeline streaming, ce qui n'est pas la façon efficace de traiter une archive. Pour l'audio de réunions en direct, Muse Voice Transcribe est le seul produit de cet article à être réellement opérationnel, et son tarif de 3,00 $ sous-cote les autres API de transcription en temps réel contre lesquelles il a été lancé — Gemini 3.5 Transcribe Live à environ 9 $ pour 1 000 minutes, GPT Live Transcribe à 17 $ — tout en offrant une diarisation de plus de vingt locuteurs, que ces produits ne proposent pas. Le constat honnête est que Meta a fixé un prix bas pour le streaming et Microsoft un prix encore plus bas pour le batch, et que ces deux chiffres relèvent d'une tarification de période promotionnelle, qui évoluera dès que chaque fournisseur aura annoncé son tarif standard.

Lequel pour quel audio
Si votre audio est en direct — réunions transcrites en temps réel, agents vocaux, sous-titrage en direct, tout ce qui nécessite des mots pendant qu'ils sont prononcés — Muse Voice Transcribe est le choix à faire, et de loin. C'est le seul modèle en streaming ici, il sépare plus de vingt locuteurs en une seule passe, et il a été tarifé pour s'imposer sur ce créneau dès le premier jour. Ses faiblesses sont celles à garder en tête lors d'un essai : les chiffres de précision et de diarisation proviennent de Meta, et un modèle de streaming vieux d'une semaine n'a pas encore montré son comportement sur l'audio chaotique qui existe en dehors des benchmarks de lancement.
Si votre audio se compose déjà de fichiers — archives, enregistrements d’appels, bibliothèques média, ou tout autre élément traité en masse — MAI-Transcribe-2 est celui qui présente les meilleurs chiffres sur tous les axes qui comptent : un WER mesuré plus bas, un débit supérieur d’environ un ordre de grandeur, et un prix aux 1 000 minutes inférieur à celui du modèle streaming. Ses risques sont le miroir exact de ceux de Muse : quatre jours d’existence, aucune référence streaming, qualité de diarisation non mesurée, et un tarif de lancement derrière lequel se cache un prix standard non divulgué.
La page de lancement de Microsoft qui présente MAI-Transcribe-2 énumère les fonctionnalités que Microsoft regroupe dans son offre et que son rival du streaming ne propose pas en une seule fois ; c'est le document à consulter lorsque vous cherchez à déterminer quelles affirmations relèvent du périmètre réel du produit et lesquelles ne sont encore que des promesses de benchmark.

Et si la transcription ne constitue que la première moitié de votre pipeline, le choix entre ces deux solutions compte moins que celui que vous faites au-dessus. L'audio de réunions en direct transcrit par Muse Voice Transcribe nécessite encore une synthèse, l'extraction des points d'action et la rédaction des suivis avant d'être utile ; les appels archivés transcrits par MAI-Transcribe-2 doivent encore être recherchés, expurgés ou acheminés vers le bon système en aval. C'est à cette couche qu'une plateforme multi-modèles démontre sa valeur — l'API unique d'OrcaRouter sur plus de 200 modèles, avec les prix catalogue des fournisseurs répercutés sans aucune marge, permet à ce travail en aval d'appeler un modèle différent selon la charge via une seule intégration. Ainsi, quel que soit le modèle de reconnaissance vocale qui remporte votre pilote, la pile au-dessus de la transcription n'a pas à être reconstruite pour changer. Ni Muse Voice Transcribe ni MAI-Transcribe-2 ne figurent aujourd'hui sur cette liste ; les deux vivent sur les API de leurs propres fournisseurs. Le pari réellement tranché cette semaine est plus étroit et plus utile : la transcription en temps réel et par lots viennent toutes deux de devenir suffisamment abordables pour que le facteur différenciant ne soit plus les mots — c'est ce que vous en faites.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
