
MAI-Transcribe-2-Streaming vs Gemini 3.5 Transcribe Live : même prix de 9 $, compromis différent
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 221 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
MAI-Transcribe-2-Streaming et Gemini 3.5 Transcribe Live coûtent le même prix et reposent sur des théories opposées de ce à quoi sert un transcripteur en streaming. Tous deux atteignent environ 9,00 $ par 1 000 minutes d’audio diffusé en streaming. Le modèle de Microsoft, publié le 1er octobre 2026, est un instrument de précision : un taux d’erreur de mot en streaming annoncé de 2,5 % à 0,13 seconde pour la transcription finale, premier pour l’exactitude sur les transcriptions finales et partielles selon Microsoft lui-même, mesuré selon la méthodologie de streaming d’Artificial Analysis mais pas encore représenté comme une ligne sur ce tableau. L’autre modèle, en aperçu public depuis le 26 août 2026 et servi via l’API Live, est un instrument de couverture : plus de 85 langues avec changement en cours de flux, une offre gratuite, et un taux d’erreur de mot en streaming de 4,00 % à 0,40 seconde, le chiffre qu’Artificial Analysis mesure pour lui. Aucun n’est le choix évident, et la raison en est qu’ils ne sont pas vraiment en concurrence pour la même charge de travail.
Voici le face-à-face tel qu’il ressort réellement des chiffres — les chiffres déclarés par les fournisseurs, étiquetés, les chiffres du tracker, attribués, et les points où un modèle l’emporte sur une dimension que l’autre ne conteste pas du tout.
La version en une ligne
• Exactitude et latence — MAI-Transcribe-2-Streaming, d’après les chiffres publiés. Microsoft revendique un WER en streaming de 2,5 % à 0,13 seconde pour obtenir la transcription finale, en tête pour l’exactitude, tant sur les transcriptions finales que partielles, et 2,5 % sur la première transcription partielle à 0,12 seconde. En face, Artificial Analysis situe Gemini 3.5 Transcribe Live à 4,00 % à 0,40 seconde. L’avantage revendiqué par Microsoft est de 1,5 point et une stabilisation environ trois fois plus rapide. La réserve, c’est que le tracker n’a pas encore intégré MAI-Transcribe-2-Streaming lui-même à ses graphiques — le leader actuel du classement est Grok Voice Transcribe 2.0 à 2,73 % et 0,49 seconde, avec Muse Voice Transcribe à 3,06 % et 0,16 seconde — donc les 2,5 % sont un chiffre avancé par le fournisseur, à comparer à un panel que le tracker mesure bel et bien. Ce n’est pas une différence marginale sur l’axe que les deux modèles publient, mais un seul de ses côtés est publié de manière indépendante.
• Étendue linguistique — Gemini 3.5 Transcribe Live. Plus de 85 langues avec détection automatique et possibilité de changer de langue en cours de flux sans redémarrer la session, ce qui est l'argument phare de Google pour la Live API. MAI-Transcribe-2-Streaming couvre 60 langues avec détection automatique et continue de la langue. Le plancher de Microsoft est plus élevé ; le plafond de Google est plus large, et l'écart de 25 langues concerne surtout des langues pour lesquelles un modèle de streaming monolingue n'est pas utilisable du tout.
• Forme de session — Gemini 3 — Transcribe Live, et ce point est à double tranchant. L’API est une session WebSocket plafonnée à 10 minutes, ce qui convient pour un tour d’agent vocal et peu pratique pour une réunion d’une heure ; Microsoft ne publie aucun plafond de session équivalent pour son modèle de streaming, ce qui compte si votre unité est un appel, et non un tour de conversation.
• Coût d’entrée — Gemini 3.5 Transcribe Live. Il existe un palier gratuit, et le tarif combiné de Google revient à environ 0,009 $ par minute avec la tarification basée sur les tokens. Les 0,54 $ par heure d’audio de Microsoft constituent un tarif d’introduction que Microsoft indique valable jusqu’à la fin de l’année, sans prix standard divulgué — la même structure que son lancement par lots de septembre.

Pourquoi l'écart de précision est plus important qu'il n'y paraît
Un écart de 1,5 point de taux d'erreur sur les mots ressemble à une différence d'arrondi, jusqu'à ce qu'on en calcule le coût. À un WER en streaming de 4,00 %, Gemini 3.5 Transcribe Live se trompe sur environ 40 mots pour 1 000 ; au taux de 2,5 % annoncé par Microsoft, MAI-Transcribe-2-Streaming en rate 25. Sur les volumes que produit un pipeline en temps réel — une organisation de support traitant 5 000 heures d'appels par mois, soit 300 000 minutes, plus de 45 millions de mots au rythme d'une conversation — cet écart représente des millions de mots erronés par an, concentrés sur les entités dont dépendent les systèmes en aval : noms de comptes, numéros de tickets, dosages, adresses.
L’écart de latence est le plus difficile à vendre. 0,13 seconde contre 0,40 seconde après la fin de la parole est perceptible dans un flux de sous-titres en direct — en dessous d’environ 0,2 seconde, cela est perçu comme simultané, et un tiers de seconde donne l’impression que la transcription court après le locuteur — mais ce n’est pas perceptible dans un panneau d’assistance aux agents qui s’actualise à l’échelle de temps humaine. Si votre consommateur est une personne qui lit en suivant, l’avance de Microsoft en matière de latence est le produit. Si votre consommateur est un modèle qui reçoit la transcription finale à la fin du tour, ce n’est qu’un nombre.
Les deux chiffres portent la même mise en garde, et il vaut la peine de la formuler une fois : il s'agit de chiffres issus d'une seule exécution, provenant d'un tableau de suivi comptant 37 modèles, et l'écart entre le premier et le troisième de ce tableau est inférieur à un point. Une nouvelle exécution peut rebattre le haut du classement en streaming d'une manière qu'un écart de deux points sur le tableau batch ne permet pas. Les 2,5 % de Microsoft ne figurent d'ailleurs pas encore du tout dans le tableau — il s'agit d'une affirmation de fournisseur, mesurée selon la méthodologie du tracker, ce qui n'est pas la même chose qu'une ligne que le tracker publie.
Les limites sont là où réside véritablement la décision.
Les limites de fonctionnalités séparent ces deux-ci plus vite que ne le font les benchmarks, et ils vont dans des directions opposées.
Gemini 3.5 Transcribe Live présente trois contraintes documentées : un plafond de session de 10 minutes sur la Live API, aucune diarisation des locuteurs et aucun horodatage au niveau des mots. La première est d'ordre architectural — le streaming via une session WebSocket a un plafond par conception — et cela signifie que la transcription live de longue durée doit être recousue d'une session à l'autre, la gestion des raccords vous revenant. Les deux autres sont absolues : si votre produit doit attribuer la parole à un locuteur, ou placer un mot à un horodatage pour la recherche ou la synchronisation des sous-titres, Gemini 3.5 Transcribe Live ne le fait à aucun prix.
Les contraintes de MAI-Transcribe-2-Streaming sont moins documentées, ce qui est en soi une information. Microsoft ne revendique ni diarisation ni horodatage au niveau des mots pour le modèle de streaming ; le MAI-Transcribe-2 en mode batch intègre la diarisation et renvoie des horodatages au niveau des mots, mais il s'agit du produit batch, et présumer que le SKU streaming en hérite est exactement le type d'inférence que les documents de lancement ont pour but d'empêcher. Ce que Microsoft revendique, ce sont 60 langues avec détection continue de la langue et un positionnement à la frontière de Pareto en termes d'exactitude par rapport à la latence — deux affirmations du fournisseur que les données du tracker corroborent.
Donc, la lecture honnête des fonctionnalités est la suivante : aucun des deux modèles de streaming ne publie de diarisation ni d’horodatages par mot. Gemini 3.5 Transcribe Live dispose d’un plafond de session publié et d’une offre gratuite ; MAI-Transcribe-2-Streaming a un nombre de langues publié et aucun plafond publié. Si vos exigences incluent la diarisation, aucun de ces deux n’est la solution, et vous avez affaire à de la transcription par lots avec une couche de streaming greffée en amont.
Ce que la parité des prix vous dit vraiment
Que deux fournisseurs aboutissent au même tarif de 9 $ pour 1 000 minutes en partant de directions opposées est le fait le plus intéressant de cette comparaison. Google y est parvenu grâce à une tarification basée sur les jetons pour une session Live API : entrée audio à 3,50 $ par million de jetons, sortie texte à 21 $ par million, et une consommation approximative de 175 jetons de texte par minute, ce qui donne environ 0,009 $ par minute. Microsoft y est parvenu en affichant un tarif forfaitaire de 0,54 $ par heure d’audio pour un modèle d’une famille dont l’équivalent en mode batch coûte 0,10 $. L’une est une session en temps réel facturée à l’usage ; l’autre est un tarif forfaitaire à la minute assorti d’une remise de lancement.
Ces structures se comportent différemment à mesure que vous montez en charge. Un tarif forfaitaire est prévisible et facile à budgéter ; une session facturée au token varie selon le volume de réponses du modèle et la durée pendant laquelle la session reste ouverte sans activité. Pour un pipeline à fort volume, le tarif forfaitaire est la facture la plus avantageuse ; pour un prototype ou une fonctionnalité à faible volume, l’offre gratuite et la facturation par token constituent la porte d’entrée la plus avantageuse.

Ce que ni l’une ni l’autre des structures ne modifie, c’est la couche située au-dessus de la transcription. Quel que soit le modèle qui la produit, une transcription en direct constitue une entrée pour la synthèse, la classification, le caviardage et le routage, et ces étapes ont leurs propres courbes de coût et de qualité — généralement exécutées sur plusieurs modèles plutôt qu’un seul. C’est la couche que couvre OrcaRouter : une API unique pour plus de 200 modèles, les prix catalogue des fournisseurs répercutés avec 0 % de marge, un basculement automatique, et un DSL de routage capable d’envoyer une transcription vers différents modèles selon la charge de travail. Ni MAI-Transcribe-2-Streaming ni Gemini 3.5 Transcribe Live ne figurent sur cette liste — ils sont servis respectivement par les propres stacks vocales de Microsoft et de Google — et l’objectif n’est pas de les router, mais de préserver la portabilité de tout ce qui se trouve en aval.

Lequel choisir
Choisissez MAI-Transcribe-2-Streaming lorsque l'exactitude et le temps de stabilisation sont le produit : des sous-titres en direct qu'un humain lit, une notation de conformité ou de qualité en temps réel où une entité mal entendue a un coût, ou de longues sessions que le plafond de 10 minutes de Gemini vous forcerait à recoller. Choisissez Gemini 3.5 Transcribe Live lorsque la couverture est le produit : un déploiement mondial dans des langues que vous ne pouvez pas énumérer à l'avance, un changement de langue en cours de flux, ou un prototype où le niveau gratuit et la facturation par token suppriment l'engagement. Les équipes qui ont besoin des deux ne sont pas bloquées — les deux sont des API différentes avec des modèles de session différents, et l'architecture honnête consiste à acheminer selon la charge de travail plutôt qu'à standardiser sur une seule.
La conclusion à retenir de cette comparaison n’est pas que Microsoft l’a emporté. C’est que la transcription en streaming dispose désormais de deux options de pointe crédibles à prix identique, ce qui signifie que la décision est passée de « ce qui est disponible » à « ce dont cette charge de travail spécifique a besoin ». C’est un meilleur problème à avoir.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
