
MAI-Transcribe-2-Streaming vs Gemini 3.5 Transcribe Live: dezelfde $9, andere afweging
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 221 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
MAI-Transcribe-2-Streaming en Gemini 3.5 Transcribe Live kosten hetzelfde en zijn gebouwd op tegenovergestelde theorieën over waarvoor een streamingtranscriber dient. Beide komen uit op ongeveer $9,00 per 1.000 minuten gestreamde audio. Het model van Microsoft, uitgebracht op 1 oktober 2026, is een precisie-instrument: een beweerd streaming-woordfoutpercentage van 2,5% bij 0,13 seconden tot het definitieve transcript, volgens Microsoft zelf als eerste op nauwkeurigheid voor zowel definitieve als gedeeltelijke transcripten, gemeten volgens de streamingmethodologie van Artificial Analysis, maar nog niet als rij op dat scorebord uitgezet. Het andere model, sinds 26 augustus 2026 in openbare preview en aangeboden via de Live API, is een dekkingsinstrument: 85+ talen met taalwisseling midden in de stream, een gratis niveau, en een streaming-woordfoutpercentage van 4,00% bij 0,40 seconden, het cijfer dat Artificial Analysis ervoor meet. Geen van beide is de voor de hand liggende keuze, en de reden is dat ze niet echt om dezelfde workload concurreren.
Hier is de rechtstreekse vergelijking zoals de cijfers werkelijk luiden — door leveranciers gerapporteerde cijfers gelabeld, trackercijfers met bronvermelding, en de delen waar het ene model wint op een dimensie waarop het andere helemaal niet meedingt.
De éénregelige versie
Nauwkeurigheid en latentie — MAI-Transcribe-2-Streaming, op basis van de gepubliceerde cijfers. Microsoft claimt 2,5% streaming-WER bij 0,13 seconden tot een definitief transcript, als eerste qua nauwkeurigheid voor zowel definitieve als gedeeltelijke transcripten, en 2,5% op het eerste gedeeltelijke transcript bij 0,12 seconden. Daartegenover zet Artificial Analysis Gemini 3.5 Transcribe Live op 4,00% bij 0,40 seconden. De geclaimde voorsprong van Microsoft is 1,5 punt en ongeveer drie keer sneller om tot een definitief transcript te komen. De kanttekening is dat de tracker MAI-Transcribe-2-Streaming zelf nog niet heeft uitgezet — de huidige koploper op het scorebord is Grok Voice Transcribe 2.0 met 2,73% en 0,49 seconden, met Muse Voice Transcribe op 3,06% en 0,16 seconden — dus de 2,5% is een leverancierscijfer dat wordt afgezet tegen een veld dat de tracker wél meet. Het is geen nek-aan-nekrace op de as waarop beide modellen publiceren, maar slechts één kant ervan is onafhankelijk gepubliceerd.
• Taalbreedte — Gemini 3.5 Transcribe Live. Meer dan 85 talen met automatische detectie en de mogelijkheid om midden in een stream van taal te wisselen zonder de sessie opnieuw te starten, wat Googles belangrijkste claim voor de Live API is. MAI-Transcribe-2-Streaming dekt 60 talen met automatische continue taaldetectie. Microsofts ondergrens ligt hoger; Googles bovengrens is breder, en het gat van 25 talen zit vooral in talen waarin een streamingmodel voor één taal helemaal niet bruikbaar is.
• Sessievorm — Gemini 3.5 Transcribe Live, en deze snijdt aan twee kanten. De Live API is een WebSocket-sessie met een limiet van 10 minuten, wat prima is voor een beurt van een spraakagent maar onhandig voor een vergadering van een uur; Microsoft publiceert geen gelijkwaardig sessieplafond voor zijn streamingmodel, wat van belang is als je werkeenheid een oproep is, niet een gespreksbeurt.
• Instapkosten — Gemini 3.5 Transcribe Live. Er is een gratis niveau, en het gecombineerde tarief van Google komt neer op ongeveer $0,009 per minuut bij de op tokens gebaseerde prijsstelling. De $0,54 per audio-uur van Microsoft is een introductietarief dat volgens Microsoft tot het einde van het jaar loopt, zonder dat een standaardprijs bekend is gemaakt — dezelfde structuur als zijn batchlancering in september.

Waarom de nauwkeurigheidskloof groter is dan hij lijkt
Een verschil van 1,5 punt in het woordfoutpercentage klinkt als een afrondingsverschil, tot je er een prijskaartje aan hangt. Bij een streaming-WER van 4,00% krijgt Gemini 3.5 Transcribe Live ongeveer 40 woorden per 1.000 fout; bij de door Microsoft geclaimde 2,5% krijgt MAI-Transcribe-2-Streaming er 25. Bij de volumes die een realtime-pipeline produceert — een supportorganisatie die maandelijks 5.000 uur aan gesprekken verwerkt, is 300.000 minuten, meer dan 45 miljoen woorden bij een conversationeel tempo — vormt dat verschil jaarlijks miljoenen onjuiste woorden, geconcentreerd in de entiteiten waarvan downstreamsystemen afhankelijk zijn: accountnamen, ticketnummers, doseringen, adressen.
Het latentieverschil is het moeilijkste om te verkopen. 0,13 seconden versus 0,40 seconden na het einde van de spraak is waarneembaar in een live ondertitelstream — onder ongeveer 0,2 seconden wordt als gelijktijdig ervaren, en een derde van een seconde wordt ervaren als het transcript dat de spreker achternazit — maar het is niet waarneembaar in een agent-assistpaneel dat op menselijke tijdschaal ververst. Als je afnemer iemand is die meeleest, is de latentievoorsprong van Microsoft het product. Als je afnemer een model is dat het definitieve transcript krijgt wanneer de beurt eindigt, is het een getal.
Beide cijfers hebben dezelfde kanttekening, en het is de moeite waard die één keer te noemen: dit zijn cijfers uit één enkele run van een trackingboard met 37 modellen, en het verschil tussen de eerste en de derde op dat board is minder dan een punt. Een nieuwe run kan de top van het streamingleaderboard door elkaar husselen op een manier die een verschil van twee punten op het batchboard niet kan. En Microsofts 2,5% staat ook nog helemaal niet op het board — het is een leveranciersclaim gemeten volgens de methodologie van de tracker, wat iets anders is dan een rij die de tracker publiceert.
De grenzen zijn waar de beslissing daadwerkelijk leeft
Functiebeperkingen scheiden deze twee sneller dan benchmarks dat doen, en ze lopen in tegengestelde richtingen.
Gemini 3.5 Transcribe Live heeft drie gedocumenteerde beperkingen: een sessielimiet van 10 minuten op de Live API, geen sprekersdiarisatie en geen tijdstempels op woordniveau. De eerste is architectuurgebonden — streamen via een WebSocket-sessie heeft per ontwerp een plafond — en het betekent dat langdurige live-transcriptie over sessies heen moet worden aaneengeregen, waarbij het omgaan met de naden aan jou wordt overgelaten. De laatste twee zijn absoluut: als je product spraak aan een spreker moet toewijzen, of een woord op een tijdstempel moet plaatsen voor zoeken of ondertitelsynchronisatie, dan doet Gemini 3.5 Transcribe Live dat niet, tegen welke prijs dan ook.
De beperkingen van MAI-Transcribe-2-Streaming zijn minder gedocumenteerd, wat op zichzelf informatie is. Microsoft doet voor het streamingmodel geen diarisatieclaim en ook geen claim over woordtijdstempels; de batch-MAI-Transcribe-2 bundelt diarisatie en retourneert tijdstempels op woordniveau, maar dat is het batchproduct, en aannemen dat de streaming-SKU deze erft, is precies het soort gevolgtrekking dat lanceringsmateriaal bedoeld is te voorkomen. Wat Microsoft wel claimt, is 60 talen met continue taaldetectie en een positie aan de Pareto-frontier op het gebied van nauwkeurigheid versus latentie — beide leveranciersverklaringen waarmee de gegevens van de tracker consistent zijn.
Dus de eerlijke functieanalyse is: geen van beide streamingmodellen publiceert diarisatie of woordtijdstempels. Gemini 3.5 Transcribe Live heeft een gepubliceerde sessielimiet en een gratis niveau; MAI-Transcribe-2-Streaming heeft een gepubliceerd aantal talen en geen gepubliceerde limiet. Als diarisatie deel uitmaakt van je vereisten, is geen van beide het antwoord en kijk je naar batchtranscriptie met een streaminglaag ervoor geschroefd.
Wat de prijspariteit je echt vertelt
Twee leveranciers die vanuit tegenovergestelde richtingen op dezelfde $9 per 1.000 minuten uitkomen, is het interessantste gegeven in deze vergelijking. Google kwam daar via tokengebaseerde prijsstelling op een Live API-sessie: audio in voor $3,50 per miljoen tokens, tekst uit voor $21 per miljoen, en een ruw verbruik van 175 teksttokens per minuut, wat neerkomt op ongeveer $0,009 per minuut. Microsoft kwam daar door een vast tarief van $0,54 per audio-uur te vermelden voor een model in een familie waarvan de batchvariant op $0,10 draait. De ene is een naar verbruik afgerekende real-time sessie; de andere is een vast tarief per minuut met een introductiekorting.
Die structuren gedragen zich anders naarmate je opschaalt. Een vast tarief is voorspelbaar en makkelijk te budgetteren; een sessie met tokenmeting beweegt mee met hoeveel het model terugpraat en hoe lang de sessie open blijft staan zonder activiteit. Voor een pipeline met veel volume is het vaste tarief de vriendelijkere factuur; voor een prototype of een functie met weinig volume zijn het gratis niveau en facturering per token de vriendelijkere instap.

Wat geen van beide structuren verandert, is de laag boven het transcript. Welk model het ook produceert, een live transcript is input voor samenvatting, classificatie, redactie en routering, en die stappen hebben hun eigen kosten- en kwaliteitscurves — die doorgaans over meerdere modellen draaien in plaats van één. Dat is de laag die OrcaRouter dekt: één API voor meer dan 200 modellen, lijstprijzen van providers doorgegeven tegen 0% opslag, automatische failover, en een routerings-DSL die een transcript per workload naar verschillende modellen kan sturen. Noch MAI-Transcribe-2-Streaming noch Gemini 3.5 Transcribe Live staat op die lijst — ze worden respectievelijk via Microsofts en Googles eigen spraakstacks geleverd — en het gaat er niet om ze te routeren, maar om alles stroomafwaarts van hen portable te houden.

Welke moet je kiezen?
Kies MAI-Transcribe-2-Streaming wanneer nauwkeurigheid en settletijd het product zijn: live ondertiteling die een mens leest, realtime compliance- of kwaliteitsscores waarbij een verkeerd verstane entiteit kosten met zich meebrengt, of lange sessies die je door Gemini's plafond van 10 minuten zou moeten aaneenrijgen. Kies Gemini 3.5 Transcribe Live wanneer dekking het product is: een wereldwijde uitrol over talen die je niet vooraf kunt opsommen, taalwisseling midden in de stream, of een prototype waarin het gratis niveau en facturering per token de verplichting wegnemen. Teams die beide nodig hebben, zitten niet vast — het zijn twee verschillende API's met verschillende sessiemodellen, en de eerlijke architectuur is om op basis van workload te routeren in plaats van op één te standaardiseren.
De conclusie die de moeite waard is om uit deze vergelijking mee te nemen, is niet dat Microsoft heeft gewonnen. Het is dat streamingtranscriptie nu twee geloofwaardige frontier-opties heeft die identiek geprijsd zijn, wat betekent dat de beslissing is verschoven van "wat beschikbaar is" naar "wat deze specifieke workload nodig heeft." Dat is een beter probleem om te hebben.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
