
MAI-Transcribe-2-Streaming vs MAI-Transcribe-2: Betaal 5,4× voor timing op woordniveau
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 221 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
MAI-Transcribe-2-Streaming en MAI-Transcribe-2 behoren tot dezelfde modelfamilie, verdeeld over twee prijsklassen, en die splitsing is duidelijk genoeg om op te plannen. MAI-Transcribe-2 kwam op 3 september 2026 uit als batchmodel: 2,0% woordfoutpercentage op de non-streamingranglijst van Artificial Analysis, ongeveer 411× realtime, en $0,10 per audio-uur — ongeveer $1,67 per 1.000 minuten. MAI-Transcribe-2-Streaming kwam op 1 oktober 2026 uit als de realtimevariant: een geclaimd streaming-woordfoutpercentage van 2,5% bij 0,13 seconden tot het definitieve transcript, wat Microsoft omschrijft als een primeur voor de nauwkeurigheid van zowel definitieve als gedeeltelijke transcripten, gemeten volgens de streamingmethodologie van Artificial Analysis, maar nog niet uitgezet als een rij op de ranglijst van de tracker. $0,54 per audio-uur — ongeveer $9,00 per 1.000 minuten. Dezelfde 60 talen, dezelfde distributie uitsluitend via API, geen gepubliceerde gewichten. Streaming kost 5,4× het batchtarief en, volgens Microsofts eigen cijfers, 0,5 punt aan nauwkeurigheid. Of dat een koopje of een belasting is, hangt volledig af van één vraag: heeft iets in je pijplijn het transcript nodig voordat de zin voorbij is?
Omdat de twee modellen van één leverancier en één documentatieomgeving komen, is de vergelijking ongewoon zuiver — geen giswerk over feature-pariteit, geen mismatch tussen benchmarkversies, geen "hun cijfers versus onze cijfers". Het is één leverancier die twee snelheden van dezelfde capaciteit prijst, en het interessante werk is uitzoeken welke workloads de goedkope tier daadwerkelijk dekt.
De familie, in twee rijen
• MAI-Transcribe-2 — batch, vooraf opgenomen audio, uitgebracht op 3 september 2026. 2,0% AA-WER, tweede op de non-streamingranglijst van Artificial Analysis. Ongeveer 411× realtime, ook tweede. $0,10 per audio-uur, ongeveer $1,67 per 1.000 minuten, als tijdelijke aanbieding tot het einde van het jaar, zonder gepubliceerde standaardprijs. Bundelt sprekersdiarisatie en retourneert tijdstempels op woordniveau. 60 talen met automatische taalidentificatie.
• MAI-Transcribe-2-Streaming — realtime, continue transcriptie in WebSocket-stijl, uitgebracht op 1 oktober 2026. Microsoft meldt een WER van 2,5% voor het eindtranscript op 0,13 seconden na het einde van de spraak, en dezelfde 2,5% voor het eerste partiële resultaat op 0,12 seconden, wat het bedrijf omschrijft als een primeur voor nauwkeurigheid op beide — een leveranciersclaim gemeten volgens de streamingmethodologie van Artificial Analysis, hoewel de tracker op het moment van schrijven het model nog niet op de eigen ranglijst (37 modellen) heeft uitgezet, en de huidige koploper is Grok Voice Transcribe 2.0 met 2,73% en 0,49 seconden. $0,54 per audio-uur, ongeveer $9,00 per 1.000 minuten, introductietarief tot het einde van het jaar. 60 talen met automatische continue taalherkenning. Geen gepubliceerde claim over diarisatie, geen gepubliceerde claim over woordtijdstempels.
De enige asymmetrie die niet over snelheid of prijs gaat, is capaciteit: de diarisatie en woordtijdstempels van het batchmodel zijn gedocumenteerde functies, en die van het streamingmodel niet. Dat is belangrijker dan het nauwkeurigheidsverschil van 0,5 punt, en het is de reden dat veel teams uiteindelijk beide zullen draaien.

Wat 5.4× daadwerkelijk oplevert
Bij $1,67 per 1.000 minuten is batchtranscriptie op dit nauwkeurigheidsniveau marginaal bijna gratis. Bij $9,00 per 1.000 minuten is streaming een echte kostenpost — ongeveer de kosten van hetzelfde audio vijf keer transcriberen, plus een half procentpunt nauwkeurigheid. De vraag is dus niet of realtime meer waard is; de vraag is welke specifieke minuten het nodig hebben.
De workloads waarin dat duidelijk het geval is: live-ondertiteling die iemand leest terwijl de spreker praat, waarbij 0,13 seconden tegenover einde van bestand het hele product is; realtime agent-assistentie en compliance-scoring, waarbij een interventie die aankomt nadat het gesprek is afgelopen waardeloos is; en interactieve spraakapplicaties, waarbij een beurt niet kan worden afgerond voordat het transcript voltooid is. In alle drie de gevallen is het batchmodel geen goedkopere optie, het is geen optie — er is geen prijs waarvoor post-hoc transcriptie realtime wordt.
De workloads waarbij dat duidelijk niet het geval is: vergadering- en gespreksopnamen die achteraf worden verwerkt, media-archieven, batch-QA voor contactcenters, compliance-beoordeling van afgeronde gesprekken, ondertiteling van podcasts en video's. Dit zijn precies de pipelines waarvoor de 411× realtime en het tarief van $1,67 van het batchmodel zijn ontworpen om te winnen, en 5,4× betalen om een paar honderd milliseconden af te halen van een transcriptie die niemand leest tot morgen, is ronduit weggegooid geld. Voeg daar de functies voor diarisatie en woordtijdstempels aan toe — het batchmodel heeft ze gedocumenteerd, het streamingmodel niet — en de post-hoczaak wordt sterker, niet zwakker.
Het interessante midden is waar de twee elkaar echt aanvullen: streaming draaien voor het live-oppervlak en batch voor de vastlegging. Een supportgesprek dat in realtime wordt getranscribeerd om een agent-assist-paneel aan te sturen en 's nachts opnieuw in batch wordt getranscribeerd om het transcript voor archivering met diarisatie en tijdstempels te produceren, kost een kleine meerprijs ten opzichte van batch alleen en levert beide gedragingen op. Dat patroon werd pas in september mogelijk, en de release van oktober is wat het compleet maakt.
Waar de tweedelingsstructuur naar voren komt
Twee dingen aan deze familie zijn het opmerken waard, omdat ze structureel zijn en niet incidenteel.
Ten eerste is de nauwkeurigheidshiërarchie omgekeerd ten opzichte van het gebruikelijke patroon. Streamingmodellen betalen normaal gesproken een aanzienlijke nauwkeurigheidsbelasting voor realtime-uitvoer; hier is die belasting 0,5 punt, van 2,0% op de batchranglijst naar een geclaimde 2,5% op de streamingranglijst. Microsoft kreeg een realtime model binnen een half punt van zijn batchvlaggenschip op basis van zijn eigen cijfers, wat de eigenlijke technische prestatie van de oktoberrelease is als dat standhoudt — niet de toppositie op de ranglijst, die een goede nieuwe run zou kunnen veranderen en die de tracker nog niet heeft bevestigd.
Ten tweede is ook de prijsstelling omgekeerd ten opzichte van het gebruikelijke patroon. Leveranciers geven doorgaans korting op de laag met hoger volume; Microsoft zette de prijs voor streaming op 5,4× die van batch en liet beide op introductietarieven staan die op hetzelfde moment aflopen. Dat komt minder over als een bewuste streamingtoeslag en meer als twee afzonderlijke lanceringen die elk een introductiekorting dragen, zonder dat voor een van beide een standaardtarief is gepubliceerd. Teams die een begroting voor 2027 plannen, moeten beide bedragen als voorlopig beschouwen — de $1,67 en de $9,00 zijn beide aangeduid als tijdelijk, en voor geen van beide is een opvolgend tarief aangekondigd.

Wat is nog niet bewezen
De open vragen van september over het batchmodel zijn nog steeds open: geen gepubliceerd diarisatiefoutpercentage, geen uitsplitsing per taal achter de claim van 60 talen, en een actieprijs zonder genoemde opvolger. Het streamingmodel voegt daar nog een aan toe die specifiek is voor real-timewerk: streaming-WER wordt gemeten op schone audio, en de kwaliteit van gedeeltelijke transcripties in een lawaaierige far-fieldstream is de faalmodus die het belangrijkst is bij uitrol en het minst wordt behandeld in het lanceermateriaal. Het erft ook de nauwe marges van het streamingklassement: de top drie op het 37-modellenklassement van de tracker bevinden zich binnen een fractie van een punt van elkaar, dus "eerste" is een status die door een nieuwe run kan veranderen — en Microsofts eerste plaats is eerder een claim dan een rij.
De vraag op familieniveau is echter degene om in de gaten te houden. Microsoft verkoopt dezelfde mogelijkheid nu tegen twee prijzen die een factor vijf van elkaar verschillen, waarbij de dure tier twee functies mist die de goedkope tier wel documenteert. Als diarisatie en woordtijdstempels naar de streaming-SKU komen, wordt de kloof teruggebracht tot louter een afweging tussen latentie en prijs, wat een veel eenvoudiger beslissing is. Als dat niet gebeurt, is de tweedelige structuur permanent en moeten architecturen daaromheen worden gebouwd.
Waar dit een transcriptiestack achterlaat

Het praktische gevolg is dat transcriptie in september ophield één enkele regelpost te zijn en in oktober een routeringsbeslissing werd. Een pipeline die voorheen standaardiseerde op één API wil nu streaming voor het live-oppervlak, batch voor het archief, en een regel voor welke audio welk pad volgt — en die regel is zelf een routeringsprobleem, wat een vreemde hoeveelheid complexiteit is om in de releasecyclus van één leverancier terecht te komen.
Het komt het hardst aan op wat boven het transcript zit. Welke tier de tekst ook produceert, die tekst wordt vervolgens samengevat, geclassificeerd, geredigeerd en gerouteerd, en die stappen draaien op taalmodellen met hun eigen latentie- en kostenprofielen — een live transcript wil een snel, goedkoop model, een transcript voor archivering kan zich een sterker model veroorloven. OrcaRouter dekt precies die laag: één API over 200+ modellen, lijstprijzen van providers doorgegeven met 0% markup, automatische failover, en een routerings-DSL die een model per workload kiest in plaats van per pipeline. Noch MAI-Transcribe-2-Streaming noch MAI-Transcribe-2 staat op die lijst — beide worden aangeboden via Microsofts eigen spraakstack — maar een transcriptielaag met twee divisies is het sterkste argument tot nu toe om alles stroomafwaarts daarvan portable te houden.
De eerlijke samenvatting: streaming is geen betere MAI-Transcribe-2, het is een tweede product tegen een tweede prijs. Koop het voor de minuten die echt realtime moeten zijn, laat de rest op het goedkope niveau, en houd rekening met het feit dat beide tarieven opnieuw worden geprijsd wanneer de introductieperiode eindigt.
