
MAI-Transcribe-2-Streaming is live: Microsoft pakt de kroon voor streamingtranscriptie met 2,5% WER
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 221 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
MAI-Transcribe-2-Streaming is het antwoord van Microsoft AI op de enige vraag die zijn release in september openliet, en het antwoordde daar binnen 28 dagen op. MAI-Transcribe-2-Streaming, uitgebracht op 1 oktober 2026, is een realtime spraak-naar-tekstmodel dat transcribeert terwijl de woorden binnenkomen in plaats van nadat het bestand klaar is. Microsoft zegt dat het eerste staat qua nauwkeurigheid voor zowel definitieve als gedeeltelijke transcripties in de AA-WER Streaming-evaluatie van Artificial Analysis, met een woordfoutpercentage van 2,5% en het definitieve transcript gereed 0,13 seconde na het einde van de spraak. Dat is een claim van de leverancier op basis van de methodologie van een tracker, niet een rij die de tracker publiceert — op het moment van schrijven bevatten de 37 modellen van de ranglijst het niet, en het model dat het zou verdringen is Grok Voice Transcribe 2.0 (Streaming) met 2,73% en 0,49 seconde. Het model waarop het is gebouwd, MAI-Transcribe-2, werd op 3 september uitgebracht als batchmodel met 2,0% WER zonder realtime-SKU; de streamingvariant dicht die kloof zonder veel van de nauwkeurigheid op te geven die de batchversie opmerkelijk maakte. Wat het wel opgeeft, is de prijs: streaming is bij de lancering 5,4× het batchtarief.
De framing die Microsoft wil, is een volledige overwinning op het streamingboard. De framing die de cijfers ondersteunen, is nauwer en interessanter: een model dat claimt tegelijkertijd leidend te zijn op het gebied van nauwkeurigheid en latentie, op een frontier waar de nauwkeurigste inzending van het board vier keer langzamer tot een resultaat komt dan de snelste inzendingen, en geen van die snelle inzendingen een woordfoutpercentage onder de 3% heeft, geprijsd op hetzelfde niveau als de gevestigde partij in plaats van eronder. Hier is de lancering zoals die plaatsvond, met leveranciersclaims als zodanig aangeduid.
Wat Microsoft op 1 oktober uitbracht
MAI-Transcribe-2-Streaming wordt aangeboden via Microsofts spraakstack in de Azure AI Speech-service, met documentatie onder de eigen naam van het model en hetzelfde distributiemodel als de batchrelease: alleen via een API, zonder gewichten. Het transcribeert 60 talen met automatische, continue taaldetectie, zodat een sessie die midden in de stream van taal wisselt, niet vooraf hoeft te worden aangegeven. Microsoft positioneert het op de Pareto-grens van nauwkeurigheid versus latentie in de streaminggrafiek van Artificial Analysis — de eigen interpretatie van de leverancier van de gegevens van de tracker, en de interpretatie die de eigen grafiek van de tracker ondersteunt.
Het streamingmodel vormde niet de hele release. Microsoft bracht daarnaast twee spraakmodellen uit: MAI-Voice-2.1, dat 23 talen in 26 locales bestrijkt, en MAI-Voice-2.1-Flash, dat tot 45 seconden audio verwerkt bij een latentie van ongeveer 150 ms. Als set bekeken is de release van 1 oktober een volledige realtime conversationele stack — horen, begrijpen, spreken — in plaats van de lancering van één enkel model.

Het streamingklassement lezen
AA-WER Streaming meet per model twee dingen: hoe fout het voltooide transcript is, en hoe lang het na het stoppen van de spreker duurt voordat het klaar is. Microsofts claim is dat MAI-Transcribe-2-Streaming op beide punten vooroploopt: 2,5% woordfoutpercentage op het definitieve transcript bij 0,13 seconde na het einde van de spraak, en dezelfde 2,5% op het eerste gedeeltelijke transcript bij 0,12 seconde, wat volgens Microsoft een primeur is qua nauwkeurigheid op beide. Lees dat als een leverancierscijfer — op het moment van schrijven heeft het eigen streamingboard van de tracker het model nog niet geplot, dus er is geen onafhankelijke MAI-Transcribe-2-Streaming-rij om te lezen. Wat het board wel laat zien, is het veld dat het beweert te verslaan, en dat veld ligt dichter bij elkaar dan een 'kroon'-framing doet vermoeden:
• Grok Transcribe 2.0 — 2,73% WER voor het eindtranscript bij 0,49 seconden na het einde van de spraak, volgens Artificial Analysis, en de huidige koploper op de ranglijst. Dat is 0,23 punt achter de door Microsoft geclaimde 2,5%, en ongeveer vier keer zo traag om te stabiliseren — het verschil tussen een ondertitel die bijblijft en een die achterloopt.
• Muse Voice Transcribe — 3,06% bij 0,16 seconden, volgens Artificial Analysis. De dichtstbijzijnde concurrent qua latentie: ongeveer 30 milliseconden achter, en 0,5 punt slechter qua nauwkeurigheid dan Microsofts claim.
• ElevenLabs Scribe v2 Realtime — 3,59% bij 0,14 seconden, volgens Artificial Analysis. Vrijwel gelijk op snelheid, meer dan een punt achter op nauwkeurigheid.
• Gemini 3.5 Transcribe Live — 4,00% streaming-WER bij 0,40 seconden, het cijfer dat Artificial Analysis publiceerde en dat Google aanhaalt voor zijn eigen Live API-model. Dat is een verschil van 1,5 punt, en het is de vergelijking waarop deze release is gericht.
De kolom met eerste partiële resultaten is waar de bewering het minst lijkt op de rest van het bord. Op dezelfde tracker staan de eerste partiële resultaten van Grok Voice Transcribe 2.0 op 3,36% en die van Gemini 3.5 Transcribe Live op 5,77% — partiële resultaten horen slechter te zijn dan het definitieve transcript, vaak met een punt of meer, omdat het model zich vastlegt voordat de zin eindigt. Een eerste partieel resultaat dat overeenkomt met het definitieve cijfer is het echt ongebruikelijke onderdeel van de lancering van Microsoft, en het is het onderdeel dat nog niet kan worden bevestigd door de eigen data van de tracker. Citeer het als een bewering totdat er een rij bestaat.
De eerlijke kanttekening is dat 0,13 seconden en 0,16 seconden voor een mens die ondertitels leest dezelfde productervaring opleveren, en dat 2,5% tegenover de 2,73% die momenteel de ranglijst aanvoert neerkomt op ongeveer 2 fouten per 1.000 woorden. Een voorsprong van die omvang is reëel maar klein, en of het een voorsprong is die iemand kan merken, hangt af van de werklast. Waar het wél bijt, is in de staart: een contactcenterstream die acht uur per dag draait met 2,73% versus 2% levert tienduizenden extra foute woorden per jaar op, en woordenfouten in een transcript zijn niet gelijkmatig verdeeld — ze clusteren precies op de eigennamen en getallen die een transcript nuttig maken.

Wat $9,00 per 1.000 minuten koopt
Streaming is duurder dan batch, en Microsoft heeft het aan de top van de realtime-tier geprijsd in plaats van eronder. MAI-Transcribe-2-Streaming staat vermeld voor $0,54 per audio-uur, wat neerkomt op $9,00 per 1.000 minuten gestreamde audio, beschreven als een introductietarief dat geldig is tot het einde van het jaar. Ter vergelijking: de batchversie MAI-Transcribe-2 kost $0,10 per audio-uur — $1,67 per 1.000 minuten — dus realtime-transcriptie kost ongeveer 5,4× het tarief voor bestandsgebaseerde transcriptie voor dezelfde onderliggende familie en 0,5 punt meer woordfout. Dat is geen opslag die Microsoft verbergt; het is de eerlijke prijs van een persistente verbinding en een gedeeltelijk transcript dat al juist moet zijn voordat de zin voorbij is.
Afgezet tegen de rest van de streamingcategorie is het beeld gemengd. MAI-Transcribe-2-Streaming evenaart Gemini 3.5 Transcribe Live op ongeveer $9 per 1.000 minuten — nauwkeuriger, voor hetzelfde geld. Het zit boven ElevenLabs Scribe v2 Realtime en Deepgram Flux op ongeveer $6,50 per 1.000 minuten, boven Cartesia Ink-2 op ongeveer $4, en ongeveer drie keer zo hoog als Muse Voice Transcribe op ongeveer $3. De lancering is dus een zet op het gebied van nauwkeurigheid en latency tegen gelijke prijzen, geen prijzenoorlog; teams die al een goedkoper streamingmodel draaien, zullen dollars inruilen voor WER-punten.
Die afweging is het waard om precies te benoemen, want het is dezelfde afweging die de batchlancering omkeerde. In september maakte Microsoft nauwkeurigheid goedkoop. In oktober liet het realtime-nauwkeurigheid net zoveel kosten als die van iedereen. Als je pipeline transcripties alleen uiteindelijk nodig heeft, verandert er niets aan je rekening door 1 oktober. Als je ze nodig hebt terwijl het gesprek nog gaande is, is de afweging net verschoven naar kwaliteit.

Voortbouwen op een transcript is de andere helft van die beslissing, en dat is waar een multi-model-laag zijn bestaansrecht verdient. Een realtime transcript is zelden het einde van de pipeline — het wordt samengevat, gescoord, doorzocht, gerouteerd en geëscaleerd, en die stappen willen verschillende modellen tegen verschillende kosten. OrcaRouter bestaat voor die laag: één API voor meer dan 200 modellen, lijstprijzen van providers doorgegeven tegen 0% markup, automatische failover, en een routing-DSL die een live transcript naar het ene model kan sturen voor compliance-screening en naar een ander voor vergadernotities, zonder een tweede integratie. MAI-Transcribe-2-Streaming staat zelf niet op die lijst — het wordt aangeboden via Microsofts eigen spraakstack — maar het streamingtranscript dat het produceert is precies het soort hoogvolume-, latentiegevoelige input dat ervoor pleit om de laag erboven model-agnostisch te houden.
Wat is nog niet bewezen
Drie dingen liggen echt nog open. Ten eerste, diarisatie: het batchmodel bundelt sprekerattributie zonder een gepubliceerd diarisatiefoutpercentage, en Microsofts streamingmateriaal doet helemaal geen diarisatieclaim — voor een realtime model dat live agent-assistentie of ondertiteling voedt, is wie wat zei vaak de functie die meer telt dan ruwe WER. Ten tweede, de meertalige uitsplitsing: 60 talen met automatische continue taaldetectie is een verstrekkende claim, en de latentie per taal van een streamingmodel kan veel sterker variëren dan die van een batchtegenhanger, omdat de kwaliteit van een gedeeltelijk transcript afhangt van hoe snel het model zich op een taal vastlegt. Microsoft heeft geen streamingtabel per taal gepubliceerd. Ten derde, streaming-WER wordt gemeten op schone benchmarkaudio; de faalmodus die echte implementaties schaadt, is een lawaaierige far-fieldstream, en op de lanceringsdag bestond er geen onafhankelijke vergelijking van far-fieldstreaming.
Waar het je stack achterlaat
Het interessante aan deze lancering is niet dat Microsoft het meest nauwkeurige streamingtranscript heeft. Het is de cadans: batch in september, streaming in oktober, in dezelfde familie, op hetzelfde documentatieoppervlak, met een prijsstructuur die nu uiteenloopt van $1,67 tot $9,00 per 1.000 minuten voor dezelfde onderliggende capaciteit. Dat geeft teams voor het eerst een echte keuze — betaal alleen voor realtime waar realtime ertoe doet, en batch de rest — maar het betekent ook dat de transcriptielaag nu iets is dat je per workload afstemt in plaats van eenmalig te standaardiseren.
Lees de kopclaim letterlijk en hij houdt stand als een leveranciersverklaring: Microsoft zegt dat MAI-Transcribe-2-Streaming eerste is op zowel de nauwkeurigheid van het eindtranscript als van het eerste gedeeltelijke transcript, en dat het zich op de Pareto-grens bevindt. De asterisken zijn dat het scorebord van de tracker het model nog niet heeft uitgezet, de voorsprong die het opeist op de huidige leider klein genoeg is om in een nieuwe run te verdwijnen, het prijsvoordeel nul is, en het verhaal over diarisatie nog niet is verteld. Dat zijn de dingen om in de gaten te houden, niet de kroon.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
