
MAI-Transcribe-2 is live: Microsofts bod van $0,10 per uur om spraak-naar-tekst te domineren
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MAI-Transcribe-2 is het model waar Microsoft AI op inzet om spraak-naar-tekst tot een basisvoorziening te maken in plaats van een premiumfunctie, en de cijfers waarmee het is uitgebracht, zijn ontworpen om dat argument kracht bij te zetten. MAI-Transcribe-2, dat op 3 september 2026 in openbare preview is gegaan op Microsoft Foundry, de MAI Playground en Microsofts eigen API-oppervlakken, is het derde Microsoft-spraakmodel in vijf maanden — na MAI-Transcribe-1 in april voor $0,36 per audiouur en MAI-Transcribe-1.5 in juni — en het eerste dat alle beheerde concurrenten die het benoemt, voorbijstreeft op de twee metrieken waar teams daadwerkelijk op afgaan. Op het leaderboard voor niet-streaming woordfoutenpercentage van Artificial Analysis staat het met 2,0% AA-WER op de tweede plaats, en met ongeveer 411× realtime eveneens op de tweede plaats, wat het samen op de Pareto-grens van nauwkeurigheid en snelheid plaatst: op dat leaderboard is geen enkel model zowel nauwkeuriger als sneller. De introductieprijs ligt ongeveer 72% onder die van zijn eigen voorganger.
Het "snelste, meest nauwkeurige en goedkoopste spraakherkenningsmodel ter wereld" is Microsofts eigen kop voor de release, en die verdient het om gelezen te worden met de bijbehorende asterisken uit het bronmateriaal. Dit is het lanceerverhaal zoals het daadwerkelijk is verlopen, met de beweringen van de leverancier gelabeld en de onderdelen die nog bewijs behoeven eruit gelicht.
Wat Microsoft daadwerkelijk heeft uitgebracht
MAI-Transcribe-2 is een batchgeoriënteerd transcriptiemodel voor vooraf opgenomen audio, gericht op lange opnamen: vergaderingen, gesprekken, media-archieven en contactcenter-opnamen. Microsoft positioneert het voor precies die workloads waarin doorvoersnelheid en kosten per minuut bepalend zijn. Het transcribeert in 60 talen met automatische taalidentificatie, heeft sprekersdiarisatie die woorden aan de juiste persoon toekent, levert tijdstempels op woordniveau en ondersteunt keyword biasing voor namen, afkortingen en vakterminologie. Twee configureerbare transcriptiestijlen bieden de bekende tweedeling: "verbatim", dat opvulwoorden en valse starts behoudt voor compliancetranscripten, en "clean", dat disfluenties verwijdert voor ondertitels en notities. Microsoft benadrukt daarnaast code-switching in mengtalige spraak zoals Hinglish en Spanglish, en robuustheid bij rumoerige audio uit de praktijk.

Het beschikbaarheidsverhaal is net zo belangrijk als de functielijst. Microsoft zet dit niet achter zijn enterprise-spraakstack: het model is vandaag al te demonstreren vanuit de MAI Playground en wordt via Microsoft Foundry in openbare preview aangeboden, waarbij de Foundry-documentatie onder de Azure AI Speech-service valt. Dat is een bewuste distributiekeuze: plaats het frontier-model waar een ontwikkelaar het met een sleutel kan aanspreken, niet waar eerst een enterprise-verkoopcyclus het moet goedkeuren. Microsoft heeft geen gewichten gepubliceerd, en niets in het lanceringmateriaal wijst erop dat het dat wel zal doen.
De kop letterlijk lezen
"'De snelste, meest nauwkeurige en goedkoopste ter wereld' is drie beweringen van verschillende sterkte, en het lanceringsbericht zelf zwakt er twee stilzwijgend af. De eerlijke versie van elk:"
• Nauwkeurigheid — Op de ranglijst van Artificial Analysis staat MAI-Transcribe-2 tweede met 2,0% AA-WER, niet eerste; de eigen tekst van Microsoft zegt dat het tweede staat. De term "meest nauwkeurig" is alleen houdbaar als je hem opvat als "onder de beheerde batch-API's die op dit niveau presteren", en zelfs dan is het een claim over een vier dagen oud model, geen gevestigde toppositie. Afzonderlijk meldt Microsoft dat MAI-Transcribe-2 eerste staat op de meertalige benchmark FLEURS met een gemiddelde WER van 5,2% over de 60 talen — dat cijfer komt uit de lanceringspost van Microsoft en is nog niet onafhankelijk per taal opnieuw afgeleid.
• Snelheid — Volgens Artificial Analysis draait MAI-Transcribe-2 op ongeveer 411× real time, tweede op die ranglijst. Opvallend genoeg vermeldt Microsofts eigen aankondiging nooit het absolute getal; in plaats daarvan begint die met vriendelijkere relatieve vermenigvuldigers — “tot 10× snellere verwerking dan toonaangevende concurrenten, vooral bij lange audio,” en specifiek 10× sneller dan OpenAI's GPT-Transcribe, 7× sneller dan ElevenLabs' Scribe v2, en 5× sneller dan Gemini 3.5 Transcribe. Die verhoudingen zijn Microsofts weergave van dezelfde Artificial Analysis-gegevens, en de onderliggende snelheden doen ertoe: “5× sneller dan Gemini 3.5 Transcribe” klinkt als een bescheiden verschil totdat je het omrekent naar minuten rekentijd per uur audio.
• Goedkoopste — Alleen waar binnen twee beperkingen. Microsoft stelt duidelijk: het tarief van $0,10 is een 'beperkte aanbieding tot het einde van het jaar', en er wordt nergens in het lancermateriaal een standaardprijs na de promotie vermeld. En het is het goedkoopst onder beheerde API's met hoge nauwkeurigheid; een zelfgehost open model zoals Whisper Large v3 Turbo transcribeert nog steeds voor feitelijk de elektriciteitskosten. Het commoditeitsargument is reëel — het is alleen smaller dan de kop.

Wat $1,67 per 1.000 minuten oplevert
Met een prijs van $0,10 per audio-uur kost MAI-Transcribe-2 ongeveer $1,67 per 1.000 minuten audio. De vergelijking die dit bedrag echt laat landen, is met de andere beheerde transcriptie-API's die op nauwkeurigheid concurreren. GPT-Transcribe heeft een lijstprijs van $4,50 per 1.000 minuten; de prijscategorie voor vooraf opgenomen audio van Gemini 3.5 Transcribe komt met Google's tokengebaseerde prijzen uit op ruwweg $5 per 1.000 minuten; en de Scribe v2 van ElevenLabs staat nog hoger genoteerd. Bij 1.000 uur audio per maand — een serieuze maar niet enorme werklast voor contactcenters of media — is het verschil tussen MAI-Transcribe-2 tegen het early-bird-tarief en GPT-Transcribe tegen de lijstprijs in de orde van $170 per maand, elke maand, nog voordat eventuele nauwkeurigheidsverschillen worden meegerekend. Dat is de prijskloof die transcriptie verandert van een kostenpost die teams optimaliseren in een kostenpost die ze negeren.
Twee kanttekeningen moeten in één adem worden genoemd. Ten eerste: een promotieprijs is een prijsexperiment totdat het dat niet meer is. Teams die een product bouwen op het tarief van $0,10 moeten weten dat het standaardtarief niet bekend is gemaakt, en het eerlijke planningscijfer voor een begroting voor 2027 ligt ergens tussen het introductieaanbod en wat Microsoft ook noemt wanneer het aanbod afloopt. Ten tweede: 'goedkoopst op dit nauwkeurigheidsniveau' zegt niets over de totale eigendomskosten — het model is uitsluitend via een API beschikbaar, dus de vergelijking die voor hoogvolume-teams van belang is, is $1,67 per 1.000 minuten tegenover de volledige kosten van het draaien van hun eigen open-weights stack, niet alleen tegenover andere API's.
Samengevat tot een scorebord ziet de lanceerpositie er als volgt uit — elk cijfer hieronder draagt het bronlabel dat er in de bovenstaande tekst aan is gekoppeld.

Wat is nog niet bewezen
Ondanks alle specificiteit van de lanceerclaims zijn er drie zaken die echt openliggen. De eerste is streaming: MAI-Transcribe-2 is een batchmodel, Microsofts snelheidsverhaal draait om bestandsdoorvoer, en er is geen realtime-SKU aangekondigd of gedemonstreerd — de "411×" is geen latentiegetal voor live-transcriptie. De tweede is de diarisatiekwaliteit: sprekerstoewijzing is gebundeld, maar Microsoft publiceert geen diarisatiefoutpercentage, en dat is de functie die bij onafhankelijke tests waarschijnlijk slechter zal scoren dan de WER. De derde is de meertalige uitsplitsing: een enkel FLEURS-gemiddelde over 60 talen kan grote variatie per taal verbergen, en Microsoft heeft de tabel per taal niet gepubliceerd. Elk daarvan is een reden waarom het verhaal op dag vier nog niet rond is.
Waar het uw transcriptiestack verlaat
Niets hiervan vereist dat je vandaag voor MAI-Transcribe-2 kiest, en dat is precies waarom de prijsstelling aandacht verdient van teams die niet op zoek zijn naar een nieuwe leverancier. Spraak-naar-tekst is zelden het einde van een pipeline — transcripten worden samengevat, verwerkt, doorzocht en doorgestuurd, en het is die downstreamlaag waarin een opzet met meerdere modellen zich terugverdient. Een platform als OrcaRouter bestaat voor die helft van de stack: één API voor 200+ modellen, lijstprijzen van providers doorberekend zonder opslag, automatische failover en een routing-DSL waarmee een transcript per workload een ander model kan voeden — notulen van vergaderingen naar de ene samenvatter, compliancebeoordeling naar een andere — zonder een tweede integratie. MAI-Transcribe-2 zelf staat vandaag niet op die lijst; het draait op Microsofts eigen API en de thirdpartyplatforms die Microsoft vermeldt. Maar de commodityprijs die het zojuist heeft neergezet, is tot nu toe het sterkste argument om het deel boven het transcript modelagnostisch te bouwen.
De lanceringsprijs is veelzeggend. Microsoft probeert spraak-naar-tekst niet te winnen op functies alleen — het probeert hoge nauwkeurigheid zo goedkoop te maken dat de categorie geen aparte begrotingspost meer is. MAI-Transcribe-2 verdient de aandacht die het krijgt; lees alleen al "de snelste, meest nauwkeurige en goedkoopste ter wereld" met de drie sterretjes erbij: tweede op AA-WER, promotionele prijzen tot het einde van het jaar en een streamingverhaal dat nog niet is verteld.
