
Grok Voice Transcribe 2.0 vs MAI Transcribe 2: Twee sporen, geen twee rivalen
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Deze twee modellen zijn vijftien dagen na elkaar uitgebracht en tot op de cent hetzelfde geprijsd, en ze zullen bijna nooit in dezelfde inkoopbeslissing terechtkomen. Grok Voice Transcribe 2.0, op 18 september 2026 uitgebracht door SpaceXAI, is het model dat je aanroept wanneer audio nog binnenkomt — het streamt via een WebSocket, geeft ongeveer elke 500 ms tussentijdse resultaten door, en staat bovenaan de AA-WER Streaming-ranglijst van Artificial Analysis met 2,7% woordfoutpercentage voor definitieve transcripties en 3,4% voor de eerste gedeeltelijke resultaten. MAI-Transcribe-2, op 3 september 2026 uitgebracht door Microsoft AI, is het model dat je aanroept wanneer de audio al een bestand is — het is alleen batch, en op de non-streaming-ranglijst van Artificial Analysis is het het nauwkeurigste beheerde model, gemeten op 2,04% AA-WER, vóór de 2,29% van Grok Voice Transcribe 2.0 en ongeveer 2× sneller in doorvoer. Beide staan geprijsd op $0,10 per audio-uur, ongeveer $1,67 per 1.000 minuten. Als je behoefte realtime is, valt er niets te vergelijken. Als je behoefte een bestand is, wel.
De grens die geen van beide leveranciers voor je zal trekken
Streamingondersteuning is geen functieschakelaar. Grok Voice Transcribe 2.0 levert hetzelfde model via REST voor opgenomen bestanden en via `wss://api.x.ai/v1/stt` voor live audio, dus de nauwkeurigheid die je op je archief meet, is de nauwkeurigheid die je in een live gesprek krijgt. MAI-Transcribe-2 heeft helemaal geen streaming-SKU: de lanceringsmaterialen van Microsoft positioneren het expliciet voor langdurige en batch-audio, en hoewel de modelkaart realtime ondertiteling noemt bij de toepassingsscenario's, is de route daarnaartoe het opsplitsen van audio en elk segment door de batch-API halen — een pipeline die je zelf bouwt en beheert, geen latentiegarantie die je koopt. De opvallende doorvoer van Microsoft van ongeveer 411× realtime is een cijfer voor verwerkingssnelheid, niet voor responstijd, en die twee worden in de berichtgeving over deze release voortdurend door elkaar gehaald.
De praktische consequentie: als je spraakagenten met beurtwisseling bouwt, live ondertiteling, of iets waarbij een mens of een model reageert op spraak die nog gaande is, dan komt MAI-Transcribe-2 niet in aanmerking, hoe goed de nauwkeurigheid ook is. Als je vergaderingen achteraf transcribeert, opnames van contactcenters 's nachts verwerkt, media-archieven, of compliance-achterstanden, dan is streaming overbodige ballast en vertellen de batchcijfers het hele verhaal.
Waar MAI-Transcribe-2 echt vooroploopt
Nauwkeurigheid bij bestanden, eerst. Het gat van 2,04% tegenover 2,29% wordt gemeten op dezelfde onafhankelijke testomgeving — AA-WER v2 van Artificial Analysis, 50% AA-AgentTalk en telkens 25% VoxPopuli en Earnings22 — waardoor het het zuiverste gegeven in deze vergelijking is. Het is een verschil van 0,25 punt, ruwweg tweeënhalf minder fouten per duizend woorden. Of dat ertoe doet, hangt af van wat je met het transcript doet; voor een doorzoekbaar archief niet, en voor een juridisch of medisch dossier misschien wel.
Doorvoer, ten tweede, en met meer dan het nauwkeurigheidsverschil: 333× realtime tegenover 162× van Grok Voice Transcribe 2.0. Beide cijfers zijn metingen van Artificial Analysis van ingevoerde audioseconden die per seconde worden getranscribeerd, geen leveranciersclaims. Bij dat tempo is een archief van duizend uur in ongeveer drie rekenuren klaar op het Microsoft-model en ongeveer zes op dat van SpaceXAI. Voor een eenmalige migratie is dat irrelevant; voor een pijplijn die continu binnenkomt, is de gehalveerde kloktijd een echt capaciteitsverschil.
Taalbereik, ten derde. Microsoft specificeert 60 talen met automatische detectie, codewisseling binnen één opname en een gemiddeld woordfoutpercentage van 5,2% over die talen op FLEURS — een door de leverancier gerapporteerd cijfer, niet onafhankelijk gereproduceerd, maar het beschrijft ten minste de meertalige situatie over een vermelde talenlijst. SpaceXAI documenteert tientallen talen met wisseling midden in een opname en formattering van de geschreven vorm voor 25 daarvan. Als je audio buiten de goed gedekte set van Engels en de grote Europese talen valt, is het FLEURS-cijfer informatiever dan een leaderboard dat op Engels is gewogen en veel agentgesprekken bevat.
Nog twee verschillen die operationeel van belang zijn. MAI-Transcribe-2 biedt configureerbare transcriptiestijlen — verbatim, waarbij disfluenties behouden blijven, tegenover clean, die ze verwijdert — terwijl Grok Voice Transcribe 2.0 hetzelfde probleem aanpakt met een filler-word-removal-flag. En het model van Microsoft is in openbare preview op Microsoft Foundry, wat betekent dat er geen SLA is en dat er een blijvend advies geldt om het niet in productie te gebruiken totdat het GA is; het model van SpaceXAI is algemeen beschikbaar met gepubliceerde limieten van 10 verzoeken per seconde en 100 gelijktijdige streamingsessies per team.

Waar Grok Voice Transcribe 2.0 werkelijk vooroploopt
• Real-time streaming — een WebSocket-eindpunt met tussentijdse resultaten elke ~500 ms, versus alleen batchverwerking zonder aangekondigde real-time SKU
• Nauwkeurigheid van de eerste gedeeltelijke transcriptie — 3,4% WER bij 0,49 s op AA-WER Streaming, een categorie waarin MAI-Transcribe-2 niet meedingt
• Batchnauwkeurigheid op agent-talk-audio — 2,29% in totaal, maar op de AA-AgentTalk-subset van het non-streamingboard is de rangorde strakker dan de kop doet vermoeden, en op de agent-zware mix van het streamingboard staat Grok onbetwist aan de leiding
• Voice-agent-infrastructuur — Smart Turn-detectie van het einde van een beurt en het verwijderen van vulwoorden worden in het model meegeleverd, terwijl MAI-Transcribe-2 de beurtlogica aan de aanroeper overlaat
• Meerkanaals audio — tot 8 onafhankelijke kanalen in één keer getranscribeerd, wat belangrijk is voor stereo- of multi-leg gespreksopnames
• Betrouwbaarheid op woordniveau — tijdstempels bevatten een betrouwbaarheidsscore per woord, zodat segmenten met een lage betrouwbaarheid kunnen worden gemarkeerd in plaats van gelijkelijk te worden vertrouwd
• Beschikbaarheidsvoorwaarden — algemeen beschikbaar met gepubliceerde gelijktijdigheidslimieten, tegenover een openbare preview zonder SLA
Prijsbestendigheid — $0,10 per uur is het vaste tarief voor zowel batch als de basis voor de $0,20 streamingtier, waarbij Microsofts identieke $0,10 een tijdelijke introductieaanbieding is zonder aangekondigd standaardtarief voor 2027
Dat laatste punt is precies het punt dat de meeste vergelijkingen overslaan. De twee modellen kosten vandaag hetzelfde, en een van die prijzen heeft een vervaldatum die de andere niet heeft. Microsoft heeft geen tarief na de promotie gepubliceerd, en de berichtgeving is het er niet over eens of de aanbieding tot eind 2026 loopt of helemaal geen vermeld einde heeft. Als je een transcriptiebudget voor drie jaar baseert op $1,67 per 1.000 minuten van Microsoft, baseer je je op een bedrag waaraan de leverancier zich niet heeft vastgelegd.

De overlap is reëel, en het is het grootste deel van de functielijst
Laat de streamingkwestie buiten beschouwing en de twee producten convergeren sterk. Beide doen aan sprekersdiarisatie. Beide geven tijdstempels op woordniveau terug. Beide verwerken inverse tekstnormalisatie — getallen, datums, valuta en contactgegevens in geschreven vorm. Beide accepteren domeinterminologie: Grok Voice Transcribe 2.0 als maximaal 100 kerntermen per verzoek en MAI-Transcribe-2 als domeinterminologie- en afkortingenlijsten. Beide detecteren automatisch de taal en volgen een spreker die midden in een opname van taal wisselt. Beide verwerken 8 kHz telefonieaudio, het geval waarop de meeste transcriptiemodellen stilletjes falen en waartegen SpaceXAI het hardst heeft geoptimaliseerd — de interne telefonieset ging tussen versies van 10,6% naar 7,1% WER, een door het bedrijf gerapporteerd cijfer op bedrijfsaudio.
Beide hebben ook invoerlimieten die architecturen vormgeven, niet alleen budgetten. Grok Voice Transcribe 2.0 accepteert bestanden tot 500 MB in 12 audioformaten met samplefrequenties van 8 kHz tot 48 kHz. De limieten van MAI-Transcribe-2 worden bepaald door het Foundry-pad en niet door het model, en teams kunnen beter de eigen documentatie van Microsoft raadplegen voor het huidige plafond dan pariteit te veronderstellen met een gespecialiseerde STT-service.
Wat die convergentie betekent, is dat de beslissing in deze volgorde neerkomt op drie vragen: moet het live zijn, hoeveel talen heb je eigenlijk, en hoeveel kost de nauwkeurigheidskloof je. De eerste vraag is binair en schakelt één optie meteen uit. De tweede is meestal te beantwoorden aan de hand van een sample van je eigen audio. De derde is klein genoeg dat die voor de meeste op bestanden gebaseerde workloads niets zal beslissen — de kloof van 0,25 punt is reëel, maar dat geldt ook voor het feit dat beide modellen binnen een half punt van het beste getal zitten dat iemand heeft gemeten.

Wat te doen met dit
Behandel ze als een tweebaans-stack in plaats van als een rechtstreekse confrontatie. Een contactcenter dat live agentondersteuning draait en een nachtelijk compliance-archief, kiest niet tussen Grok Voice Transcribe 2.0 en MAI-Transcribe-2 — het draait beide, en de enige vraag is of dat het twee leveranciersrelaties, twee sets inloggegevens, twee facturen en twee rate limits kost. Geen van beide modellen staat vandaag in de catalogus van OrcaRouter, dus de transcriptieaanroepen zelf gaan naar de eigen API van elke leverancier. Wat één OrcaRouter-sleutel wél dekt, is alles stroomafwaarts: de summarizer, de classifier, de agent die redeneert over het transcript, en de evaltaak die de output van de twee leveranciers op dezelfde opname vergelijkt. Dat laatste is de reden waarom dit ertoe doet — je kunt niet op basis van een leaderboard tussen deze modellen beslissen, want het leaderboard bestaat uit acht uur Engelse agentgesprekken en jouw audio is dat niet.
Let op twee dingen. Ten eerste of Microsoft een standaardprijs aan MAI-Transcribe-2 hangt wanneer de lanceringsaanbieding afloopt; een permanente $1,67 per 1.000 minuten zou het alleen al op basis van kosten de standaardkeuze voor batch maken, en een terugkeer naar de $0,36 per uur van MAI-Transcribe-1 zou dit een stuk korter gesprek maken. Ten tweede of Microsoft een streaming-SKU uitbrengt. De modelkaart noemt realtime-ondertiteling al als een doelscenario, en het enige dat tussen MAI-Transcribe-2 en het streaming-spoor staat, is een endpoint — als dat er komt, zijn deze twee geen afzonderlijke sporen meer, maar concurrenten.
