
Grok Voice Transcribe 2.0 vs GPT Transcribe: zelfde streamingprijs, andere nauwkeurigheid
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Het toeval is bijna te mooi. Op het AA-WER Streaming-board van Artificial Analysis staan Grok Voice Transcribe 2.0 en GPT Live Transcribe — de streaming-endpoint voor transcriptie — beide voor precies $3,33 per 1.000 minuten audio. Grok Voice Transcribe 2.0 van SpaceXAI, uitgebracht op 18 september 2026, levert een definitief transcript met een woordfoutpercentage van 2,7%, 0,49 seconden na het einde van de spraak, en een eerste gedeeltelijk resultaat bij 3,4%. GPT Live Transcribe, dat op 28 juli 2026 samen met GPT Transcribe werd uitgebracht, levert zijn definitieve transcript bij 3,9% en zijn eerste gedeeltelijke resultaat bij 6,3%. Dezelfde prijs, en ongeveer 1,2 punt nauwkeurigheid van het definitieve transcript plus 2,9 punt nauwkeurigheid van het gedeeltelijke transcript in het voordeel van SpaceXAI. De batchkant van dezelfde vergelijking is helemaal geen toeval: GPT Transcribe kost $4,50 per 1.000 minuten tegenover $1,67 voor Grok Voice Transcribe 2.0, een verschil van 63% op het pad voor opgenomen bestanden.
Twee verschillende gokken op hoe transcriptie beter wordt
Het antwoord van OpenAI op nauwkeurigheid is context. GPT Transcribe en GPT Live Transcribe accepteren beide vrije prompts, trefwoordenlijsten en lijsten met verwachte talen, en in Realtime-sessies worden de eerder getranscribeerde beurten teruggevoerd als context voor latere. Op OpenAI's eigen Context Aware ASR-benchmark verhoogde die conditionering de semantische nauwkeurigheid van GPT Live Transcribe van 38,5% naar 44,6% — een door de leverancier gerapporteerd cijfer, en een dat meet of de betekenis behouden bleef in plaats van of de woorden juist waren. De ruil die OpenAI biedt is expliciet: geef het model informatie over wat het op het punt staat te horen, en het zal je domein beter transcriberen dan een algemeen model met dezelfde ruwe nauwkeurigheid zou doen.
Het antwoord van SpaceXAI is het model zelf. Grok Voice Transcribe 2.0 heeft wel een biasmechanisme — tot 100 sleuteltermen per verzoek, elk tot 50 tekens — maar het is een woordenlijst, geen prompt. Je kunt het vertellen dat "OrcaRouter" en "Kubernetes" echte woorden zijn; je kunt het geen alinea geven waarin staat dat dit een supportgesprek over een terugbetaling is. De nauwkeurigheidsverbetering in 2.0 komt in plaats daarvan uit hertraining: op de eigen, uit productie afgeleide evaluatiesets van SpaceXAI daalde het woordfoutpercentage van 8,7% naar 3,3% bij gespreksaudio, van 10,6% naar 7,1% bij 8 kHz-telefonie, van 7,2% naar 3,2% bij gesproken inloggegevens, en van 20,6% naar 6,8% bij korte commando's in 19 talen. Dat zijn de cijfers van het bedrijf op de audio van het bedrijf, door niemand buiten het bedrijf gereproduceerd, en ze beschrijven een model dat beter is geworden in het akoestische probleem dan een model dat beter is geworden in het te horen krijgen wat het moet verwachten.
Het praktische verschil wordt duidelijk in het tweede uur van het werk. Een contextgeconditioneerd model kan dramatisch beter zijn dan zijn ruwe benchmark suggereert, omdat je de woordenschat en het domein hebt aangeleverd. Het kan ook de trefwoorden hallucineren die je hebt aangeleverd: zet "OrcaRouter" in de prompt en een model dat het woord niet duidelijk kan horen, kan het toch produceren. Een model met bias voor sleuteltermen degradeert op een elegantere manier, omdat bias de waarschijnlijkheid van een term verschuift in plaats van te beweren dat deze aanwezig is. Geen van beide faalmodi staat op een leaderboard, en beide zullen in je logs opduiken.
De cijfers, naast elkaar
• Nauwkeurigheid van het uiteindelijke transcript (streaming) — Grok Voice Transcribe 2.0 met 2,7% WER vs. GPT Live Transcribe met 3,9% op AA-WER Streaming, beide volgens Artificial Analysis
• Nauwkeurigheid van het eerste partiële resultaat (streaming) — 3,4% vs 6,3%, het grootste verschil in de vergelijking en het verschil dat het gedrag van de spraakagent bepaalt
• Tijd tot definitief transcript — 0,49 s vs. 0,81 s na het einde van de spraak, dus het nauwkeurigere model is ook het model dat het snelst tot een definitief transcript komt
• Tijd tot eerste deelresultaat — 0,49 s vs. 0,26 s, de enige latentiekolom die OpenAI zonder meer wint
• Streamingprijs — $3,33 per 1.000 minuten voor beide, genormaliseerd door Artificial Analysis op basis van $0,20 per uur voor Grok en $0,017 per minuut voor OpenAI
• Batchnauwkeurigheid (niet-streaming) — Grok Voice Transcribe 2.0 met 2,3% AA-WER vs GPT Transcribe met 3,31%
• Batchprijs — $1,67 per 1.000 minuten versus $4,50 per 1.000 minuten, vanaf $0,10/uur tegenover $0,0045/minuut
• Batchdoorvoer — ruwweg 162× realtime versus ruwweg 41× op hetzelfde board
Lees die lijst als twee kolommen in plaats van als één eindoordeel. OpenAI wint de latentie tot het eerste deelresultaat met een duidelijke marge en biedt een contextmechanisme dat Grok niet heeft. SpaceXAI wint de uiteindelijke nauwkeurigheid in beide modi, de nauwkeurigheid van deelresultaten bij streaming, de doorvoer en de batchprijs met een ruime marge. Er is geen kolom waarin GPT Live Transcribe zowel sneller als nauwkeuriger is dan Grok Voice Transcribe 2.0; er is één kolom waarin het sneller is, en dat is de vroegste.

Op welk batchpad je eigenlijk zit
Het verschil van $1,67 tegenover $4,50 is het minst dubbelzinnige cijfer hier, en het is de moeite waard precies te zijn over waarom het bestaat. OpenAI verlaagde de prijs van deze productlijn met 25% toen het GPT Transcribe lanceerde, uit het GPT-4o Transcribe-tijdperk, en $0,0045 per minuut was het resultaat. SpaceXAI liet zijn batchtarief onaangeroerd op $0,10 per uur toen het van versie 1.0 naar 2.0 ging — het verbeterde het model en rekende hetzelfde, wat moeilijker is om te doen en een beter signaal vormt over waar de markt naartoe gaat. Microsofts MAI-Transcribe-2 kwam uit op het identieke tarief van $0,10 per uur als tijdelijke aanbieding, dus het punt van $1,67 per 1.000 minuten is de ondergrens van frontier-labs voor batchtranscriptie geworden in plaats van een promotietarief van één leverancier.
Bij tienduizend uur audio per maand is dat verschil ongeveer $2.830 tegenover $450. Voor een podcastarchief, een achterstand aan opgenomen gesprekken of een mediabibliotheek die met terugwerkende kracht wordt getranscribeerd, doet het prijsverschil elk nauwkeurigheidsverschil tussen 2,3% en 3,31% WER in het niet vallen. Voor een streamingagent, waar de twee producten hetzelfde kosten, zijn nauwkeurigheid en latentie de enige dingen waarover nog te twisten valt.
Er zit een structureel verschil achter die tarieven dat het benoemen waard is: Grok Voice Transcribe 2.0 factureert een vast tarief per audio-uur, en GPT Live Transcribe factureert per minuut, maar Gemini 3.5 Transcribe Live factureert per token voor zowel audio-invoer als tekstuitvoer. Slechts één van die drie maakt dat je factuur afhangt van wat het model kiest te zeggen. Als je volume groot genoeg is dat prognoses ertoe doen, zijn de vaste tarieven gemakkelijker te verdedigen tegenover degene die de factuur ondertekent — en omdat OrcaRouter de lijstprijzen van providers doorgeeft met 0% opslag, zou een verlaging aan de leverancierskant zoals OpenAI's 25% bij ons dezelfde dag nog live zijn als die wordt aangekondigd, niet bij de volgende verlenging.

Wat geen van beide modellen is
GPT Transcribe en GPT Live Transcribe zijn twee producten, niet één product met een schakelaar. Het batchmodel verwerkt voltooide bestanden, transcripties van gestreamde bestanden en vastgelegde beurten in Realtime-sessies, en verwerkt audio ongeveer 34 keer sneller dan realtime volgens OpenAI's eigen cijfer — Artificial Analysis meet 41× in zijn eigen testopstelling. Het streamingmodel is het duurdere model tegen $0,017 per minuut en het model met een 10× hogere foutmarge op tussentijdse resultaten. OpenAI kiezen betekent kiezen welk van die twee problemen je hebt, want het goedkopere endpoint kan de taak van het andere niet vervullen.
Grok Voice Transcribe 2.0 is één model met twee transporten: dezelfde gewichten bedienen /v1/stt via REST voor bestanden tot 500 MB en wss://api.x.ai/v1/stt via WebSocket voor live-audio, waarbij tussentijdse resultaten ongeveer elke 500 ms worden uitgezonden. Het streamingtarief is precies het dubbele van het batchtarief in plaats van een apart ontwikkeld product, wat betekent dat de nauwkeurigheid die je meet op je gearchiveerde audio de nauwkeurigheid is die je live mag verwachten. Het betekent ook dat er geen tweede model te evalueren valt — één set prompts, één set sleuteltermen, één set verwachtingen.
De functiepariteit is bijna gelijk, maar niet identiek. Beide retourneren tijdstempels op woordniveau; Grok Voice Transcribe 2.0 koppelt een betrouwbaarheidsscore aan elk woord, waardoor je segmenten met een lage betrouwbaarheid kunt drempelen in plaats van het hele transcript evenveel te vertrouwen. Beide doen sprekersdiarisatie, en die van Grok is inbegrepen zonder extra kosten. Beide verwerken inverse tekstnormalisatie voor getallen, datums, valuta en contactgegevens. Grok Voice Transcribe 2.0 voegt meerkanaalstranscriptie toe over maximaal 8 onafhankelijke kanalen, het verwijderen van stopwoorden en Smart Turn-detectie van het einde van een beurt; de onderscheidende toevoegingen van GPT Transcribe zijn de contextconditionering op promptniveau en, aan de Realtime-kant, het automatisch meenemen van eerdere beurten. OpenAI heeft voor geen van beide modellen een aantal ondersteunde talen gepubliceerd; Grok Voice Transcribe 2.0 documenteert tientallen talen met wisselen tijdens de opname en formattering in schriftvorm in 25 talen.

Hoe je beslist, en hoe je het test
Als je een voice-agent bouwt die moet reageren voordat de beller is uitgesproken, is de kolom met partiële transcripties je beslissingsvariabele, en die scheidt de twee modellen duidelijk: Grok Voice Transcribe 2.0 is 2,9 punten nauwkeuriger bij partiële transcripties, maar doet er 0,23 seconde langer over om ze te produceren. Kies SpaceXAI als een foutieve partiële transcriptie erger is dan een late — routing, escalatie, door compliance getriggerde reacties. Kies OpenAI als een late partiële transcriptie erger is dan een foutieve, en als je de domeinwoordenschat hebt om het contextmechanisme te voeden zodat het nauwkeurigheidsverschil kleiner wordt. Meet ze daarna allebei, want het gedrag van geen van beide leveranciers op het vlak van partiële transcripties bij acht uur Engelstalige agentgesprekken voorspelt wat een van beide zal doen bij jouw accent, jouw codec en jouw jargon.
Als je bestanden transcribeert, is de beslissing veel eenvoudiger: $1,67 tegenover $4,50 per 1.000 minuten en 2,3% tegenover 3,31% WER, beide wijzen in dezelfde richting. De enige reden om voor batchwerk bij GPT Transcribe te blijven, is als het contextconditioneringsmechanisme iets voor jouw audio doet wat het ruwe nauwkeurigheidsverschil niet kan compenseren — wat bij zeer domeinspecifieke opnames een reële mogelijkheid is, en een die te testen valt.
Geen van beide transcriptiemodellen staat vandaag in de catalogus van OrcaRouter, dus de aanroepen zelf gaan naar de eigen API van de leverancier. Wat wél achter één OrcaRouter-sleutel zit, is alles wat het transcript voedt: het agentmodel, de samenvatter, de classifier, de code die bepaalt wat er met de tekst moet gebeuren. Daar duikt meestal het tweede contract op — de ene leverancier voor spraak, de andere voor het model dat erover redeneert — en dat hoeft niet. Eén sleutel voor meer dan 200 modellen, automatische failover als een provider hapert, en de routing-DSL als je een verzoek door meerdere modellen wilt sturen en wilt vergelijken voordat je een keuze maakt. Het is een kleinere claim dan 'we routeren je transcriptie', en het is de ware.
Waar je op moet letten is of OpenAI het antwoord geeft op het gebied van nauwkeurigheid in plaats van context. Het bedrijf heeft nu in een jaar tijd twee generaties transcriptie uitgebracht en één keer de prijzen verlaagd; het contextmechanisme is echt onderscheidend, maar op de ranglijst die ruwe transcriptie meet staat het momenteel achter zowel SpaceXAI als Microsoft. Als er een GPT Transcribe 2 komt met het contextmechanisme intact en het foutpercentage teruggebracht tot de 2%-range, kantelt deze vergelijking aan de batchkant van de ene op de andere dag — en de streamingprijs, die al identiek is, maakt dat een race die het volgen waard is.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
