
Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo: Wat de gratis baseline nog steeds beter doet
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Whisper Large v3 Turbo is sinds de release onder de MIT-licentie op 1 oktober 2024 het standaardantwoord op "we hebben transcriptie nodig", en niets aan Grok Voice Transcribe 2.0 verandert de reden waarom. Het nieuwe model van SpaceXAI, uitgebracht op 18 september 2026, is met ruime marge een werkelijk betere transcriber: 2,7% woordfoutpercentage voor definitieve transcripties en 3,4% voor de eerste partiële resultaten op de AA-WER Streaming board van Artificial Analysis, tegenover een cijfer van 4,07% voor de Whisper-familie op de niet-streaming board, waarbij Turbo zelf doorgaans een paar tienden van een punt achterligt op de volledige Large v3 waaruit het is gedistilleerd. Het is ook geprijsd op $0,10 per audio-uur voor batch en $0,20 per uur voor streaming. Whisper Large v3 Turbo is een bestand van 1,6 GB met 809 miljoen parameters dat op je eigen hardware draait, niets meet, nergens audio naartoe stuurt, en geen snelheidslimiet, geen gelijktijdigheidslimiet en geen uitfaseringsschema heeft. De vergelijking gaat niet tussen een beter en een slechter model. Het gaat tussen het huren van nauwkeurigheid en het bezitten van een component.
Het venster van dertig seconden is de hele architectuur
Whisper Large v3 Turbo neemt de structuur van elk Whisper-model over: audio wordt verwerkt in vaste vensters van 30 seconden, de encoder wordt één keer per venster uitgevoerd en de decoder genereert tekst voor dat stuk. Turbo maakte dat goedkoper — vier decoderlagen in plaats van tweeëndertig, ongeveer 8× sneller dan Large v3, ongeveer 6 GB VRAM in plaats van 10 — maar het veranderde de vorm niet. Er is geen idee van "de zin tot nu toe" in het model, omdat er geen persistente toestand over vensters heen is.
Dat ene ontwerpfeit verklaart alles wat daaruit voortvloeit. Er is geen native streaming, omdat streaming vereist dat je je midden in een uiting vastlegt op gedeeltelijke uitvoer, en het model heeft daar geen mechanisme voor. Er bestaan realtime Whisper-implementaties, maar die zijn chunking plus spraakactiviteitsdetectie plus een samenvoeglaag die iemand heeft geschreven en nu onderhoudt, en de latentie die uit die pipeline voortkomt, wordt gemeten in seconden in plaats van de halve seconde die Grok Voice Transcribe 2.0 haalt. Er is geen sprekersdiarisatie, omdat diarisatie een apart probleem is: het gaat erom wie er praat, niet wat er is gezegd. En de Turbo-variant retourneert specifiek platte tekst — geen tijdstempels, geen betrouwbaarheidsscores, geen inverse tekstnormalisatie die gesproken getallen en e-mailadressen omzet in geschreven vorm.
Grok Voice Transcribe 2.0 is precies andersom gebouwd. Streaming is het primaire transport, batch is hetzelfde model achter een REST-endpoint, en de functielijst leest als een opsomming van de dingen die Whisper aan de applicatie overliet: tijdstempels op woordniveau met betrouwbaarheidsscore per woord, sprekersdiarisatie inbegrepen zonder extra kosten, multichannel-transcriptie over maximaal 8 onafhankelijke kanalen, het bevoordelen van sleuteltermen met maximaal 100 domeintermen per verzoek, inverse tekstnormalisatie in 25 talen, het verwijderen van stopwoorden, en Smart Turn-detectie van het einde van een beurt voor voice-agents. Als je een chunking-and-stitching-pipeline rond Whisper hebt onderhouden, dan is die lijst een beschrijving van de code die je hebt geschreven.
Het nauwkeurigheidsverschil, en waarom het kleiner is dan het lijkt
• Nauwkeurigheid van het definitieve transcript (streaming) — Grok Voice Transcribe 2.0 met 2,7% WER op AA-WER Streaming tegenover geen vermelding voor Whisper Large v3 Turbo, omdat het model niet native kan streamen
• Batchnauwkeurigheid — Grok Voice Transcribe 2.0 met 2,29% AA-WER tegenover Whisper Large v3 met 4,07% op de non-streamingboard van Artificial Analysis, waarbij Turbo in onafhankelijke tests doorgaans 0,4 tot 0,6 punten achterloopt op volledige Large v3
• Schone Engelse audio — Whisper Large v3 Turbo haalt ongeveer 2,1% WER op LibriSpeech test-clean en circa 4,2% op test-other, dus bij spraak van studiokwaliteit wordt de kloof met de frontier-API bijna nihil
• Audio uit de praktijk — dezelfde onafhankelijke benchmarks plaatsen Turbo op ongeveer 4,6% bij zakelijke gesprekken met twee sprekers en 8–12% bij luidruchtige audio, en dat is waar de marge van het frontiermodel groter wordt
• Batchdoorvoer — Grok Voice Transcribe 2.0 met ongeveer 162× realtime versus Whisper Large v3 Turbo met ongeveer 80× op één bescheiden consumenten-GPU, waarbij snellere serverhardware veelvouden daarvan haalt
• Streaminglatentie — 0,49 seconden tot het eerste deelresultaat bij Grok Voice Transcribe 2.0 versus 1–5 seconden voor zelfgehoste Whisper-streamingpijplijnen, wat eerder gluecode plus VAD is dan een modelcapaciteit
De eerlijke lezing van die lijst is dat het nauwkeurigheidsargument om te betalen reëel maar voorwaardelijk is. Bij schone, door één spreker ingesproken, goed opgenomen Engelse spraak komt Whisper Large v3 Turbo dicht genoeg in de buurt dat het verschil zelden een uitkomst verandert. Bij 8 kHz-telefonie, rumoerige callcenter-audio, spraak met een accent en korte domeinspecifieke zinnen — precies de sets waartegen SpaceXAI 2.0 is afgestemd, waarbij de door SpaceXAI zelf gerapporteerde cijfers van 10,6% naar 7,1% gingen bij telefonie en van 20,6% naar 6,8% bij korte meertalige commando's — wordt de kloof het verschil tussen een transcriptie waarop je routering kunt baseren en een die je moet lezen. Dat zijn door het bedrijf gerapporteerde cijfers op audio van het bedrijf, niet gereproduceerd door iemand buiten SpaceXAI, en de richting die ze aangeven strookt met elke onafhankelijke test van Whisper op gedegradeerde audio.

De kostenvergelijking is niet $0,10 versus $0
De licentie van Whisper kost niets; het draaien ervan niet. Een GPU-instance die een model van 1,6 GB in 6 GB VRAM houdt en met ruwweg 80× realtime transcribeert, is de echte kostenpost, en bij typische cloud-GPU-tarieven komt dat voor continue workloads in dezelfde orde van grootte uit als de gehoste API's — met de belangrijke uitzondering dat je betaalt voor capaciteit, of er nu wel of geen audio doorheen stroomt. Gehoste Whisper-endpoints bestaan in een breed scala aan prijzen, van minder dan $1,20 per 1.000 minuten aan de goedkope kant tot een paar dollar, en die variatie is een nuttige herinnering dat "Whisper" een model is, geen serviceniveau. Het genormaliseerde prijzenoverzicht van Artificial Analysis zet de goedkoopste gehoste Whisper Large v3-endpoints op $0,50 en $1,15 per 1.000 minuten; beide onderbieden het batchtarief van $1,67 van Grok Voice Transcribe 2.0 — maar geen van die endpoints is van jou, en beide komen met de snelheidslimieten en het bewaarbeleid van iemand anders eraan vast.
Waar self-hosting zonder meer wint, is bij volumes met een uitgesproken piekpatroon. Een media-archief van tienduizend uur kost hetzelfde op je eigen GPU, of je het nu in een week of in een jaar verwerkt, en er loopt geen meter per uur mee terwijl je besluit. Een compliance-pijplijn die audio nooit buiten het netwerk mag versturen, heeft tegen welke prijs dan ook geen gehost alternatief, omdat de eis architecturaal is en niet financieel. En fine-tuning is alleen voor jou beschikbaar als je de weights in handen hebt: Whispers MIT-licentie laat je het model met 809M parameters nemen en aanpassen aan één spreker, één accent of een beperkte domeinwoordenschat, een mogelijkheid die geen enkele API tegen welke prijs dan ook biedt.
Het spiegelbeeld is dat de prijs van een gehost model onder je kan veranderen. SpaceXAI liet zijn tarief ongewijzigd toen het van 1.0 naar 2.0 ging — een modelverbetering tegen een gelijkblijvende prijs — en Microsoft's MAI-Transcribe-2 kwam uit op het identieke $0.10 per audio-uur, wat je vertelt waar de frontier-ondergrens ligt. Als je via OrcaRouter routeert, worden die lijstprijzen doorgegeven met 0% opslag, zodat een leverancierskorting je factuur bereikt op de dag dat die plaatsvindt en niet pas na een herprijzingscyclus. Dat is een echt voordeel van de gehuurde kant van deze vergelijking, en het is de moeite waard om het af te wegen tegen het feit dat de gratis kant je helemaal nooit een factuur stuurt.

Waar elk exemplaar eigenlijk voor is
Blijf bij Whisper Large v3 Turbo als de audio al een bestand is, het volume hoog of onregelmatig is, de opnamen redelijk schoon zijn, en ofwel de data je netwerk niet kunnen verlaten, ofwel het budget geen uurtarief kan dragen. Het blijft de juiste keuze voor offline-archieven, edge- en on-device-transcriptie waar een model van 1,6 GB door kwantisatie klein genoeg wordt gemaakt om te passen, batchpijplijnen waar doorvoer de beperkende factor is in plaats van latentie, en elk project waar fine-tuning op je eigen audio de weg is naar de nauwkeurigheid die je nodig hebt. De tooling eromheen — whisper.cpp voor edge, faster-whisper voor productie, GGUF-builds voor beperkt geheugen — heeft twee jaar community-hardening achter zich, wat een vorm van betrouwbaarheid is die geen twee dagen oude API heeft.
Stap over op Grok Voice Transcribe 2.0 wanneer de audio nog binnenkomt, wanneer de opnamen van slechte kwaliteit zijn, wanneer je moet weten wie sprak en wanneer, wanneer domeinwoordenschat moet worden beïnvloed in plaats van fijn-afgesteld, of wanneer de toepassing op een gedeeltelijk transcript reageert voordat de spreker klaar is. Het upgradepad is één parameter op een bestaande integratie en een pin terug naar 1.0 als het misgaat, wat de proef goedkoop maakt. Het is het vermelden waard dat de omgekeerde migratie niet goedkoop is: code die is geschreven voor een streaming-API met diarisatie en beurtdetectie, degradeert niet soepel naar een batchmodel dat platte tekst retourneert, wat een argument is om het gehoste pad op een stukje van je echte audio te bewijzen voordat je er een pipeline aan vastlegt.

Waar de beslissing daadwerkelijk wordt genomen
De meeste teams die Whisper op welke schaal dan ook draaien, kiezen niet tussen deze twee modellen; ze draaien een hybride: Whisper voor het archief omdat het gratis is en goed genoeg voor schone audio, een frontier-API voor het live-pad omdat niets anders streamt met 3,4% partiële WER, en een derde model stroomafwaarts dat samenvat, classificeert of actie onderneemt op welke tekst er ook uit komt. Die derde stap is waar de wildgroei meestal ontstaat — een tweede leverancierscontract voor het redeneermodel, een tweede set inloggegevens, een tweede rate limit om te monitoren. OrcaRouter klapt die laag in elkaar: één sleutel voor 200+ modellen, automatische failover wanneer een provider verslechtert, en een routing-DSL als je hetzelfde transcript door meerdere modellen wilt sturen en wilt vergelijken voordat je er een kiest. De transcriptieaanroepen zelf gaan nog steeds naar de leverancier die je hebt gekozen; wat ophoudt zich te vermenigvuldigen is alles daarna.
Wat je aan de Whisper-kant in de gaten moet houden, is niet een nieuw checkpoint — de familie is sinds Turbo niet meer veranderd, en de aandacht van OpenAI is uitgegaan naar de GPT Transcribe-lijn. Het is de servinglaag. Elk jaar wordt de self-hosted tooling sneller en de hardware die ervoor nodig is kleiner, en elke verbetering daar verkleint het argument om per uur te betalen. Wat je aan de SpaceXAI-kant in de gaten moet houden, is de omschakeling van de standaard: wanneer 2.0 de standaard wordt en 1.0 wordt afgeschaft, zal elke integratie die nooit een model bij naam heeft genoemd, in één keer meebewegen, inclusief latentie. Geen van beide ontwikkelingen verandert de fundamentele tweedeling. Eén model dat je bezit en afstelt, één model dat je huurt en aanroept, en het eerlijke antwoord dat de meeste productiestacks uiteindelijk beide draaien.
