
Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B: twee leaderboards, één misleidende vergelijking
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA Parakeet TDT 0.6B is een FastConformer-TDT-transducer met 600 miljoen parameters, uitgebracht op 14 augustus 2025 onder CC-BY-4.0, en het is al meer dan een jaar de standaardaanbeveling voor iedereen die transcriptie zelf wil uitvoeren. Grok Voice Transcribe 2.0 is het beheerde spraak-naar-tekstmodel van SpaceXAI, uitgebracht op 18 september 2026, geprijsd op $0,10 per audio-uur voor batch en $0,20 per uur voor streaming, met een uiteindelijke word error rate van 2,7% op de streamingboard van Artificial Analysis. Als je zoekt naar een vergelijking tussen hen, zul je zien dat Parakeet wordt genoemd met 13,7% WER en Grok Voice Transcribe 2.0 met 2,7%, waardoor het beheerde model vijf keer nauwkeuriger lijkt en wat echt misleidend is om te lezen. Die twee cijfers komen uit verschillende Artificial Analysis-indexen, gebouwd op verschillende datasets, jaren na elkaar gepubliceerd, en een ervan is achterhaald door de nieuwere metingen van de leverancier zelf. De echte vergelijking is interessanter, en gaat erover wat 600 megabyte aan gewichten je oplevert wat een API niet kan.
Het getal 13,7%, en waarom je het niet zou moeten gebruiken
Het State of AI-rapport van Artificial Analysis voor Q3 2025 plaatste NVIDIA Parakeet TDT op de derde plaats in zijn AA-WER-index met 13,7%, achter Chirp 2 van Google met 11,6% en NVIDIA's eigen Canary Qwen met 13,2%. Die index was een naar audioduur gewogen gemiddelde over ongeveer twee uur van elk van VoxPopuli, Earnings-22 en AMI-SDM — echte spraak met uiteenlopende accenten, domeinwoordenschat en moeilijke kanaalomstandigheden, waardoor elk cijfer erop hoog is. Een WER van 13,7% op AMI-SDM, dat far-field-vergaderaudio is die in galmende ruimtes is opgenomen, is geen slecht resultaat; het is een zware test.
Die index bestaat in die vorm niet meer. Artificial Analysis heeft hem opnieuw opgebouwd als AA-WER v2, met AA-AgentTalk voor 50% gewogen en VoxPopuli-Cleaned-AA en Earnings22-Cleaned-AA elk voor 25%, ongeveer acht uur audio, en het opschonen en herwegen heeft de score van elk model flink verschoven. Op het huidige niet-streaming scorebord zit Parakeet TDT 0.6B V3 in de lage enkele procenten — dezelfde band als andere open-weight koplopers — in plaats van ergens in de buurt van 13,7%, en de top van het scorebord ligt nu rond de 2%. Wie nog steeds 13,7% voor Parakeet citeert, citeert een afgedankte meting, en als men dat vergelijkt met een streamingcijfer uit 2026, vergelijkt men bovendien twee verschillende scoreborden met elkaar.
Wat je eerlijk naast elkaar kunt leggen, is beperkter. NVIDIA's eigen evaluatie op de Open ASR Leaderboard — de standaard openbare Engelstalige short-formdatasets, verwerkt met de tooling van dat board — rapporteert een gemiddelde WER van 6,32% voor Parakeet TDT 0.6B V3 met een RTFx van 3.332,74, en een gemiddelde van 6,05% voor de Engelstalige v2. De 2,7% van Grok Voice Transcribe 2.0 is een eindtranscriptcijfer op het streamingboard, gemeten na het einde van de spraak, op agent-gewogen Engelstalige conversationele audio. Andere sets, een ander board, een andere modus. Het managed model is zeer waarschijnlijk nauwkeuriger op de audio die de twee boards gemeen hebben; de grootte van dat voordeel is niet 5×, en niemand heeft de meting gepubliceerd die uitsluitsel zou geven.
Wat de twee modellen eigenlijk voor vorm hebben
Het architectonische verschil verklaart het grootste deel van het praktische verschil. Parakeet TDT 0.6B is een FastConformer-encoder met een token-and-duration transducer-decoder — deze voorspelt zowel een token als met hoeveel frames moet worden opgeschoven, waardoor hij kan overslaan in plaats van blanks uit te zenden, en dat is de belangrijkste bron van zijn efficiëntie. Het wordt geleverd met automatische taalherkenning voor 25 Europese talen, tijdstempels op woord- en segmentniveau, interpunctie en hoofdlettergebruik, en het kan lange audio verwerken — tot 24 minuten met volledige aandacht, of ongeveer drie uur met lokale aandacht. Het wordt aangeboden via NeMo 2.2, heeft een MLX-pad voor Apple Silicon, en er zijn ONNX INT8-builds die op gewone CPU's draaien.
Grok Voice Transcribe 2.0 is een beheerde service, dus de vergelijking is tussen een model en een product. Wat het product voor zijn adviesprijs bevat:
• Streaming — Grok Voice Transcribe 2.0 native via WebSocket, eerste partiële resultaat na 0,49 seconden versus de chunked of gebufferde aanpak van Parakeet TDT 0.6B, zonder een eersteklas interface voor partiële transcripties
• Sleutelterm-biasing — tot 100 sleuteltermen per verzoek vs. geen Parakeet-functie
• Diarisatie — inbegrepen in de aanvraagprijs versus een apart systeem dat je zelf toevoegt
• Kanalen — tot acht audiokanalen in één aanvraag vs. één stream per pass
Inverse tekstnormalisatie — opgenomen in 25 talen versus alleen interpunctie en hoofdlettergebruik
• Deployment — een beheerd endpoint in us-east-1 versus gewichten die je downloadt, uitvoert en overal beheert
• Licentie — commerciële API-voorwaarden versus CC-BY-4.0 met naamsvermelding
• Modelgrootte — niet bekendgemaakt tegenover ongeveer 600 miljoen parameters, ruwweg 2,4 GB in fp32 of 1,2 GB in fp16
De laatste rij is degene die veel deployments bepaalt. Parakeet TDT 0.6B past in een paar gigabyte, draait acceptabel op een laptop-CPU via het INT8 ONNX-pad, en past comfortabel op elke consumenten-GPU. Dat is geen kleinere versie van wat de API doet — het is een andere mogelijkheid, want het is het verschil tussen een transcriptiefunctie die offline werkt, op een apparaat, zonder netwerk en zonder kosten per uur, en een die dat niet doet.

De kostenberekening die niemand goed uitvoert
De vergelijking die wordt gepubliceerd is "$0,10 per uur versus gratis", en die is in beide richtingen onjuist — de API is niet het enige waarvoor je betaalt, en de gewichten zijn niet het enige waarop je bespaart.
• Batch-transcriptie — Grok Voice Transcribe 2.0 voor $0,10 per audio-uur, ongeveer $1,67 per 1.000 minuten versus Parakeet TDT 0.6B zonder licentiekosten plus GPU- of CPU-tijd
• Streaming — $0,20 per audio-uur, ongeveer $3,33 per 1.000 minuten versus zelf gehost, waarbij de beperking je eigen gelijktijdigheidsplafond is in plaats van een gepubliceerd tarief
• Servicelimieten — 10 verzoeken per seconde en 100 gelijktijdige streamsessies per team, tegenover wat je hardware toelaat, zonder snelheidslimiet en zonder limiet op gelijktijdigheid
• De kosten die op geen van beide overzichten staan — geen engineering, geen servingstack, geen autoscaling versus de piketdienst, de retrylogica, de modelupdates en de GPU die je warm houdt voor de piek
Bij kleine volumes is de managed kant bijna altijd goedkoper, omdat de vaste kosten van het self-hosted pad een persoon zijn. Bij grote, stabiele volumes wint de self-hosted kant overtuigend, en het omslagpunt is een functie van bezettingsgraad in plaats van audiovolume: een GPU die je bezig houdt, is heel goedkoop per uur audio, en een die je warm houdt voor piekverkeer niet. Een team dat 20.000 uur per maand verwerkt, betaalt $2.000 voor het managed batch-pad en ongeveer één mid-range GPU-maand plus engineeringtijd voor het self-hosted pad, wat niet in de buurt komt.
De reden dat de berekening slecht wordt uitgevoerd, is dat de self-hosted kant meestal tegen nul wordt afgezet en de managed kant meestal tegen listprijs. Geen van beide is een reëel getal. Wat wel reëel is, is dat de 3.332 RTFx van Parakeet TDT 0.6B — het cijfer van NVIDIA, gebatcht, op datacenterhardware, en het cijfer dat je als bovengrens moet beschouwen in plaats van als een belofte — betekent dat één enkele bescheiden GPU meer audio kan verwerken dan de meeste organisaties produceren.
Waar Parakeet niet langer het juiste antwoord is
Drie dingen drijven een team weg van het open model en naar een beheerd model, en geen daarvan is nauwkeurigheid.
Het eerste is bias bij sleuteltermen. Als je transcripten vol staan met productnamen, achternamen, tickersymbolen of domeinjargon, zal een model zonder mechanisme voor het beïnvloeden van sleuteltermen ze fout weergeven, met geen andere oplossing dan fine-tuning. Grok Voice Transcribe 2.0 ondersteunt maximaal 100 sleuteltermen per verzoek. Parakeet TDT 0.6B heeft deze functie niet. Voor contactcentra, de gezondheidszorg en juridisch werk is die enkele tekortkoming diskwalificerend, wat een ranglijst ook zegt.
Het tweede is diarisatie. Parakeet geeft je woorden met tijdstempels; het vertelt je niet wie ze heeft gezegd. Transcriptie met meerdere sprekers betekent dat je een apart diarisatiemodel moet draaien en de uitvoer moet uitlijnen, wat een project is in plaats van een configuratieoptie. Het beheerde model retourneert tekst met sprekerattributie in hetzelfde verzoek.
De derde is de streaminginterface zelf. Parakeet is snel genoeg dat mensen er realtime-systemen op bouwen — audio opdelen in chunks, het model op elke chunk draaien, de uitvoer aan elkaar naaien — maar het gedrag van gedeeltelijke transcripties, de detectie van het einde van een beurt en de commitment-semantiek zijn allemaal dingen die je zelf schrijft en onderhoudt. Grok Voice Transcribe 2.0 retourneert een eerste gedeeltelijke transcriptie 0,49 seconden nadat je stopt met spreken, als productfunctie.
Er is ook een licentiedetail dat teams af en toe verrast: Parakeet TDT 0.6B V3 is CC-BY-4.0, wat commercieel gebruik toestaat, maar naamsvermelding vereist, en sommige NVIDIA-spraakmodellen zijn sindsdien overgestapt op de eigen Open Model License van de leverancier. Als naamsvermelding een probleem is voor je product, lees dan de kaart voor het specifieke checkpoint in plaats van aan te nemen dat de voorwaarden van de familie van toepassing zijn.

Waarom de API meestal toch wint, en wanneer dat niet zou moeten
Het patroon van het afgelopen jaar is steeds hetzelfde geweest: teams beginnen met een open model zoals Parakeet TDT 0.6B omdat het gratis en beheersbaar is, leveren de functie op, ontdekken vervolgens dat de doorlopende kosten niet de GPU zijn maar het onderhoud, en stappen over naar een managed endpoint. De omgekeerde migratie komt ook voor, meestal wanneer het volume een drempel overschrijdt waarop de kosten per uur beginnen te lijken op huur voor iets dat je zou kunnen bezitten.
Beide richtingen zijn duur om uit te voeren als het model rechtstreeks in je applicatie is ingebouwd, wat het argument is om de call site saai te houden. OrcaRouter stelt 200+ modellen beschikbaar achter één OpenAI-compatibele sleutel met automatische failover tussen providers en 0% opslag op de lijstprijs van de provider, zodat een self-hosted deployment en een managed deployment achter dezelfde interface kunnen zitten en met een modelstring kunnen worden verwisseld. Dat is bij spraak belangrijker dan gewoonlijk, waar de ranglijst elke paar weken van koploper wisselt en een managed service in één regio een storing in één regio is — het failoverpad is wat voorkomt dat een transcriptiefunctie een transcriptiestoring wordt.
Voor teams die de doorvoer van het open model willen zonder de serving-stack, is dat ook de vorm van de beslissing: benchmark Parakeet TDT 0.6B op je eigen audio, benchmark Grok Voice Transcribe 2.0 op dezelfde audio, en laat degene die wint het verkeer houden, terwijl het je niet meer uitmaakt welk leverancierslogo erop staat.

Als je de versie in één regel wilt: Parakeet TDT 0.6B is nog steeds het beste antwoord op "alles transcriberen, overal, zonder kosten per uur, op hardware die ik al bezit", en Grok Voice Transcribe 2.0 is het antwoord op "nauwkeurig transcriberen met sprekerslabels en mijn eigen vocabulaire, zonder iets te draaien." Het cijfer van 13,7% dat de kloof enorm doet lijken, is een verouderde meting, en de eerlijke kloof — ergens tussen één en drie punten WER bij overlappende audio — is klein genoeg dat de operationele vraag de doorslag zou moeten geven.
