
Grok Voice Transcribe 2.0 verovert de #1-plek voor streamingnauwkeurigheid tegen een ongewijzigde prijs
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 is het spraak-naar-tekstmodel dat SpaceXAI op 18 september 2026 uitbracht, en het enige getal dat er echt toe doet, is niet het getal waarmee het lanceringsbericht opent. Het is dit: het eerste gedeeltelijke transcript — de tekst waarop een spraakagent daadwerkelijk kan handelen terwijl er nog over de beller heen wordt gepraat — ging van 18,3% woordfoutpercentage in Grok Voice Transcribe 1.0 naar 3,4%. Dat is de meting op de AA-WER Streaming-board van Artificial Analysis, waar het nieuwe model nu eerste staat in zowel de Final Transcript-ranglijst (2,7% WER, 0,49 seconden na einde van spraak) als de First Partial Transcript-ranglijst (3,4%, 0,49 seconden). De nauwkeurigheid van het eindtranscript verbeterde ook, van 3,9% naar 2,7%, wat reëel maar bescheiden is. De sprong in het gedeeltelijke transcript is degene die verandert wat je kunt bouwen.
Wat is er eigenlijk veranderd tussen 1.0 en 2.0?
De twee versies zijn hetzelfde product in dezelfde API, en SpaceXAI heeft geen wijzigingen aan de interface aangebracht: Grok Voice Transcribe 2.0 wordt geselecteerd door grok-voice-transcribe-2.0 mee te geven aan /v1/stt in plaats van grok-voice-transcribe-1.0, of door het te kiezen wanneer de WebSocket-verbinding voor streaming wordt aangemaakt. Bestaande integraties die de modelparameter weglaten, blijven 1.0 krijgen totdat SpaceXAI de standaardwaarde verandert, wat volgens het bedrijf de komende weken zal gebeuren, tegelijk met het uitfaseren van de oudere versie. Tot dan is 2.0 opt-in en kan 1.0 bewust worden vastgezet, wat de juiste aanpak is voor een wijziging als deze: je kunt het A/B-testen op je eigen audio voordat het je productiestandaard wordt, of je daar nu om hebt gevraagd of niet.
De cijfers van Artificial Analysis, naast elkaar gelezen, vertellen een specifieker verhaal dan "twee keer zo nauwkeurig":
• Nauwkeurigheid van definitief transcript — Grok Voice Transcribe 2.0 met 2,7% WER versus Grok Voice Transcribe 1.0 met 3,9% op AA-WER Streaming, beide gemeten na het einde van de spraak
• Nauwkeurigheid van eerste gedeeltelijke transcriptie — 3,4% WER vs. 18,3%, het grootste individuele verschil tussen de twee versies
• Tijd tot definitief transcript — 0,49 s vs 0,37 s, dus het nieuwe model is trager met definitief vastleggen dan het model dat het vervangt
• Tijd tot eerste deelresultaat — 0,49 s vs. 0,25 s, eveneens langzamer
• Batchnauwkeurigheid (niet-streaming) — 2,3% AA-WER op de niet-streamingranglijst van Artificial Analysis, tegenover 4,07% voor Whisper Large v3 en 3,31% voor GPT Transcribe
• Batchdoorvoer — ongeveer 162× realtime op hetzelfde board, achter de 333× van MAI-Transcribe-2 en voor de 88× van Gemini 3.5 Transcribe
Die vierde en vijfde regel zijn het eerlijke voorbehoud in deze release. SpaceXAI kocht nauwkeurigheid met latentie. Het nieuwe model doet er ongeveer een derde seconde langer over om zijn eerste partiële resultaat en zijn definitieve transcript terug te geven dan 1.0. Op een leaderboard waar Deepgram Flux een partieel resultaat in 0,02 seconde teruggeeft en Soniox v5 in 0,05, concurreert Grok Voice Transcribe 2.0 helemaal niet op snelheid — het concurreert op juistheid, en het wint die afweging met een ruime marge. Of dat de juiste afweging is, hangt volledig af van of je applicatie een live spraakagent is die moet beginnen met terugpraten, of een transcriptiepijplijn waarin een halve seconde onzichtbaar is.

De bewering "twee keer zo nauwkeurig", gecontroleerd
De belangrijkste boodschap van SpaceXAI is dat 2.0 twee keer zo nauwkeurig is als 1.0 voor dezelfde prijs, en de eigen evaluatietabel van het bedrijf ondersteunt dat op de sets die het heeft gekozen. Bij Engelstalige klantenservicegesprekken van 8 kHz daalde het woordfoutpercentage van 10,6% naar 7,1%. Bij gesprekken met Grok van 8,7% naar 3,3%. Bij gesproken inloggegevens — accountcodes, telefoonnummers, e-mailadressen — van 7,2% naar 3,2%. Bij korte commando's in 19 talen, van 20,6% naar 6,8%, een vermindering van fouten met ongeveer tweederde. Die vier sets zijn afkomstig uit het productieverkeer van SpaceXAI en de vergelijkingen zijn van SpaceXAI zelf; niemand buiten het bedrijf heeft ze gereproduceerd. Beschouw de tabel als een kaart van waar het model is afgestemd, niet als een algemene nauwkeurigheidsgarantie.
Het resultaat van Artificial Analysis is het deel dat niet door de leverancier is gerapporteerd: een onafhankelijke testomgeving uitgevoerd op ongeveer acht uur audio, gewogen als 50% voor de besloten AA-AgentTalk-set en 25% elk voor VoxPopuli en Earnings22. Het ondersteunt een nauwere en nuttigere bewering dan "twee keer zo nauwkeurig" — dat dit model op die specifieke mix de nauwkeurigste streamingtranscriber is die is gemeten. Eén kanttekening die het benoemen waard is: SpaceXAI's bericht beschrijft een eerste plaats "onder 32 streamingmodellen", terwijl de ranglijstpagina zelf 27 van de 33 modellen toont. De rang is echt; de omvang van het deelnemersveld in de marketingtekst is de telling van het bedrijf, niet die van de ranglijst.
Het loont ook de moeite om precies te zijn over wat een eerste plaats op AA-WER Streaming wel en niet omvat. De ranglijst leunt sterk op Engels en staat bol van agentenpraat. Deze meet niet je accent, je codec, je domeinwoordenschat of je achtkanaals callcenteraudio. Een model dat bovenaan staat, kan op jouw opnames alsnog slecht presteren, en dat is precies waarom het opt-invenster van belang is.

De prijs is ongewijzigd, en dat is het op een na grootste feit hier
Grok Voice Transcribe 2.0 kost hetzelfde als 1.0: $0,10 per audio-uur voor batch- en opgenomen bestanden via het REST-eindpunt, $0,20 per audio-uur voor streaming via de WebSocket. Op het prijzenoverzicht van Artificial Analysis komt de streaming-SKU uit op $3,33 per 1.000 minuten en de batch-SKU op $1,67 — hetzelfde batchtarief dat Microsoft rekent voor MAI-Transcribe-2, en ongeveer een derde van wat ElevenLabs Scribe v2 Realtime per streamingminuut kost.
Diarisatie, tijdstempels op woordniveau met betrouwbaarheidsscores en key-term-biasing zijn allemaal inbegrepen bij dat tarief in plaats van apart gefactureerd, wat niet universeel is in deze markt. Gemini 3.5 Transcribe Live factureert per token voor zowel audio-invoer als tekstuitvoer, dus je kosten bewegen mee met hoeveel het model zegt, niet alleen met hoe lang de audio liep. Een vast tarief per uur is makkelijker te voorspellen en makkelijker te vergelijken tussen leveranciers — en omdat OrcaRouter de lijstprijzen van providers met 0% markup doorgeeft, zou een wijziging van dat tarief aan de leverancierskant dezelfde dag nog bij ons zichtbaar zijn in plaats van pas na een herprijzingscyclus.
Wat de API je daadwerkelijk geeft
De lijst met mogelijkheden is uitgebreid en grotendeels overgeërfd in plaats van nieuw, wat de moeite waard is om te weten als je de upgrade alleen op functies beoordeelt:
• Batch en streaming in één model — REST voor opgenomen bestanden tot 500 MB, WebSocket via wss://api.x.ai/v1/stt met tussentijdse resultaten die ongeveer elke 500 ms worden weergegeven
• Sprekerdiarisatie inbegrepen, plus meerkanaals transcriptie van maximaal 8 onafhankelijke kanalen
• Tijdstempels op woordniveau met betrouwbaarheidsscores, zodat je een drempel kunt toepassen op gedeelten met lage betrouwbaarheid in plaats van het hele transcript evenveel te vertrouwen
• Biasing van sleuteltermen voor maximaal 100 domeintermen per verzoek, elk tot 50 tekens
• Inverse tekstnormalisatie voor getallen, datums, valuta's, telefoonnummers en e-mailadressen, met ondersteuning voor opmaak in geschreven vorm in 25 talen
• Verwijdering van stopwoorden en Smart Turn-detectie van het einde van een beurt, specifiek gericht op spraakagenten
• Automatische taaldetectie met taalwisseling tijdens de opname in één enkele doorgang, voor 12 audioformaten en samplefrequenties van 8 kHz tot 48 kHz
• Servicelimieten van 10 verzoeken per seconde voor zowel REST als streaming, en 100 gelijktijdige streaming-sessies per team, gehost in us-east-1
De enige productienotitie die niet op de functielijst staat: de service draait in één regio. Als uw audio van buiten de Verenigde Staten afkomstig is, maakt het netwerktraject nu deel uit van uw latencybudget, en AA-WER Streaming rekent netwerkvertraging expliciet mee in de timing. SpaceXAI biedt voorwaarden voor zero data retention en verwijst naar SOC 2 Type II, BAAs en opties voor EU-gegevensresidentie, dus het complianceverhaal is verder uitgewerkt dan het geografische.

Wie moet er weg, en waar moet je op letten
Als je al op Grok Voice Transcribe 1.0 zit en je applicatie reageert op gedeeltelijke transcripties — turn detection, barge-in, live agent responses — dan is het verschil in gedeeltelijke nauwkeurigheid van 18,3% naar 3,4% groot genoeg dat het testen van 2.0 niet optioneel is. Dat getal dat van "meestal fout" naar "meestal juist" gaat, is het verschil tussen een gedeeltelijke transcriptie waarop je kunt routeren en een die je alleen kunt weergeven. Als je applicatie wacht op definitieve transcripties van opgenomen bestanden, is de verbetering reëel maar kleiner, en de toegevoegde 0,12 seconden commit-latentie is de prijs daarvoor.
Als je bij een heel andere leverancier zit, is de reden om naar deze release te kijken niet de positie op de ranglijst — het is dat een frontierlab zijn transcriptiemodel met ruime marge heeft verbeterd zonder de prijs te verhogen, en dat is hoe een markt eruitziet wanneer nauwkeurigheid niet langer het ding is waarvoor je geld vraagt. Het upgradepad is ook de goedkoopste soort: één parameter, geen codewijziging, geen nieuw contract, en een pin beschikbaar als het misgaat.
Wat je hierna in de gaten moet houden, is de standaardwijziging. Wanneer SpaceXAI 2.0 de standaard maakt en 1.0 begint af te bouwen, stapt elke integratie die nooit een modelparameter heeft meegegeven in één keer over op het nieuwe model, inclusief de verandering in latentie. Teams die afhankelijk zijn van de oude partiële timing van 0,25 seconde, kunnen die nu beter vastpinnen dan de verandering in productie te ontdekken. Het tweede om in de gaten te houden is onafhankelijke reproductie: de vermelding in Artificial Analysis is een echte meting, maar het is één board op één audiomix, en geen enkele derde partij heeft nog een gelijkwaardige 1.0-versus-2.0-run op productieaudio gepubliceerd.
