
Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe: de streamingbaan is voor één van hen
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 en Gemini 3.5 Transcribe zijn de twee nieuwste frontier-spraak-naar-tekstmodellen van concurrerende labs, en de eerlijke manier om ze te vergelijken is vooraf toe te geven dat ze niet voor dezelfde taak zijn gebouwd. Grok Voice Transcribe 2.0 van SpaceXAI, uitgebracht op 18 september 2026, is een streaming-first model met een aangehangen batchmodus: het staat bovenaan het AA-WER Streaming-board met een woordfoutpercentage van 2,7% voor definitieve transcripties en 3,4% voor eerste partiële resultaten, die beide 0,49 seconden na het einde van de spraak binnenkomen. Gemini 3.5 Transcribe, uitgebracht op 26 augustus 2026, is een batch-first model met een aangehangen streaming-SKU, en de twee helften ervan gedragen zich heel verschillend — het vooraf opgenomen pad meet 2,6% AA-WER op het non-streamingboard van Artificial Analysis, terwijl het afzonderlijke gemini-3.5-transcribe-live eindpunt 4,0% meet op het streamingboard bij 0,40 seconden. Zet die vier getallen naast elkaar en de vorm van deze confrontatie is duidelijk: ze ontlopen elkaar nauwelijks qua nauwkeurigheid waar Gemini 3.5 Transcribe sterk is, en ze ontlopen elkaar wel waar Grok Voice Transcribe 2.0 dat is.
De enige baan waarin ze allebei vechten
Beide modellen kunnen live-audio transcriberen, dus streaming is het enige domein waar een directe vergelijking iets betekent. Daar heeft Grok Voice Transcribe 2.0 een voorsprong van 1,3 punt op Gemini 3.5 Transcribe Live wat betreft de nauwkeurigheid van eindtranscripten — 2,7% versus 4,0% WER op dezelfde testopstelling, dezelfde ongeveer acht uur aan audio, en dezelfde 50/25/25-weging over AA-AgentTalk, VoxPopuli en Earnings22. Dat is geen afrondingsverschil; bij die foutpercentages komt het neer op ongeveer één extra fout woord per vijfenzeventig woorden die door het Google-model worden getranscribeerd. Bij eerste partiële transcripten is de kloof nog groter, 3,4% tegen 5,8%, en partiële transcripten zijn de transcripten waarop een live spraakagent moet handelen voordat de spreker klaar is.
Latentie werkt de andere kant op, en dit is het deel van de vergelijking dat over het hoofd wordt gezien. Gemini 3.5 Transcribe Live levert zijn definitieve transcript 0,40 seconden na het einde van de spraak, tegenover de 0,49 van Grok, en zijn eerste partiële resultaat in 0,25 seconden, tegenover de 0,49 van Grok — ongeveer twee keer zo snel tot het eerste bruikbare woord. Geen van beide modellen wedijvert met het echt snelle einde van deze ranglijst, waar Deepgram Flux 0,02 seconden en Soniox v5 0,05 seconden noteert, maar tussen deze twee is de afweging expliciet: Google is sneller met spreken, SpaceXAI heeft meer kans om gelijk te hebben wanneer het dat doet. Voor een agent voor beurtwisseling die niet door een beller heen mag praten, is 0,24 seconde extra partiële latentie een echte kostenpost die de nauwkeurigheidswinst moet rechtvaardigen.

Waar Gemini 3.5 Transcribe echt wint
Taaldekking is het duidelijkste, en het is niet eens een close call. Het model van Google verwerkt 85+ talen; Grok Voice Transcribe 2.0 ondersteunt tientallen talen, met schrijfwijze-opmaak — de inverse-tekstnormalisatie die gesproken getallen, datums, valuta en e-mailadressen omzet naar hun geschreven vorm — gedocumenteerd voor 25 talen. Als je audio Portugees, Vietnamees of een code-switched mengeling van twee talen binnen één zin is, is de vraag welk model nauwkeuriger is op het Artificial Analysis-bord grotendeels academisch, omdat dat bord Engels-gewogen is en veel agent-talk bevat. Google rapporteert 5,50% streaming en 5,04% non-streaming WER op FLEURS binnen zijn eigen meertalige suite, cijfers die door de leverancier zijn gerapporteerd en niet onafhankelijk zijn gereproduceerd, maar die tenminste het meertalige geval überhaupt beschrijven.
De tweede winst is de gratis laag. Gemini 3.5 Transcribe biedt gratis invoer- en uitvoertokens op Google's API, met de kanttekening dat content in de gratis laag wordt gebruikt om Google-producten te verbeteren, terwijl dat bij content in de betaalde laag niet gebeurt. Voor een prototype, een hobbyproject of een interne tool die audio verwerkt die je anders niet zou betalen om te transcriberen, is dat een echt alternatief dat geen enkele aanbieder die per uur factureert kan evenaren. Grok Voice Transcribe 2.0 is betaald vanaf het eerste audio-uur.
En het derde is dat Gemini 3.5 Transcribe een algemeen multimodaal model met een transcriptiemodus is, geen speciaal daarvoor gebouwde ASR-dienst. Het kan prompts ontvangen, het kan tekst als context gebruiken, en het bevindt zich in hetzelfde API-oppervlak als alles wat Google verder uitbrengt. Als transcriptie één stap is in een pijplijn die ook redeneren over het transcript vereist, is het behouden van beide in één modelaanroep iets waard dat een foutenpercentage per woord niet vastlegt.
De prijsberekening, per duizend minuten
Artificial Analysis normaliseert beide modellen naar kosten per 1.000 minuten audio, wat de enige manier is om een vast uurtarief te vergelijken met facturering per token:
• Batch, vooraf opgenomen — Grok Voice Transcribe 2.0 tegen $1,67 per 1.000 minuten ($0,10/uur) versus Gemini 3.5 Transcribe tegen $5,00 per 1.000 minuten ($0,30/uur, vanaf $2,00 per 1 mln. invoertokens en $12,00 per 1 mln. uitvoertokens)
• Streaming — Grok Voice Transcribe 2.0 voor $3,33 per 1.000 minuten ($0,20/uur) vs Gemini 3.5 Transcribe Live voor ongeveer $5,40 per 1.000 minuten, samengesteld uit $3,50 per 1 miljoen audio-invoer en $21,00 per 1 miljoen tekst-uitvoertokens
• Batchdoorvoer — Grok Voice Transcribe 2.0 met ongeveer 162× realtime versus Gemini 3.5 Transcribe met ongeveer 88× op hetzelfde board, dus het goedkopere model is ook het snellere voor bestandswerk
• Limiet voor live-sessies — Grok Voice Transcribe 2.0 streamt via een WebSocket zonder gepubliceerd sessieplafond, anders dan 100 gelijktijdige sessies per team, tegenover Gemini 3.5 Transcribe Live met een limiet van 10 minuten per sessie
Die laatste regel is het operationele detail dat meer architecturen bepaalt dan de nauwkeurigheidscijfers doen. Een plafond van 10 minuten op een live sessie betekent dat lange gesprekken, lange vergaderingen en lange streams moeten worden opgeknipt en opnieuw opgezet, en elke hernieuwde totstandbrenging is een naad waar context verloren gaat. Het streaming-endpoint van Grok heeft een limiet voor de bestandsgrootte van 500 MB op het batchpad en een gelijktijdigheidslimiet van 100 sessies per team op het streamingpad, wat een ander soort beperking is — doorvoer in plaats van duur.
Het is de moeite waard om tokenfacturering te begrijpen voordat je je aan de kant van Google vastlegt, want daardoor wordt je factuur een functie van twee variabelen in plaats van één. Gemini rekent audio-invoer en tekstuitvoer apart af, dus een model dat uitgebreide opmaak produceert of zichzelf herhaalt, kost meer dan een dat dat niet doet, en een taal met langere woorden kost meer dan een met kortere. Het vaste uurtarief van Grok beweegt niet mee met al dat soort dingen. Voor workloads met een groot volume is het vaste tarief makkelijker te voorspellen, en omdat OrcaRouter de lijstprijzen van providers doorgeeft met 0% opslag, bereikt een wijziging aan de kant van een van beide leveranciers je factuur op de dag dat die plaatsvindt, in plaats van bij de volgende contractverlenging.

Vormen van features: wat elk weigert te doen
De capaciteitenlijsten lopen verder uiteen dan de nauwkeurigheidscijfers suggereren, en de hiaten zitten op plekken die van belang zijn voor specifieke toepassingen:
• Sprekerdiarisatie — inbegrepen zonder extra kosten bij Grok Voice Transcribe 2.0; niet ondersteund op Gemini 3.5 Transcribe Live, dus live-transcripties met sprekerattributie zijn op dat eindpunt helemaal niet beschikbaar
• Tijdstempels op woordiniveau — Grok Voice Transcribe 2.0 retourneert deze met betrouwbaarheidsscores per woord; Gemini 3.5 Transcribe Live retourneert er geen, waardoor betrouwbaarheidsdrempels en nauwkeurige ondertiteluitlijning komen te vervallen.
• Meerkanaals audio — Grok Voice Transcribe 2.0 transcribeert tot 8 onafhankelijke kanalen in één keer; Gemini 3.5 Transcribe Live heeft geen equivalent, dus meerkanaals gespreksopnames hebben sessies per kanaal nodig
• Sleutelterm-bias — Grok Voice Transcribe 2.0 accepteert tot 100 domeintermen per verzoek; Gemini 3.5 Transcribe accepteert een aangepaste woordenlijst en optionele taalaanwijzingen
• Spraakagent-infrastructuur — Grok Voice Transcribe 2.0 levert verwijdering van stopwoorden en Smart Turn-detectie van het einde van een beurt; Gemini 3.5 Transcribe Live dekt het streaming-scenario, maar laat de beurtlogica aan de applicatie over
• Invoerafhandeling — Grok Voice Transcribe 2.0 ondersteunt directe bestandsupload tot 500 MB in 12 audioformaten; het pad voor vooraf opgenomen audio van Gemini 3.5 Transcribe verwacht een openbare HTTPS-URL met een limiet van 15 minuten en 300 MB, en kan de Smart formatting-modus niet combineren met woordtijdstempels of sprekerlabels
Het patroon in die lijst is dat SpaceXAI een transcriptieproduct bouwde en Google een transcriptiecapaciteit. Diarisatie, tijdstempels, kanaalsplitsing en beurtdetectie zijn de functies die je nodig hebt wanneer transcriptie de hele applicatie is; promptbaarheid, taalbreedte en één-API-voor-alles zijn wat je wilt wanneer transcriptie een stap in een groter geheel is. Geen van beide lijsten is in abstracto beter, en een team dat alleen op nauwkeurigheid afgaat, zal uiteindelijk de set missen die het niet nodig had.

Kiezen tussen hen, en wat het antwoord verandert
Kies voor Grok Voice Transcribe 2.0 wanneer het transcript correct moet zijn terwijl de audio nog speelt: live beurtwisseling tussen agenten, realtime ondertiteling die zich geen fouten kan permitteren, contactcenterstreams waarbij sprekerattributie en kanaalscheiding deel van de vereisten uitmaken, of elke batchpipeline waarin $1,67 per 1.000 minuten en 162× doorvoer beide belangrijk zijn. Kies voor Gemini 3.5 Transcribe wanneer de audio meertalig is in een taal buiten de gedocumenteerde set van Grok, wanneer het transcript een model voedt dat er ook over moet redeneren, wanneer je wilt prototypen met een gratis tier, of wanneer de 2,6% AA-WER van het batchpad simpelweg genoeg is voor wat je doet en de extra taaldekking meer waard is dan het prijsverschil.
Wat de meeste teams hier in de praktijk doen, is niet kiezen. Beide modellen zijn bereikbaar via één OrcaRouter-API-sleutel, naast 200+ andere modellen, wat betekent dat je live verkeer van agents naar Grok Voice Transcribe 2.0 kunt routeren en lange meertalige archieven naar Gemini 3.5 Transcribe, zonder twee leverancierscontracten, twee facturatieverhoudingen en twee sets inloggegevens te onderhouden. Dat is ook hoe je de nauwkeurigheidsvraag voor je eigen audio beslecht: laat beide op dezelfde opnamen draaien, vergelijk de transcripties die je daadwerkelijk hebt gekregen, en laat de routing-DSL het verkeer sturen waar het thuishoort. De ranglijst vertelt je welk model wint op acht uur Engelstalige agentgesprekken van iemand anders; alleen je eigen audio vertelt je welk model wint op die van jou.
De open vraag is wat er met die streamingkloof gebeurt wanneer Google het Live-endpoint de volgende keer herziet. Gemini 3.5 Transcribe Live is in openbare preview gelanceerd en het cijfer van 4,0% werd ongeveer een dag nadat het aanroepbaar werd gemeten — een sterk vroeg signaal, maar een dat minder tijd heeft gehad om te bezinken dan het Grok-cijfer waar het nu achter staat. Als Google de streamingkloof van 1,3 punt dicht terwijl het de partiële latentie van 0,25 seconde behoudt, is de afweging geen afweging meer en beperkt Groks voordeel zich tot prijs en functies. Tot die tijd is de splitsing duidelijk: de snelste partiële resultaten zijn van Google, de nauwkeurigste zijn van SpaceXAI, en geen enkel model in het overzicht is beide.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
