
Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC: 12.600× realtime ontmoet een halve seconde
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Granite Speech 5.0 470M TurboCTC transcribeert ongeveer 3,5 uur audio per seconde op één enkele H200, en Grok Voice Transcribe 2.0 levert een eerste gedeeltelijk transcript 0,49 seconden nadat je stopt met praten. Die twee getallen worden in vergelijkingsposts naast elkaar gezet alsof het om hetzelfde soort meting gaat, terwijl ze dat totaal niet zijn — het ene is een doorvoercijfer voor batchverwerking in datacenters waaraan geen latentie is gekoppeld, het andere is een latentiecijfer voor een model waarvan niemand de doorvoer heeft gepubliceerd. IBM bracht Granite Speech 5.0 470M TurboCTC op 25 augustus 2026 uit onder Apache 2.0, waarbij de taalmodeldecoder volledig werd weggelaten en met één enkele niet-autoregressieve CTC-pass werd gedecodeerd. SpaceXAI bracht Grok Voice Transcribe 2.0 op 18 september 2026 uit als een beheerde API voor $0,10 per audio-uur voor batch en $0,20 per uur voor streaming. Het zijn beide uitstekende transcriptiemodellen die elk een tegenovergestelde helft van hetzelfde probleem oplossen, en de keuze tussen hen is makkelijker zodra je stopt met de getallen direct te vergelijken.
12.600× realtime, en de woorden die het nader bepalen
Het Granite-cijfer is 12.600 RTFx, gemeten op één NVIDIA H200 met batched inference — een cijfer van IBM, bij de lancering gemeld en sindsdien niet onafhankelijk gereproduceerd. RTFx is een verhouding tussen audioduur en verwerkingstijd, dus 12.600 betekent ongeveer 3,5 uur audio per seconde kloktijd. IBM formuleert het zelf als meer dan 20× de doorvoer van eerdere Granite Speech-releases, en dat is de bewering die hier echt telt: de versnelling kwam doordat er werk werd weggelaten, niet doordat er hardware werd toegevoegd.
Wat het niet is, is een latentiegetal. Een gebatchte taak die 3,5 uur audio per seconde afrondt, kan er nog steeds lang over doen om het eerste token van een individueel bestand terug te geven, afhankelijk van hoe de batch is samengesteld en hoeveel audio je erin stopt voordat deze begint. IBM publiceert helemaal geen latentiecijfers voor TurboCTC. Op de far-field-ranglijst zijn de twee checkpoints de twee snelste inzendingen, maar de doorvoer daar werd gemeten op een enkele NVIDIA L4, een accelerator die dicht tegen datacenterklasse aanleunt en geen telefoon is.
De reden dat dit ertoe doet, is dat het model expliciet is gepositioneerd voor laptops, telefoons en edge-apparaten — de eigen framing van IBM — en niemand heeft single-streamprestaties op een van die apparaten gepubliceerd. Totdat iemand dat doet, moet je "12,600×" behandelen als een uitspraak over hoe goedkoop je een backfill op gehuurde GPU's kunt wegwerken, wat een echt waardevolle en goed onderbouwde claim is, en niet als een uitspraak over hoe snel één gebruiker één zin terugkrijgt.
Wat IBM heeft verwijderd, en wat dat jou kost
TurboCTC is een encoder-only-ontwerp: een 16-laags akoestische Conformer-encoder die met CTC is getraind, greedy wordt gedecodeerd in één niet-autoregressieve pass, met een subwoord-uitvoerlaag van 16.384 eenheden. Er zit geen taalmodel in de lus. Daar komt de snelheid vandaan, en daar komen ook de functionele beperkingen vandaan, en die zijn niet gering. Vergeleken met eerdere Granite Speech-modellen laat TurboCTC spraakvertaling vallen, laat het trefwoordbias vallen en levert het geen tijdstempels of interpunctiegereedschap mee.
Zet dat af tegen wat het beheerde model voor zijn lijstprijs biedt, en de vorm van de transactie wordt concreet:
• Biasing van sleuteltermen — Granite Speech 5.0 470M TurboCTC heeft dit niet, tegenover maximaal 100 sleuteltermen per verzoek bij Grok Voice Transcribe 2.0
• Woordniveau-tijdstempels — niet meegeleverd met TurboCTC versus inbegrepen met betrouwbaarheidsscores
• Spraakvertaling — aanwezig in eerdere Granite Speech-modellen, hier verwijderd versus hoe dan ook niet aangeboden
• Taaldekking — alleen Engels versus automatische detectie over een uitgebreide meertalige invoerset met opmaakondersteuning in 25 talen
• Diarisatie — een apart probleem dat je zelf oplost vs inbegrepen in de prijs van de aanvraag
• Kanalen — één stream per doorgang versus tot acht audiokanalen in één verzoek
• Tekstnormalisatie — geen versus inverse tekstnormalisatie, waarbij gesproken datums, valuta en telefoonnummers naar geschreven vorm worden omgezet
• Implementatie — gewichten die je downloadt en zelf draait versus een beheerd endpoint in us-east-1
Lees die lijst als een beschrijving van twee verschillende producten, niet als een scorekaart. Het schrappen van diarisatie, biasing en normalisatie is wat de doorvoer heeft opgeleverd. Een batchbackfill van 40.000 gespreksopnames in een zoekindex heeft geen tijdstempels of sprekerbeurten nodig — het moet goedkoop zijn en het moet klaar zijn — en voor die taak ontbreken de ontbrekende functies niet: het is geschrapt gewicht.
Het omgekeerde geldt voor alles wat live is. Als je een voice-agent bouwt, is een lijst met sleuteltermen hoe je "Kubernetes" en "Granola" en klantnamen correct gespeld krijgt, en een transcriber zonder biasmechanisme krijgt ze elke keer fout, zonder andere manier om dat te verhelpen dan fine-tuning, wat een ander project met een ander budget is. Die ene ontbrekende functie diskwalificeert TurboCTC voor sommige workloads en is irrelevant voor andere, en daarom is de modelvergelijking minder nuttig dan een workloadvergelijking.

De nauwkeurigheidsvergelijking die niet zuiver kan worden gemaakt
IBM rapporteert een totale woordfoutpercentage van 5,00% voor het Apache 2.0-checkpoint en 4,85% voor het niet-commerciële broertje op de Open ASR Leaderboard, over openbare Engelse sets met korte spraakfragmenten. Dat zijn batchcijfers op een leaderboard waarvan de evaluaties AMI en Earnings22 en langere conversationele sets omvatten, en ze zijn door de leverancier gerapporteerd — ze zijn door de tooling van het leaderboard gehaald, maar nog niet opgenomen in de officiële tabel, die ook privétestsets bevat. De gepubliceerde uitsplitsing per set op de modelkaart is het lezen waard, want het gemiddelde verbergt veel: LS Clean 1,42%, LS Other 2,66%, SPGISpeech 3,18%, Voxpopuli-Cleaned-AA 4,88%, Earnings22-Cleaned-AA-chunked 6,69%, AMI-Cleaned 7,52% en Gigaspeech-Cleaned 8,67%, met een gemiddelde van precies 5,00%. Dezelfde kaart vermeldt een gemiddelde RTFx van 13.042,98 gemeten op één H200 — hoger dan het cijfer van 12.600 dat het lanceringsbericht van IBM gebruikte, en beide getallen zijn van het bedrijf zelf, uit dezelfde week, op dezelfde hardware.
Het cijfer van 2,7% voor het definitieve transcript van Grok Voice Transcribe 2.0 is geen vergelijkbare meting. Het komt van de AA-WER Streaming-board van Artificial Analysis, een gewogen samengestelde maatstaf van AA-AgentTalk voor 50%, VoxPopuli voor 25% en Earnings22 voor 25% — ongeveer acht uur agent-gewogen Engelstalige conversationele audio, gemeten via een streaming-interface. Andere datasets, andere weging, andere werkwijze. 2,7% naast 5,00% zetten en concluderen dat het beheerde model ongeveer twee keer zo nauwkeurig is, is de meest voorkomende fout die je in deze vergelijking kunt maken.
Wat eerlijk gezegd kan worden, is beperkter en toch nuttig. Beide modellen zijn sterk op de audio waarop elk van hen is gemeten. Grok Voice Transcribe 2.0 staat aan de leiding op een onafhankelijk beheerde streamingranglijst waarop andere modellen ook worden gemeten, wat zijn rangschikking controleerbaar maakt, zelfs als de exacte waarde ervan niet overdraagbaar is. Granite Speech 5.0 470M TurboCTC heeft een samengestelde WER op de standaard open ASR-sets en daarnaast een far-fieldresultaat waarbij de niet-commerciële checkpoint qua nauwkeurigheid op de vijfde plaats staat en de Apache-variant op de negende — gemeten op spraak met ruis en nagalm, de moeilijkste conditie in de set en misschien wel het eerlijkste onderdeel van de cijfers van beide modellen.
Als je audio schone, voorgelezen Engelstalige spraak is, is het nauwkeurigheidsverschil tussen deze twee waarschijnlijk kleiner dan de posities op de ranglijst doen vermoeden. Als die ruis bevat, een accent heeft, telefonisch of niet-Engelstalig is, vertelt geen van beide ranglijsten je veel en is je eigen testset het enige instrument dat dat wel doet.
Vrije gewichten tegen $1,67 per uur
De kostenvergelijking is de enige plek waar deze twee modellen echt gemakkelijk uit elkaar te houden zijn, en het getal dat mensen gewoonlijk aanhalen, klopt in beide richtingen niet.
• Batchtranscriptie — Grok Voice Transcribe 2.0 voor $0,10 per audio-uur, of ongeveer $1,67 per 1.000 minuten versus Granite Speech 5.0 470M TurboCTC zonder licentiekosten, plus GPU-tijd
• Streaming — $0,20 per audio-uur, ongeveer $3,33 per 1.000 minuten versus geen door IBM gepubliceerde gehoste streamingroute
• Licentie — een commerciële API zonder gewichten versus Apache 2.0 voor het hoofdcheckpoint en CC-BY-NC-SA-4.0 voor de nauwkeurigere niet-commerciële versie
"Free" doet veel werk in die eerste rij. Een encoder-only model van 470M is klein genoeg om op bescheiden hardware te draaien — dat is het punt van het ontwerp, en de reden dat IBM het in tien dagen op acht H100's trainde en het uitbracht tegen `transformers>=5.16.0` met een WebGPU-demo — maar iemand betaalt nog steeds voor de GPU, de servingstack, de autoscaling, de retries en de on-callrotatie. Bij kleine volumes is de managed prijs meestal goedkoper dan de engineeringtijd. Bij grote, stabiele volumes wint het pad van gehuurde hardware, en het omslagpunt is een functie van je bezettingsgraad, niet van je audiovolume: een GPU die je bezig houdt is goedkoop per uur, en een die je warm houdt voor piekverkeer is dat niet.
Eén licentiedetail is het vermelden waard voordat iemand daar zijn architectuur op afstemt. Het nauwkeurigste van de twee checkpoints, degene met 4,85% WER, is de niet-commerciële variant onder CC-BY-NC-SA-4.0. Het Apache 2.0-checkpoint is degene met 5,00%, en dat is degene die je in een product mag meeleveren. Dat is een nauwkeurigheidsverschil van 0,15 punt dat wordt ingeruild voor het recht om het model überhaupt te mogen gebruiken, en het betekent ook dat elke vergelijking die 4,85% noemt voor "Granite Speech 5.0" en vervolgens commerciële inzet bespreekt, het verkeerde checkpoint aanhaalt.

De beslissingsregel
Drie vragen onderscheiden deze twee modellen sneller dan welke benchmarktabel dan ook.
Wordt het transcript live gebruikt, terwijl de spreker nog aan het woord is? Zo ja, dan is TurboCTC niet de kandidaat — niet omdat het traag is, maar omdat het geen streaminginterface en geen gedeeltelijke uitvoer heeft, en een gedeeltelijk transcript is een andere architectuurkeuze dan een snelle batch-decodering. Zo nee, dan wordt het doorvoervoordeel het hele verhaal en is IBM's model zeer moeilijk te verslaan op het gebied van kosten per uur verwerkte audio.
Heeft het werk domeinwoordenschat nodig? Zo ja, dan is een model met biasing automatisch de winnaar, en is het ontbreken van key-term-biasing in TurboCTC diskwalificerend in plaats van louter ongemakkelijk. Zo nee, dan betaalt u voor een functie die u aan de beheerde zijde niet zult gebruiken.
Is de audio Engelse voorgelezen spraak op degelijke hardware? Zo ja, dan zijn beide sterk en gaat de keuze over operationele zaken. Zo nee, dan zijn beide boards niet informatief en telt alleen je eigen evaluatie.
Hoe dat ook uitpakt, de operationele laag is waar deze beslissing goedkoop wordt. OrcaRouter zet 200+ modellen achter één OpenAI-compatibele sleutel met automatische failover tussen providers, zodat een beheerd spraakeindpunt in één regio dat een slechte middag heeft niet langer jouw storing is, en de lijstprijs van de provider wordt doorgegeven tegen 0% opslag — wat betekent dat een prijswijziging van een leverancier of een nieuw checkpoint dezelfde dag nog live staat aan onze kant. Voor een workload waarbij het juiste antwoord echt onduidelijk is, haalt dat de kosten van een verkeerde keuze weg: benchmark beide tegen je eigen audio achter één eindpunt, houd degene die wint, en verander de modelstring wanneer de volgende uitkomt.

De korte versie: Granite Speech 5.0 470M TurboCTC is het betere antwoord op "alles wat we ooit hebben opgenomen goedkoop transcriberen, op hardware die wij beheren", en Grok Voice Transcribe 2.0 is het betere antwoord op "dit transcriberen terwijl het gebeurt, nauwkeurig, zonder dat wij de servingstack draaien". De 12.600×-kop en de 0,49 seconde-kop zijn beide waar en geen van beide is bewijs voor de andere.
