
Granite Speech 5.0 470M TurboCTC: IBM's Apache-2.0-ASR claimt 12.600 RTFx
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
Granite Speech 5.0 470M TurboCTC is het model in de nieuwe spraakrelease van IBM die je daadwerkelijk mag uitbrengen, en dat is het eerste dat je ervan moet weten. IBM plaatste op 25 augustus 2026 twee Engelse spraakherkenningscheckpoints op Hugging Face — Granite Speech 5.0 470M TurboCTC onder Apache 2.0 en Granite Speech 5.0 470M TurboCTC-NC onder een niet-commerciële CC-BY-NC-SA-4.0-licentie. Dezelfde architectuur met 470 miljoen parameters, andere data, tegenovergestelde licenties. Het Apache-model is het model dat IBM aanwijst voor 'andere use cases' — wat leverancierstaal is voor commerciële productie — en het is ook het model met het opvallende getal: IBM rapporteert een totale doorvoer van meer dan 12.600 RTFx op een enkele NVIDIA H200, wat neerkomt op meer dan drieënhalf uur Engelse audio die per seconde wordt getranscribeerd met batched inference.
Dat snelheidscijfer is een bewering van de fabrikant die een dag oud is en die door geen enkele derde partij is gereproduceerd, dus lees het als een sterk cijfer op papier in plaats van een gecontroleerd feit. De reden waarom het toch je aandacht verdient, is het ontwerp erachter: Granite Speech 5.0 TurboCTC laat de taalmodeldecoder weg die elk eerder Granite Speech-model gebruikte, waardoor er een zuivere Conformer-encoder overblijft die is getraind met connectionist temporal classification (CTC) en niet-autoregressief wordt gedecodeerd. Het is het ontbreken van een token-voor-token-generatielus waardoor een model met 470M parameters uiteindelijk beweert een doorvoer te halen die modellen verslaat die meerdere keren zo groot zijn — en dat is waarom deze release ertoe doet voor iedereen die spraak-naar-tekst bouwt, niet alleen voor de benchmarktabel.
Wat er daadwerkelijk is uitgebracht
Twee checkpoints, beide uitgebracht op 25 augustus 2026 op de ibm-granite Hugging Face org, beide Engelstalige ASR met dezelfde encoder-only architectuur:
• Granite Speech 5.0 470M TurboCTC — Apache 2.0, commercieel gebruik toegestaan, getraind op ongeveer 60.000 uur Engelstalige audio.
• Granite Speech 5.0 470M TurboCTC-NC — CC-BY-NC-SA-4.0, alleen voor onderzoek en niet-commercieel gebruik, getraind op ongeveer 75.000 uur Engelse audio.
Dit artikel gaat over het Apache-model — het model waar een product juridisch op kan vertrouwen — met de -NC-tegenhanger die wordt vermeld waar de licentiekwestie het vereist. Beide checkpoints worden geleverd als safetensors in F32 en BF16, en beide worden native ondersteund in Hugging Face Transformers via AutoModelForCTC en AutoProcessor. De feature wordt toegevoegd in de volgende Transformers-release; tot die tijd installeer je Transformers vanuit de broncode, laad je de processor en het model en voer je greedy decoding uit. IBM linkt ook naar een browsergebaseerde WebGPU-streamingdemo, de snelste manier om te horen hoe laag de latentie daadwerkelijk daalt.
De architectuurgok: een encoder, geen decoder, 12,5 tokens per seconde
Het ontwerp is het verhaal achter de snelheidsclaim. Eerdere Granite Speech-releases koppelden een akoestische encoder aan een projector en een taalmodel-decoder, en die decoder is precies wat is komen te vervallen. Granite Speech 5.0 470M TurboCTC is een 16-laags Conformer-encoder getraind met CTC, en inferentie is een enkele niet-autoregressieve greedy doorgang. Er is niets om te samplen, dus er is geen generatielatentie waarop gewacht moet worden.
Drie configuratiedetails maken het snel in plaats van alleen maar klein:
• Temporele subsampling met een factor 8. De front-end draait op 100 frames per seconde; het model produceert 12,5 tokens per seconde. Door log-mel-frames te stapelen en over te slaan, gevolgd door gestride convoluties en gepoolde residuen in de eerste twee Conformer-blokken, wordt de outputsnelheid in drie 2x-trappen verlaagd.
• Een subwoordvocabulaire in plaats van tekens. Eerdere Granite Speech-encoders genereerden 50 tekens per seconde; 5.0 genereert 12,5 subwoord-tokens per seconde uit een BPE-vocabulaire van 16.384 eenheden (SentencePiece in de -NC-variant). Minder output-eenheden per seconde audio betekent dat de CTC-decoder minder beslissingen hoeft te nemen.
• Self-conditioned CTC. De middelste Conformer-laag verfijnt de eigen tussenliggende representaties van het model, wat de truc is waarmee een kleine encoder zijn nauwkeurigheid kan behouden terwijl de decoder ontbreekt.
Dat alles staat in de modelkaart en de technische beschrijving van IBM. Het komt erop neer dat dit een checkpoint is dat is gebouwd voor laptops, telefoons en streaming-pijplijnen, waar een zware autoregressieve decoder niet zou passen — de edge-positionering is expliciet in IBM's eigen beschrijving.
De cijfers die IBM claimt
Alles in deze sectie is IBM-gerapporteerd, uitgevoerd via de publieke harness van de Open ASR-leaderboard op de Hugging Face-infrastructuur per 25 augustus 2026, en niet onafhankelijk gereproduceerd. Beschouw ze als leverancierscijfers die geloofwaardig lijken, niet als vaststaande waarheid:
• Doorvoer — meer dan 12.600 RTFx op een enkele NVIDIA H200 met batch-inferentie, wat IBM vertaalt als meer dan 3,5 uur audio per seconde. IBM voegt eraan toe dat dit meer dan 20x de doorvoer is van eerdere Granite Speech-modellen. Dit cijfer betreft een datacenter-GPU met batch-inferentie, niet wat een laptop je zal geven.
• Nauwkeurigheid — een totaal woordfoutenpercentage van 5,00% voor het Apache-model op de openbare Engelstalige korte-vorm testsets van de Open ASR-leaderboard (de -NC-variant scoort 4,85% op dezelfde sets). Inferentie werd uitgevoerd via de jobs-infrastructuur van Hugging Face en gescoord met de tooling van het leaderboard, dus IBM verwacht dat deze overeenkomen met de officiële tabel zodra de nieuwe modellen erin zijn opgenomen.
• Verre-veld — op het FFASR-leaderboard voor ruis en galm staat het Apache-model qua nauwkeurigheid op de negende plaats en het -NC-model op de vijfde, en deze twee zijn de snelste inzendingen op dat leaderboard (doorvoer gemeten op een enkele NVIDIA L4).
• Training — ongeveer 60.000 uur openbare Engelse audio voor het Apache-model, uitgevoerd in tien dagen op acht NVIDIA H100's op IBM's Blue Vela-cluster.

Wat Apache 2.0 je nu echt oplevert
Het bijzondere aan deze release zit in de licentie. Open-weight spraakmodellen verschijnen doorgaans onder onderzoekslicenties of met verplichtingen waar de juridische afdeling van een productieteam van huivert; hier is de commercieel bruikbare tegenhanger degene waar IBM iets lager op scoorde qua nauwkeurigheid. Je ruilt 0,15 punt van de geaggregeerde WER (5,00% vs 4,85%) in voor het recht om het in een product in te zetten, de output te gelde te maken, te fine-tunen en je afgeleide gewichten voor jezelf te houden, en om het in cloudinfrastructuur te gebruiken zonder een research-only-clausule die in de weg zit.
Die afweging is gemakkelijk in de verkeerde richting te maken als je de ranglijst najaagt. De 4,85% van het -NC-model komt van ongeveer 15.000 extra uren trainingsdata (GigaSpeech en SPGI Speech), en het is de versie die IBM letterlijk labelt als "alleen voor onderzoek en niet-commerciële doeleinden." Het is een prima benchmarkmodel en een slechte productafhankelijkheid. Het Apache-model verliest wat nauwkeurigheid en wint de mogelijkheid om de basis te vormen van een commerciële transcriptiepijplijn, een QA-systeem voor callcenters of een edge-apparaat. Als je deze familie evalueert, komt de licentiebeslissing vóór de benchmarkbeslissing.

Wat je opgeeft
Het weglaten van het taalmodel is niet gratis, en de modelkaart is eerlijk over de beperkingen:
• Geen spraakvertaling. Eerdere Granite Speech-generaties konden via een taalmodel vertalen terwijl ze transcribeerden; 5.0 is alleen transcriptie.
• Geen trefwoordbias. Het LM zorgde ook voor de bias naar domeintermen en namen; zonder die bias krijg je wat het subwoordvocabulaire van nature produceert.
• Alleen Engels. Er is geen meertalig checkpoint in deze release, en er is geen indicatie dat er binnenkort een komt.
• De 5,00% WER is een cijfer voor korte, schone audio. Het FFASR-resultaat (negende, op ruizige verre-veldspraak) is de meer realistische indicator voor gebruik in vergaderruimtes en handsfree, en het is een rang, geen headline-cijfer.
Voor een smalle transcriptietaak — telefoongesprekken, vergaderingen, spraakmemo's, ondertitels, dictatie — zijn deze geen belemmeringen. Ze zijn van belang als je hoopte dat één klein model ook zou vertalen, of dat het uit de doos een aangepaste woordenschat betrouwbaar zou transcriberen.
Hoe voer je het vandaag uit
Je hebt geen cloud-API nodig die nog niet bestaat. Het model draait lokaal:
• Installeer Transformers vanuit de bron (de CTC-featureset is nog niet in de nieuwste release), vervolgens AutoModelForCTC plus AutoProcessor en greedy decoding — de standaardpipeline. De processor kan log-mel-features berekenen op het apparaat van het model, waardoor een kopie van host naar apparaat wordt bespaard.
• Het modelkaartvoorbeeld is twee regels code via de pipeline: automatic-speech-recognition met het model "ibm-granite/granite-speech-5.0-470m-turboctc".
• Een WebGPU-streamingdemo draait in een browsertabblad en is de snelste manier om latentie te meten voordat je een middag besteedt aan een benchmarkopstelling.
• Voor productie is de praktische vraag het serving. Open ASR-modellen in deze klasse draaien doorgaans op CPU of een kleine GPU met zoiets als batched streaming inference — de 12.600 RTFx-kop is een H200-batchnummer; een realistisch single-streamgetal op een laptop zal veel lager liggen, en IBM heeft geen time-to-first-token-cijfers gepubliceerd.
Die servinglaag is waar de echte kosten en complexiteit van open ASR liggen, en het is ook waar een routeringsplatform zijn bestaansrecht bewijst. Het model van OrcaRouter is één API voor 200+ modellen, met de lijstprijs van de provider die zonder opslag (0% markup) wordt doorberekend — dus wanneer een leverancier een prijs verlaagt, is die verlaging dezelfde dag actief — plus automatische failover tussen providers en een routing-DSL om meerdere modellen te combineren in één aanroep. Niets daarvan is specifiek van toepassing op Granite Speech 5.0 470M TurboCTC, want geen van beide varianten staat al op OrcaRouter: de gewichten zijn een dag oud en geen enkele commerciële provider serveert ze. Wanneer een open spraakmodel als dit wél een gehost pad krijgt — of wanneer je het vergelijkt met de al bestaande gehoste ASR-API's — is een routeringslaag de manier om het uit te proberen en terug te vallen zonder de integratie te herschrijven, en is de doorberekening zonder opslag wat de vergelijking eerlijk houdt.
Wat is er nog onbevestigd?
Een model dat één dag oud is, heeft een kort papieren spoor, en het is de moeite waard om precies op te sommen wat er nog niet bekend is:
• Geen benchmark van derden. De 12.600 RTFx, de 5,00% WER en de FFASR-ranglijsten zijn allemaal IBM's eigen runs via de openbare leaderboard-harness. Geen onafhankelijke partij heeft cijfers gepubliceerd.
• Geen door IBM gehoste API. Er is geen watsonx-modelpagina, geen beheerd eindpunt, geen prijzen en geen datum voor wanneer dat allemaal beschikbaar komt.
• Geen streaming-latentiecijfers. Streaming-ondersteuning en een WebGPU-demo bestaan; time-to-first-token- en chunk-latentiecijfers niet.
• Geen vergelijking in dezelfde testopstelling met de andere snelle open ASR-modellen. De wedstrijden die ertoe doen — tegen Whisper large-v3, NVIDIA Parakeet TDT 0.6B en de gehoste transcriptie-API's — zijn door niemand nog op identieke gegevens uitgevoerd.
Wat nu te kijken
De signalen op de korte termijn zijn de onafhankelijke reproducties. Het Open ASR-leaderboard is openbaar, de harness is standaard en de gewichten staan op Hugging Face, dus een run door een derde partij zou binnen enkele dagen moeten verschijnen — let op of 5,00% standhoudt en of de 12.600 RTFx overleeft op een enkele H200 buiten IBM's eigen batchomgeving. Het andere punt om in de gaten te houden is of IBM de Apache-tweeling omzet in een beheerde dienst, aangezien een watsonx-endpoint dit onmiddellijk de open ASR met de meest geloofwaardige commerciële route zou maken. Granite Speech 5.0 470M TurboCTC is vanaf dag één een echt snelle, echt permissieve Engelse ASR met een echt dun verificatiespoor. De eerste twee zijn echt; de derde is een kwestie van tijd.

