Hjälte-titelkort för Granite Speech 5.0 470M TurboCTC, som visar en ikon för talvågform, ett märke med texten 12,600 RTFx på 1 H200, etiketter med texten 470M parametrar, Encoder-only CTC och Apache 2.0, en undertitel 'IBMs Apache-2.0 engelska ASR', en sidfot med texten Utgiven 25 aug 2026, och OrcaRouter-logotypen i nedre högra hörnet.
Guides & Insights

Granite Speech 5.0 470M TurboCTC: IBM:s Apache-2.0 ASR hävdar 12 600 RTFx

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Granite Speech 5.0 470M TurboCTC är modellen i IBMs nya tal-släpp som du faktiskt har tillåtelse att leverera, och det är det första du behöver veta om den. IBM lade upp två engelska taligenkännings-checkpoints på Hugging Face den 25 augusti 2026 — Granite Speech 5.0 470M TurboCTC under Apache 2.0 och Granite Speech 5.0 470M TurboCTC-NC under en icke-kommersiell CC-BY-NC-SA-4.0-licens. Samma arkitektur med 470 miljoner parametrar, olika data, motsatt licensiering. Apache-modellen är den som IBM pekar på för "andra användningsfall" — vilket är leverantörsspråk för kommersiell produktion — och det är också den som bär rubriksiffran: IBM rapporterar aggregerat genomflöde på över 12 600 RTFx på en enda NVIDIA H200, vilket IBM översätter till mer än tre och en halv timme transkriberat engelskt ljud per sekund med batchinferens.

Den där hastighetssiffran är ett leverantörspåstående som är en dag gammalt och inte reproducerats av någon tredje part, så läs det som ett starkt pappersvärde snarare än en granskad fakta. Anledningen till att det ändå är värt din uppmärksamhet är designen bakom: Granite Speech 5.0 TurboCTC tar bort språkmodellsavkodaren som varje tidigare Granite Speech-modell använde, och lämnar kvar en ren Conformer-encoder tränad med connectionist temporal classification (CTC) och avkodad icke-autoregressivt. Det är frånvaron av en token-för-token-genereringsloop som gör att en modell med 470M parametrar kan göra anspråk på genomströmning som slår modeller flera gånger så stora – och det är därför den här releasen är viktig för alla som bygger tal-till-text, inte bara för benchmarks-tabellen.

Vad som faktiskt levererades

Två checkpoints, båda släppta den 25 augusti 2026 på ibm-granite Hugging Face-org, båda engelska-only ASR med samma encoder-only-arkitektur:

• Granite Speech 5.0 470M TurboCTC — Apache 2.0, kommersiell användning tillåten, tränad på ungefär 60 000 timmar engelskt ljud.

• Granite Speech 5.0 470M TurboCTC-NC — CC-BY-NC-SA-4.0, endast för forskning och icke-kommersiellt bruk, tränad på cirka 75 000 timmar engelskt ljud.

Den här artikeln handlar om Apache-modellen — den som en produkt lagligen kan förlita sig på — med -NC-tvillingen omnämnd där licenshistorien kräver det. Båda checkpoints levereras som safetensors i F32 och BF16, och båda har inbyggt stöd i Hugging Face Transformers genom AutoModelForCTC och AutoProcessor. Funktionen kommer i nästa Transformers-utgåva; tills dess installerar du Transformers från källkod, laddar processor och modell, och kör greedy decoding. IBM länkar också en webbläsarbaserad WebGPU-streamingdemo, vilket är det snabbaste sättet att höra hur låg latensen faktiskt är.

Arkitektur-satsningen: en encoder, ingen decoder, 12,5 tokens per sekund

Designändringen är historien bakom hastighetspåståendet. Tidigare Granite Speech-versioner parade ihop en akustisk kodare med en projektor och en språkmodell-avkodare, och det är den avkodaren som togs bort. Granite Speech 5.0 470M TurboCTC är en 16-lagers Conformer-kodare tränad med CTC, och inferens är ett enda icke-autoregressivt girigt pass. Det finns inget att sampla, så det finns ingen genereringslatens att vänta på.

Tre konfigurationsdetaljer gör den snabb snarare än bara liten:

• Temporal nedsampling med en faktor 8. Front-end körs i 100 bildrutor per sekund; modellen ger 12,5 tokens per sekund. Stapling och överhoppning av log-mel-bildrutor, följt av stegade faltningar och poolade residualer i de två första Conformer-blocken, sänker utmatningstakten i tre 2x-steg.

• En delordsvokabulär istället för tecken. Tidigare Granite Speech-kodare genererade 50 tecken per sekund; 5.0 genererar 12,5 delordstoken per sekund från en BPE-vokabulär med 16 384 enheter (SentencePiece i -NC-varianten). Färre utenheter per sekund ljud innebär att CTC-avkodaren har färre beslut att fatta.

• Självbetingad CTC. Det mittersta Conformer-lagret förfinar modellens egna mellanliggande representationer, vilket är tricket som låter en liten encoder behålla sin noggrannhet medan avkodaren har tagits bort.

Allt detta finns i modellkortet och IBMs tekniska dokumentation. Det kokar ner till en checkpoint byggd för bärbara datorer, telefoner och strömningspipelines där en tung autoregressiv avkodare inte skulle få plats — positioneringen vid kanten är uttrycklig i IBMs egen beskrivning.

De siffror som IBM hävdar

Allt i det här avsnittet är IBM-rapporterat, kört genom Open ASR-ledartavlans offentliga testmiljö på Hugging Face-infrastruktur per den 25 augusti 2026, och inte oberoende reproducerat. Behandla dem som leverantörssiffror som ser trovärdiga ut, inte som fastställd sanning:

• Genomströmning — över 12 600 RTFx på en enda NVIDIA H200 med batchinferens, vilket IBM översätter till mer än 3,5 timmar ljud per sekund. IBM tillägger att detta är över 20 gånger genomströmningen hos tidigare Granite Speech-modeller. Detta är en siffra för datacenter-GPU med batchinferens, inte vad en bärbar dator ger dig.

• Noggrannhet — en aggregerad ordfelsfrekvens på 5,00 % för Apache-modellen på Open ASR-ledartavlans publika engelska kortformstestset (-NC-varianten får 4,85 % på samma testset). Inferensen kördes genom Hugging Faces jobbinfrastruktur och poängsattes med ledartavlans verktyg, så IBM förväntar sig att dessa matchar den officiella tabellen när de nya modellerna har införlivats i den.

• Fjärrfält — på FFASR:s leaderboard för bullriga och efterklangsfyllda ljud rankas Apache-modellen nia i noggrannhet och -NC-modellen femma, och de två är de snabbaste bidragen på den listan (genomströmning mätt på en enda NVIDIA L4).

• Träning — ungefär 60 000 timmar offentlig engelsk ljuddata för Apache-modellen, genomfört på tio dagar på åtta NVIDIA H100:or i IBMs Blue Vela-kluster.

A generated single-column scoreboard titled 'Granite Speech 5.0 470M TurboCTC — the scoreboard' with rows reading Release Aug 25 2026, License Apache 2.0, Params 470M, Speed 12,600 RTFx (1 H200), WER 5.00% Open ASR, FFASR rank 9 fastest on board, and a footer reading 'IBM-reported as of Aug 25 2026; not yet independently reproduced.'

Vad Apache 2.0 faktiskt ger dig

Licensen är det som gör den här releasen ovanlig. Open-weight-talmodeller brukar komma med forskningslicenser eller villkor som får ett produktionsbolags legalavdelning att rygga tillbaka; här är det den kommersiellt användbara tvillingen som IBM fick något lägre träffsäkerhet på. Du byter 0,15 poäng i aggregerad WER (5,00 % mot 4,85 %) mot rätten att distribuera i en produkt, tjäna pengar på utdata, finjustera och behålla dina härledda vikter för dig själv, samt använda modellen i molninfrastruktur utan en forskningsklausul i vägen.

Det är lätt att göra den avvägningen i fel riktning om du jagar topplistan. -NC-modellens 4,85 % kommer från ungefär 15 000 extra timmar av träningsdata (GigaSpeech och SPGI Speech), och det är den version som IBM bokstavligen märker ”endast för forskning och icke-kommersiella ändamål.” Den är en utmärkt benchmarkmodell men ett dåligt produktberoende. Apache-modellen förlorar lite noggrannhet och vinner möjligheten att vara basen för en kommersiell transkriptionspipeline, ett QA-system för callcenter eller en edge-enhet. Om du utvärderar den här familjen kommer licensbeslutet före benchmarkbeslutet.

A screenshot of the Hugging Face model page for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 license tag, the automatic-speech-recognition and English pipeline tags, a model card summary describing a compact 470 million parameter English ASR model trained on approximately 60,000 hours of English audio using CTC with non-autoregressive greedy decoding, and an Open ASR leaderboard evaluation line dated August 25 2026.

Vad du ger upp

Att slopa språkmodellen är inte gratis, och modellkortet är ärligt om nedskärningarna:

• Ingen talöversättning. Tidigare Granite Speech-generationer kunde passera genom en språkmodell för att översätta medan de transkriberade; 5.0 är endast transkribering.

• Ingen nyckelordsbias. Språkmodellen hanterade även bias mot domäntermer och namn; med den borta får du det som subvokabulären naturligt producerar.

• Endast engelska. Det finns ingen flerspråkig kontrollpunkt i den här utgåvan, och ingen indikation på att en kommer snart.

• 5,00 % WER är en siffra för kortform och ren ljudkvalitet. FFASR-resultatet (nionde, på brusigt fjärrfältstal) är den mer realistiska indikatorn för mötesrum och handsfree-användning, och det är en rankning, inte en rubriksiffra.

För ett smalt transkriberingsjobb – samtalsljud, möten, röstmemon, undertexter, diktamen – är inget av dessa ett hinder. De spelar roll om du hoppades att en liten modell också skulle översätta, eller tillförlitligt transkribera ett anpassat ordförråd direkt ur lådan.

Hur man kör det idag

Du behöver inte ett moln-API som inte finns ännu. Modellen körs lokalt:

• Installera Transformers från källkod (CTC-funktionsuppsättningen finns ännu inte i den senaste utgåvan), därefter AutoModelForCTC plus AutoProcessor och girig avkodning – standardpipelinen. Processorn kan beräkna log-mel-funktioner på modellens enhet, vilket sparar en kopia från värd till enhet.

Modellexemplet är en tvåradare via pipeline: automatisk taligenkänning med modellen "ibm-granite/granite-speech-5.0-470m-turboctc".

• En WebGPU-streamingdemo körs i en webbläsarflik och är det snabbaste sättet att bedöma latensen innan du lägger en eftermiddag på en benchmark-miljö.

• För produktion är den praktiska frågan serving. Öppna ASR-modeller i denna klass körs vanligtvis på CPU eller ett litet GPU med något som batchad strömmande inferens — rubriksiffran 12 600 RTFx är ett H200-batchnummer; en realistisk enkelströmmande laptopsiffra kommer att vara mycket lägre, och IBM har inte publicerat siffror för tid-till-första-token.

Det serveringslagret är där den verkliga kostnaden och komplexiteten för öppen ASR ligger, och det är också där en routingplattform gör skäl för sig. OrcaRouters modell är ett API över 200+ modeller där leverantörens listpris skickas vidare med 0 % påslag – så när en leverantör sänker ett pris är sänkningen live samma dag – plus automatisk failover mellan leverantörer och en routing-DSL för att komponera flera modeller till ett enda anrop. Inget av det gäller specifikt Granite Speech 5.0 470M TurboCTC, eftersom ingen av varianterna finns på OrcaRouter ännu: vikterna är en dag gamla och ingen kommersiell leverantör serverar dem. När en öppen talmodell som denna väl får en värdbaserad väg – eller när du jämför den med de värdbaserade ASR-API:er som redan finns – är ett routinglager hur du provar den och faller tillbaka utan att skriva om integrationen, och pass-through-prissättningen är det som håller jämförelsen ärlig.

Vad är fortfarande obekräftat

En endagarsgammal modell har ett kort pappersspår, och det är värt att lista exakt vad som ännu inte är känt:

• Ingen tredjepartsbenchmark. De 12 600 RTFx, 5,00 % WER och FFASR-rankningarna är alla IBM:s egna körningar genom den offentliga leaderboard-plattformen. Ingen oberoende part har publicerat siffror.

• Inget IBM-hostat API. Det finns ingen watsonx-modellsida, ingen hanterad slutpunkt, ingen prissättning och inget datum för när något av detta kommer.

• Inga siffror för streaminglatens. Streamingstöd och en WebGPU-demo finns; siffror för tid-till-första-token och chunklatens finns inte.

• Ingen jämförelse i samma testmiljö mot de andra snabba öppna ASR-modellerna. De matcher som betyder något — mot Whisper large-v3, NVIDIA Parakeet TDT 0.6B och de värdbaserade transkriptions-API:erna — har ännu inte körts på identiska data av någon.

Vad du ska titta på härnäst

Kortsiktiga signaler är de oberoende reproduktionerna. Open ASR-leaderboarden är publik, testselen är standard, och vikterna ligger på Hugging Face, så en tredjepartskörning borde landa inom några dagar — håll koll på om 5,00 % håller och om 12 600 RTFx överlever på en enskild H200 utanför IBMs egen batchmiljö. Det andra att bevaka är om IBM förvandlar Apache-tvillingen till en hanterad tjänst, eftersom en watsonx-slutpunkt omedelbart skulle göra detta till den öppna ASR-modellen med den mest trovärdiga kommersiella vägen. Granite Speech 5.0 470M TurboCTC är, dag ett, en genuint snabb, genuint tillåtande engelsk ASR-modell med ett genuint tunt verifieringsspår. De två första är verkliga; det tredje är en tidsfråga.

A generated infographic titled '3.5 hours of audio in 1 second' showing an H200 GPU card, an audio stack and a finished transcript connected by arrows, with tags reading over 12,600 RTFx, batched inference, Apache 2.0, and IBM-reported Aug 25 2026, and the OrcaRouter logo in the bottom-right corner.
© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube