
Granite Speech 5.0 470M TurboCTC: l'ASR Apache-2.0 di IBM dichiara 12.600 RTFx
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
Granite Speech 5.0 470M TurboCTC è il modello del nuovo rilascio vocale di IBM che puoi effettivamente distribuire, e questo è il primo aspetto da sapere. IBM ha pubblicato due checkpoint di riconoscimento vocale inglese su Hugging Face il 25 agosto 2026: Granite Speech 5.0 470M TurboCTC con licenza Apache 2.0 e Granite Speech 5.0 470M TurboCTC-NC con licenza non commerciale CC-BY-NC-SA-4.0. Stessa architettura da 470 milioni di parametri, dati diversi, licenze opposte. Il modello Apache è quello a cui IBM punta per "altri casi d'uso" — che in linguaggio da vendor significa produzione commerciale — ed è anche quello che porta il numero di punta: IBM riporta una produttività aggregata superiore a 12.600 RTFx su una singola NVIDIA H200, che traduce in più di tre ore e mezza di audio inglese trascritto al secondo con inferenza batch.
Quel dato sulla velocità è un'affermazione del fornitore vecchia di un giorno e non riprodotta da terze parti, quindi consideralo un numero forte sulla carta piuttosto che un fatto certificato. Il motivo per cui merita comunque la tua attenzione è il design che c'è dietro: Granite Speech 5.0 TurboCTC abbandona il decoder basato su modello linguistico che ogni precedente modello Granite Speech utilizzava, lasciando un puro encoder Conformer addestrato con classificazione temporale connessionistica (CTC) e decodificato in modo non autoregressivo. Niente loop di generazione token per token è il modo in cui un modello da 470M di parametri arriva a dichiarare una velocità di elaborazione che supera modelli molte volte più grandi — ed è il motivo per cui questa release è importante per chiunque costruisca sistemi di speech-to-text, non solo per la classifica dei benchmark.
Cosa è stato effettivamente spedito
Due checkpoint, entrambi rilasciati il 25 agosto 2026 sull'organizzazione ibm-granite di Hugging Face, entrambi ASR solo inglese con la stessa architettura solo encoder:
• Granite Speech 5.0 470M TurboCTC — Apache 2.0, uso commerciale consentito, addestrato su circa 60.000 ore di audio in inglese.
• Granite Speech 5.0 470M TurboCTC-NC — CC-BY-NC-SA-4.0, solo per ricerca e uso non commerciale, addestrato su circa 75.000 ore di audio in inglese.
Questo articolo riguarda il modello Apache — quello da cui un prodotto può legalmente dipendere — con il gemello -NC citato dove la storia delle licenze lo richiede. Entrambi i checkpoint sono distribuiti come safetensors in F32 e BF16, ed entrambi hanno supporto nativo in Hugging Face Transformers tramite AutoModelForCTC e AutoProcessor. La funzionalità arriva con la prossima release di Transformers; fino ad allora si installa Transformers dalla sorgente, si caricano processor e modello, e si esegue la decodifica greedy. IBM collega anche una demo di streaming basata su WebGPU nel browser, che è il modo più rapido per sentire quanto sia bassa la latenza effettiva.
La scommessa sull'architettura: un encoder, nessun decoder, 12,5 token al secondo
Il cambiamento di progettazione è la storia dietro l'affermazione sulla velocità. Le versioni precedenti di Granite Speech abbinavano un encoder acustico a un proiettore e a un decoder del modello linguistico, ed è proprio quel decoder che è stato eliminato. Granite Speech 5.0 470M TurboCTC è un encoder Conformer a 16 livelli addestrato con CTC, e l'inferenza è un singolo passaggio greedy non autoregressivo. Non c'è nulla da campionare, quindi non c'è latenza di generazione da attendere.
Tre dettagli di configurazione lo rendono veloce, non solo piccolo:
• Sottocampionamento temporale di un fattore 8. Il front-end opera a 100 frame al secondo; il modello produce 12,5 token al secondo. L'impilamento e il salto di frame log-mel, seguito da convoluzioni strided e residuali pooled nei primi due blocchi Conformer, riducono la frequenza di output in tre stadi da 2x.
• Un vocabolario di subword invece di caratteri. I precedenti encoder di Granite Speech emettevano 50 caratteri al secondo; la versione 5.0 emette 12,5 token di subword al secondo da un vocabolario BPE di 16.384 unità (SentencePiece nella variante -NC). Meno unità di output per secondo di audio significa che il decoder CTC ha meno decisioni da prendere.
• CTC auto-condizionato. Il layer Conformer intermedio raffina le rappresentazioni intermedie del modello stesso, che è il trucco che permette a un piccolo encoder di mantenere la propria accuratezza quando il decoder è assente.
Tutto questo è riportato nella scheda del modello e nel documento tecnico IBM. In sintesi, si tratta di un checkpoint pensato per laptop, telefoni e pipeline di streaming, dove un decoder autoregressivo pesante non troverebbe spazio — il posizionamento edge è esplicito nella descrizione stessa di IBM.
I numeri che IBM sta dichiarando
Tutto ciò che è riportato in questa sezione è dichiarato da IBM, è stato eseguito tramite l'harness pubblico della classifica Open ASR sull'infrastruttura Hugging Face al 25 agosto 2026 e non è stato riprodotto in modo indipendente. Considerateli come numeri del fornitore che sembrano credibili, non come verità assodata:
• Throughput — oltre 12.600 RTFx su una singola NVIDIA H200 con inferenza batch, che IBM traduce in più di 3,5 ore di audio al secondo. IBM aggiunge che si tratta di oltre 20 volte il throughput dei precedenti modelli Granite Speech. Si tratta di un dato relativo a GPU da datacenter e inferenza batch, non di ciò che un laptop riesce a fornire.
Precisione: un tasso di errore aggregato sulle parole del 5,00% per il modello Apache sui set di test pubblici in inglese in forma breve della classifica Open ASR (la variante -NC ottiene il 4,85% sugli stessi set). L'inferenza è stata eseguita tramite l'infrastruttura di job di Hugging Face e valutata con gli strumenti della classifica, quindi IBM prevede che questi risultati corrisponderanno alla tabella ufficiale una volta che i nuovi modelli saranno incorporati in essa.
• Far-field — nella leaderboard FFASR per ambienti rumorosi e riverberanti, il modello Apache si classifica nono per accuratezza e il modello -NC quinto, e i due sono le voci più veloci in quella classifica (throughput misurato su una singola NVIDIA L4).
Training — circa 60.000 ore di audio pubblico in inglese per il modello Apache, effettuato in dieci giorni su otto NVIDIA H100 sul cluster Blue Vela di IBM.

Cosa ti dà realmente Apache 2.0
La licenza è ciò che rende questa release insolita. I modelli vocali open-weight tendono a uscire con licenze di ricerca o con obblighi che fanno storcere il naso al reparto legale di un team di produzione; qui, il gemello utilizzabile a livello commerciale è quello su cui IBM ha ottenuto un punteggio leggermente inferiore in termini di precisione. Scambi 0,15 punti di WER aggregato (5,00% contro 4,85%) per il diritto di distribuire il modello in un prodotto, monetizzare l'output, fare fine-tuning e tenere per sé i pesi derivati, e usarlo in infrastruttura cloud senza che una clausola di solo-ricerca si metta in mezzo.
È facile fare questo scambio nella direzione sbagliata se insegui la classifica. Il 4,85% del modello -NC deriva da circa 15.000 ore extra di dati di addestramento (GigaSpeech e SPGI Speech), ed è la versione che IBM etichetta letteralmente "solo per scopi di ricerca e non commerciali". È un buon modello di benchmark ma una cattiva dipendenza di prodotto. Il modello Apache perde un po' di precisione e guadagna la capacità di essere la base di una pipeline di trascrizione commerciale, di un sistema di QA per call center o di un dispositivo edge. Se stai valutando questa famiglia, la decisione sulla licenza viene prima della decisione sul benchmark.

Ciò a cui rinunci
Rimuovere il modello linguistico non è privo di costi, e la model card è onesta riguardo ai tagli:
• Nessuna traduzione vocale. Le precedenti generazioni di Granite Speech potevano passare attraverso un modello linguistico per tradurre mentre trascrivevano; la 5.0 è solo trascrizione.
• Nessun bias di parole chiave. Il LM gestiva anche il bias verso termini di dominio e nomi; senza di esso, si ottiene ciò che il vocabolario subword produce naturalmente.
• Solo inglese. Non c'è alcun checkpoint multilingue in questa release, e nessuna indicazione che uno arriverà presto.
• Il 5,00% di WER è un dato relativo a un formato breve e audio pulito. Il risultato FFASR (nono, su parlato far-field rumoroso) è l'indicatore più realistico per l'uso in sale riunioni e in modalità vivavoce, ed è un rango, non un numero di punta.
Per un lavoro di trascrizione ristretto — audio di chiamate, riunioni, memo vocali, sottotitoli, dettatura — nessuno di questi è un ostacolo. Contano se speravi che un piccolo modello potesse anche tradurre, o trascrivere in modo affidabile un vocabolario personalizzato fin da subito.
Come eseguirlo oggi
Non hai bisogno di un'API cloud che non esiste ancora. Il modello viene eseguito localmente:
Installa Transformers dal sorgente (il set di funzionalità CTC non è ancora nella release più recente), poi AutoModelForCTC più AutoProcessor e decodifica greedy — la pipeline standard. Il processore può calcolare le caratteristiche log-mel sul dispositivo del modello, risparmiando una copia da host a dispositivo.
• L'esempio nella scheda del modello è di due righe tramite pipeline: automatic-speech-recognition con il modello "ibm-granite/granite-speech-5.0-470m-turboctc".
• Una demo di streaming WebGPU viene eseguita in una scheda del browser ed è il modo più rapido per valutare la latenza prima di dedicare un pomeriggio a un harness di benchmark.
• Per la produzione, la questione pratica è il serving. I modelli ASR open di questa classe vengono tipicamente eseguiti su CPU o su una piccola GPU con qualcosa come l'inferenza in streaming batch — il dato di 12.600 RTFx è un numero batch H200; un valore realistico per un laptop a flusso singolo sarà molto più basso, e IBM non ha pubblicato i dati relativi al time-to-first-token.
{{1}}Quello strato di serving è dove risiedono i costi e la complessità reali dell'ASR open, ed è anche dove una piattaforma di routing dimostra il proprio valore.{{/1}} {{2}}Il modello di OrcaRouter è una singola API su oltre 200 modelli, con il prezzo di listino del provider trasferito a margine zero — quindi quando un fornitore taglia un prezzo, il taglio è attivo lo stesso giorno — più failover automatico tra provider e un DSL di routing per comporre più modelli in un'unica chiamata.{{/2}} {{3}}Niente di tutto ciò si applica specificamente a Granite Speech 5.0 470M TurboCTC, perché nessuna delle due varianti è ancora su OrcaRouter: i pesi hanno un giorno di vita e nessun provider commerciale li sta servendo.{{/3}} {{4}}Quando un modello vocale open come questo ottiene un percorso di hosting — o quando lo si confronta con le API ASR ospitate già disponibili — un livello di routing è il modo per provarlo e ripiegare su altro senza riscrivere l'integrazione, e il prezzo a margine zero è ciò che mantiene onesto il confronto.{{/4}}
Cosa non è ancora stato confermato
Un modello di un giorno ha una breve traccia documentale, e vale la pena elencare esattamente ciò che non è ancora noto:
• Nessun benchmark di terze parti. I 12,600 RTFx, il 5.00% WER e le classifiche FFASR sono tutti risultati IBM ottenuti tramite il banco di prova della classifica pubblica. Nessun soggetto indipendente ha pubblicato numeri.
• Nessuna API ospitata da IBM. Non esiste una pagina del modello watsonx, nessun endpoint gestito, nessun prezzo e nessuna data per quando tutto questo arriverà.
• Nessun dato sulla latenza dello streaming. Esistono supporto allo streaming e una demo WebGPU; non sono invece disponibili i valori per il tempo al primo token e la latenza dei chunk.
• Nessun confronto con lo stesso harness contro gli altri modelli ASR open veloci. I confronti che contano — contro Whisper large-v3, NVIDIA Parakeet TDT 0.6B e le API di trascrizione ospitate — non sono ancora stati eseguiti su dati identici da nessuno.
Cosa guardare dopo
I segnali a breve termine sono le riproduzioni indipendenti. La classifica Open ASR è pubblica, l'harness è standard e i pesi sono su Hugging Face, quindi un'esecuzione di terze parti dovrebbe arrivare entro pochi giorni — resta da vedere se il 5,00% regge e se i 12.600 RTFx sopravvivono su una singola H200 al di fuori della configurazione batch di IBM. L'altra cosa a cui prestare attenzione è se IBM trasformerà il gemello Apache in un servizio gestito, poiché un endpoint watsonx renderebbe all'istante questo l'ASR open con il percorso commerciale più credibile. Granite Speech 5.0 470M TurboCTC è, fin dal primo giorno, un ASR inglese genuinamente veloce, genuinamente permissivo, con una traccia di verifica genuinamente sottile. I primi due sono reali; il terzo è una questione di tempo.

