Card hero dell'articolo con la scritta 'Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC', con il badge 'CONFRONTO MODELLI' e il sottotitolo 'throughput contro latenza', con chip che riportano 12.600 RTFx, 2,7% WER in streaming, 470M parametri e 0,20 $ per ora di streaming, su un gradiente dal bianco al blu con il logo OrcaRouter in basso a destra.
Guides & Insights

Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC: 12.600× in tempo reale incontra mezzo secondo

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Granite Speech 5.0 470M TurboCTC trascrive circa 3,5 ore di audio al secondo su una singola H200, e Grok Voice Transcribe 2.0 restituisce una prima trascrizione parziale 0,49 secondi dopo che hai smesso di parlare. Questi due numeri vengono messi uno accanto all’altro nei post di confronto come se fossero lo stesso tipo di misurazione, e non sono neanche lontanamente lo stesso tipo di misurazione — uno è un valore di throughput batch di datacenter senza alcuna latenza associata, l’altro è un valore di latenza di un modello il cui throughput nessuno ha pubblicato. IBM ha rilasciato Granite Speech 5.0 470M TurboCTC il 25 agosto 2026 con licenza Apache 2.0, eliminando del tutto il decoder del modello linguistico e decodificando con un singolo passaggio CTC non autoregressivo. SpaceXAI ha reso disponibile Grok Voice Transcribe 2.0 il 18 settembre 2026 come API gestita a 0,10 $ per ora di audio per il batch e 0,20 $ per ora per lo streaming. Sono entrambi ottimi modelli di trascrizione che risolvono le due metà opposte dello stesso problema, e scegliere tra i due è più facile una volta che smetti di confrontare direttamente i numeri.

12.600× tempo reale, e le parole che lo qualificano

Il dato di Granite è 12.600 RTFx misurato su una singola NVIDIA H200 con inferenza in batch — il numero di IBM, riportato al lancio e da allora non riprodotto in modo indipendente. RTFx è un rapporto tra la durata dell'audio e il tempo di elaborazione, quindi 12.600 significa circa 3,5 ore di audio per secondo di tempo reale. La presentazione fornita da IBM stessa è che si tratta di più di 20 volte il throughput delle precedenti versioni di Granite Speech, che è l'affermazione che conta davvero qui: l'accelerazione è derivata dall'eliminazione di lavoro, non dall'aggiunta di hardware.

Quello che non è è un numero di latenza. Un job in batch che completa 3,5 ore di audio al secondo può comunque impiegare molto tempo per restituire il primo token di qualsiasi file individuale, a seconda di come è assemblato il batch e di quanto audio gli si fornisce prima che inizi. IBM non pubblica alcun dato di latenza per TurboCTC. Nella classifica far-field i due checkpoint sono le due voci più veloci, ma il throughput lì è stato misurato su una singola NVIDIA L4, che è un acceleratore adiacente ai datacenter e non un telefono.

Il motivo per cui questo conta è che il modello è esplicitamente posizionato per laptop, telefoni e dispositivi edge — è la stessa presentazione di IBM — e nessuno ha pubblicato prestazioni single-stream su nessuno di questi. Finché qualcuno non lo farà, considerate "12.600×" come un'affermazione su quanto economicamente si possa macinare un backfill su GPU a noleggio, che è un'affermazione davvero preziosa e ben documentata, e non come un'affermazione su quanto velocemente un singolo utente riceva indietro una frase.

Cosa ha rimosso IBM, e quanto ti costa

TurboCTC è un'architettura solo encoder: un encoder acustico Conformer a 16 livelli addestrato con CTC, decodificato in modo greedy in una singola passata non autoregressiva, con uno strato di output subword da 16.384 unità. Non c'è alcun modello linguistico nel ciclo. Da qui deriva la velocità, ed è anche da qui che derivano i tagli alle capacità, e non sono piccoli. Rispetto ai precedenti modelli Granite Speech, TurboCTC elimina la traduzione vocale, elimina il keyword biasing e non include timestamp né strumenti per la punteggiatura.

Confrontalo con ciò che il modello gestito include al suo prezzo di listino e la forma dell’operazione diventa concreta:

• Bias dei termini chiave — Granite Speech 5.0 470M TurboCTC non ne ha alcuno rispetto a un massimo di 100 termini chiave per richiesta su Grok Voice Transcribe 2.0

• Timestamp a livello di parola — non forniti con TurboCTC vs inclusi con punteggi di confidenza

• Traduzione vocale — presente nei precedenti modelli Granite Speech, rimossa qui rispetto a non offerta in nessuno dei due casi

• Copertura linguistica — solo inglese vs rilevamento automatico su un insieme di input ampiamente multilingue con supporto alla formattazione in 25 lingue

• Diarizzazione — un problema separato che risolvi da solo vs incluso nel prezzo della richiesta

• Canali — un flusso per passata rispetto a un massimo di otto canali audio in una singola richiesta

• Normalizzazione del testo — nessuna vs normalizzazione inversa del testo che converte date, valute e numeri di telefono dal parlato alla forma scritta

• Distribuzione — pesi che scarichi ed esegui vs un endpoint gestito in us-east-1

Leggi quell'elenco come la descrizione di due prodotti diversi anziché come una scheda di valutazione. Rimuovere la diarizzazione, il biasing e la normalizzazione è ciò che ha permesso di guadagnare il throughput. Un backfill in batch di 40.000 registrazioni di chiamate in un indice di ricerca non ha bisogno di timestamp o di turni di parola — deve essere economico e deve finire — e per quel lavoro le funzionalità assenti non sono assenti: sono peso eliminato.

Vale il contrario per qualsiasi cosa in tempo reale. Se stai costruendo un agente vocale, un elenco di termini chiave è il modo in cui fai scrivere correttamente "Kubernetes", "Granola" e i nomi dei clienti, e un trascrittore senza un meccanismo di bias li sbaglierà ogni volta, senza alcun modo di rimediare se non il fine-tuning, che è un progetto diverso con un budget diverso. Quella singola funzionalità mancante squalifica TurboCTC da alcuni carichi di lavoro ed è irrilevante per altri, ed è per questo che il confronto tra modelli è meno utile di un confronto tra carichi di lavoro.

Screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 licence tag, the English and automatic-speech-recognition tags, a model summary describing a 470 million parameter conformer acoustic encoder trained with CTC on 60,000 hours of English audio and decoded non-autoregressively, and a bar chart of Open ASR leaderboard WER by test set — LS Clean 1.42, LS Other 2.66, SPGISpeech 3.18, Voxpopuli-Cleaned-AA 4.88, Earnings22-Cleaned-AA-chunked 6.69, AMI-Cleaned 7.52 and Gigaspeech-Cleaned 8.67 — with an average WER of 5.00% and an average RTFx of 13,042.98 measured on one H200.

Il confronto di accuratezza che non può essere effettuato in modo pulito

IBM riporta un tasso di errore di parola aggregato del 5,00% per il checkpoint Apache 2.0 e del 4,85% per la controparte non commerciale sulla Open ASR Leaderboard, su set pubblici di inglese short-form. Questi sono numeri batch su una classifica le cui valutazioni includono AMI e Earnings22 e set conversazionali long-form, e sono riportati dal fornitore — eseguiti tramite gli strumenti della leaderboard ma non ancora assorbiti nella tabella ufficiale, che include anche set di test privati. La suddivisione per set pubblicata sulla scheda del modello vale la pena leggerla, perché la media nasconde molto: LS Clean 1,42%, LS Other 2,66%, SPGISpeech 3,18%, Voxpopuli-Cleaned-AA 4,88%, Earnings22-Cleaned-AA-chunked 6,69%, AMI-Cleaned 7,52% e Gigaspeech-Cleaned 8,67%, con una media esattamente del 5,00%. La stessa scheda riporta un RTFx medio di 13.042,98 misurato su un H200 — superiore al valore di 12.600 utilizzato nel post di lancio di IBM, ed entrambi i numeri sono dell'azienda, della stessa settimana, sullo stesso hardware.

Il dato del 2,7% sulla trascrizione finale di Grok Voice Transcribe 2.0 non è una misura comparabile. Proviene dalla board AA-WER Streaming di Artificial Analysis, un composito ponderato di AA-AgentTalk al 50%, VoxPopuli al 25% ed Earnings22 al 25% — circa otto ore di audio conversazionale in inglese ponderato per gli agenti, misurato tramite un'interfaccia di streaming. Set diversi, ponderazione diversa, modalità di funzionamento diversa. Mettere 2,7% accanto a 5,00% e concludere che il modello gestito sia circa due volte più accurato è l'errore più comune in assoluto che si possa fare in questo confronto.

Ciò che si può dire onestamente è più limitato e comunque utile. Entrambi i modelli sono solidi sull'audio su cui ciascuno è stato misurato. Grok Voice Transcribe 2.0 guida una classifica streaming gestita in modo indipendente, sulla quale vengono misurati anche altri modelli, il che rende il suo posizionamento verificabile anche se il suo valore esatto non è trasferibile. Granite Speech 5.0 470M TurboCTC ha un WER aggregato sui set ASR aperti standard e, separatamente, un risultato in campo lontano in cui il checkpoint non commerciale si classifica quinto per accuratezza e quello Apache nono — misurato su parlato rumoroso e riverberante, che è la condizione più difficile del set e, probabilmente, la cosa più onesta nei numeri di entrambi i modelli.

Se il tuo audio è parlato inglese letto e pulito, il divario di accuratezza tra questi due è probabilmente inferiore a quanto suggeriscano le posizioni in classifica. Se è rumoroso, con accento, telefonico o non in inglese, nessuna delle due classifiche ti dice granché e il tuo set di test è l'unico strumento in grado di dirlo.

Pesi liberi contro $1,67 all'ora

Il confronto dei costi è l'unico punto in cui questi due modelli sono davvero facili da distinguere, e il numero che le persone di solito citano è sbagliato in entrambe le direzioni.

• Trascrizione in batch — Grok Voice Transcribe 2.0 a 0,10 $ per ora di audio, o circa 1,67 $ per 1.000 minuti, rispetto a Granite Speech 5.0 470M TurboCTC senza costi di licenza, più il tempo GPU

• Streaming — $0,20 per ora di audio, circa $3,33 per 1.000 minuti rispetto all'assenza di un percorso di streaming ospitato pubblicato da IBM

• Licenza — un'API commerciale senza pesi vs Apache 2.0 per il checkpoint principale e CC-BY-NC-SA-4.0 per quello non commerciale più accurato

"Free" sta facendo un gran lavoro in quella prima riga. Un modello encoder-only da 470M è abbastanza piccolo da girare su hardware modesto — è il punto del design, ed è il motivo per cui IBM lo ha addestrato in dieci giorni su otto H100 e lo ha rilasciato per `transformers>=5.16.0` con una demo WebGPU — ma qualcuno paga comunque la GPU, lo stack di serving, l'autoscaling, i retry e i turni di reperibilità. A volumi ridotti il prezzo gestito è di solito più economico del tempo di ingegneria. A volumi grandi e costanti vince la strada dell'hardware a noleggio, e il punto di incrocio è funzione del tuo utilizzo più che del tuo volume audio: una GPU che tieni occupata costa poco all'ora, e una che tieni calda per il traffico di picco no.

Un dettaglio sulla licenza vale la pena segnalarlo prima che qualcuno ci progetti sopra. Il più accurato dei due checkpoint, quello al 4,85% di WER, è quello non commerciale con licenza CC-BY-NC-SA-4.0. Il checkpoint Apache 2.0 è quello al 5,00%, ed è quello che puoi distribuire in un prodotto. Si tratta di una differenza di accuratezza di 0,15 punti scambiata con il diritto di poter usare il modello, e significa anche che qualsiasi confronto che citi il 4,85% per "Granite Speech 5.0" e poi discuta di distribuzione commerciale sta citando il checkpoint sbagliato.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: release September 18 2026, final WER 2.7% streaming, first partial 0.49s, 100 key terms included, diarization included, $0.20 per streaming hour. The right column gives Granite Speech 5.0 470M TurboCTC the rows: release August 25 2026, mean WER 5.00% Apache, speed 12,600 RTFx batched, no key terms, timestamps not shipped, Apache-2.0 weights where you pay compute. A footer reads 'Granite figures IBM-reported; Grok figures per Artificial Analysis.'

La regola di decisione

Tre domande separano questi due modelli più rapidamente di qualsiasi tabella di benchmark.

La trascrizione viene consumata in tempo reale, mentre l'oratore sta ancora parlando? Se sì, TurboCTC non è il candidato — non perché sia lento, ma perché non ha un'interfaccia di streaming né output parziali, e una trascrizione parziale rappresenta un impegno architetturale diverso rispetto a una decodifica batch veloce. Se no, il vantaggio di throughput diventa tutto ciò che conta e il modello di IBM è molto difficile da battere sul costo per ora di audio elaborato.

Il lavoro richiede vocabolario di dominio? Se sì, un modello con biasing vince di default, e l'assenza di biasing dei termini chiave in TurboCTC è squalificante, non semplicemente scomoda. Se no, stai pagando per una funzionalità che non userai sul lato gestito.

L'audio è parlato inglese letto su hardware decente? Se sì, entrambe sono valide e la scelta riguarda le operazioni. Se no, entrambe le schede non sono informative e conta solo la tua valutazione.

Comunque vada, è a livello operativo che questa decisione diventa economica. OrcaRouter mette oltre 200 modelli dietro un'unica chiave compatibile con OpenAI con failover automatico tra provider, così un endpoint vocale gestito in una singola regione che ha una brutta giornata smette di essere il tuo disservizio, e il prezzo di listino del provider viene trasferito con ricarico zero — il che significa che un cambio di prezzo del provider o un nuovo checkpoint è attivo dalla nostra parte lo stesso giorno. Per un carico di lavoro in cui la risposta giusta è davvero poco chiara, questo elimina il costo di sbagliare: fai un benchmark di entrambi sul tuo audio dietro un unico endpoint, tieni quello che vince e cambia la stringa del modello quando arriva il prossimo.

Screenshot of the SpaceXAI Speech to Text API documentation page showing the Quick Start section with a Python example posting an audio file to https://api.x.ai/v1/stt with the model parameter set to grok-voice-transcribe-2.0, alongside the API console navigation and an on-this-page index listing Supported Audio Formats, Limits, Streaming Speech-to-Text and Smart Turn.

La versione breve: Granite Speech 5.0 470M TurboCTC è la risposta migliore a «trascrivere tutto ciò che abbiamo mai registrato, a basso costo, su hardware che controlliamo», e Grok Voice Transcribe 2.0 è la risposta migliore a «trascrivere questo mentre accade, con precisione, senza che siamo noi a gestire lo stack di serving». I titoli dei 12.600× e degli 0,49 secondi sono entrambi veri e nessuno dei due è una prova che riguardi l'altro.