
Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B: Due classifiche, un confronto fuorviante
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA Parakeet TDT 0.6B è un trasduttore FastConformer-TDT da 600 milioni di parametri, rilasciato il 14 agosto 2025 con licenza CC-BY-4.0, e da oltre un anno è la raccomandazione predefinita per chiunque voglia eseguire la trascrizione in proprio. Grok Voice Transcribe 2.0 è il modello speech-to-text gestito di SpaceXAI, distribuito il 18 settembre 2026, al prezzo di 0,10 $ per ora di audio in modalità batch e 0,20 $ per ora in streaming, con un tasso di errore sulle parole finale del 2,7% nella classifica streaming di Artificial Analysis. Se cerchi un confronto tra i due, troverai Parakeet indicato al 13,7% di WER e Grok Voice Transcribe 2.0 al 2,7%, il che fa sembrare il modello gestito cinque volte più accurato ed è una cosa davvero fuorviante da leggere. Quei due numeri provengono da indici Artificial Analysis diversi, costruiti su dataset diversi, pubblicati a distanza di anni, e uno dei due è stato superato dalle misurazioni più recenti dello stesso fornitore. Il confronto reale è più interessante, e riguarda ciò che 600 megabyte di pesi ti danno e che un'API non può darti.
Il numero del 13,7%, e perché non dovresti usarlo
Il rapporto State of AI del terzo trimestre 2025 di Artificial Analysis ha collocato NVIDIA Parakeet TDT al terzo posto nel suo indice AA-WER con il 13,7%, dietro Google Chirp 2 all'11,6% e Canary Qwen della stessa NVIDIA al 13,2%. Quell'indice era una media ponderata per la durata audio su circa due ore ciascuno di VoxPopuli, Earnings-22 e AMI-SDM: parlato del mondo reale con accenti vari, vocabolario di dominio e condizioni di canale difficili, ed è per questo che ogni numero riportato è alto. Un WER del 13,7% su AMI-SDM, che è audio di riunioni far-field registrato in stanze riverberanti, non è un brutto risultato; è un test difficile.
Quell'indice non esiste più in quella forma. Artificial Analysis lo ha ricostruito come AA-WER v2, ponderando AA-AgentTalk al 50% e VoxPopuli-Cleaned-AA ed Earnings22-Cleaned-AA al 25% ciascuno, circa otto ore di audio, e la pulizia e la riponderazione hanno spostato sostanzialmente il punteggio di ogni modello. Nella classifica non-streaming attuale, Parakeet TDT 0.6B V3 si attesta su una percentuale a una cifra bassa — la stessa fascia degli altri leader open-weight — e non certo vicino al 13,7%, e la vetta della classifica è scesa intorno al 2%. Chiunque citi ancora il 13,7% per Parakeet sta citando una misurazione dismessa, e se lo confronta con un dato in streaming del 2026, sta anche confrontando due classifiche diverse.
Ciò che si può onestamente mettere a confronto è più limitato. La valutazione di NVIDIA stessa sull'Open ASR Leaderboard — i set pubblici standard in inglese di forma breve, eseguiti con gli strumenti di quella board — riporta un WER medio del 6,32% per Parakeet TDT 0.6B V3 con un RTFx di 3.332,74, e una media del 6,05% per la v2 solo inglese. Il 2,7% di Grok Voice Transcribe 2.0 è un dato di trascrizione finale sulla board in streaming, misurato dopo la fine del parlato, su audio conversazionale in inglese ponderato per gli agenti. Set diversi, board diversa, modalità diversa. È molto probabile che il modello gestito sia più accurato sull'audio che le due board condividono; l'entità di tale vantaggio non è 5×, e nessuno ha pubblicato la misurazione che lo chiarirebbe.
Che forma hanno in realtà i due modelli
La differenza architetturale spiega gran parte della differenza pratica. Parakeet TDT 0.6B è un encoder FastConformer con un decoder transducer token-and-duration: prevede sia un token sia di quanti frame avanzare, il che gli consente di saltare invece di emettere blank, e questa è la principale fonte della sua efficienza. Viene fornito con rilevamento automatico della lingua su 25 lingue europee, timestamp a livello di parola e di segmento, punteggiatura e maiuscole, e gestisce audio lungo — fino a 24 minuti con attenzione completa, o circa tre ore con attenzione locale. È servito tramite NeMo 2.2, ha un percorso MLX per Apple Silicon, e esistono build ONNX INT8 che girano su normali CPU.
Grok Voice Transcribe 2.0 è un servizio gestito, quindi il confronto è tra un modello e un prodotto. Cosa include il prodotto al suo prezzo di listino:
• Streaming — Grok Voice Transcribe 2.0 nativo su WebSocket, primo parziale a 0,49 secondi rispetto agli approcci a chunk o bufferizzati di Parakeet TDT 0.6B, senza un'interfaccia di primo livello per le trascrizioni parziali
• Bias dei termini chiave — fino a 100 termini chiave per richiesta, mentre non è una funzionalità di Parakeet
• Diarizzazione — inclusa nel prezzo richiesto vs un sistema separato che aggiungi tu stesso
• Canali — fino a otto canali audio in una singola richiesta rispetto a uno stream per passaggio
• Normalizzazione inversa del testo — inclusa in 25 lingue rispetto a sola punteggiatura e uso delle maiuscole
• Deployment — un endpoint gestito in us-east-1 rispetto a pesi che scarichi, esegui e gestisci ovunque
• Licenza — termini API commerciali vs CC-BY-4.0 con attribuzione
• Dimensione del modello — non divulgata vs circa 600 milioni di parametri, all'incirca 2,4 GB in fp32 o 1,2 GB in fp16
L'ultima riga è quella che decide molti deployment. Parakeet TDT 0.6B sta in un paio di gigabyte, funziona in modo accettabile su una CPU di un laptop attraverso il percorso INT8 ONNX, e sta comodamente su qualsiasi GPU consumer. Non è una versione più piccola di ciò che fa l'API — è una capacità diversa, perché è la differenza tra una funzionalità di trascrizione che funziona offline, su un dispositivo, senza rete e senza costi orari, e una che non lo fa.

L'aritmetica dei costi che nessuno esegue correttamente
Il confronto che viene pubblicato è «0,10 $ all'ora contro gratis», ed è sbagliato in entrambe le direzioni — l'API non è l'unica cosa per cui si paga, e i pesi non sono l'unica cosa su cui si risparmia.
• Trascrizione batch — Grok Voice Transcribe 2.0 a 0,10 $ per ora audio, circa 1,67 $ per 1.000 minuti vs Parakeet TDT 0.6B senza costi di licenza più tempo GPU o CPU
• Streaming — 0,20 $ per ora di audio, circa 3,33 $ per 1.000 minuti rispetto a una soluzione self-hosted, dove il vincolo è il tuo tetto di concorrenza anziché una tariffa pubblicata
• Limiti del servizio — 10 richieste al secondo e 100 sessioni di streaming simultanee per team, rispetto a qualunque cosa consenta il tuo hardware, senza limiti di frequenza e senza limiti di concorrenza
• Il costo che non compare su nessuno dei due prospetti — niente ingegneria, niente serving stack, niente autoscaling rispetto alla rotazione on-call, la logica di retry, gli aggiornamenti del modello e la GPU che tieni calda per i picchi
A volumi ridotti, il lato gestito è quasi sempre più economico, perché il costo fisso del percorso self-hosted è una persona. A volumi elevati e costanti, il lato self-hosted vince in modo decisivo, e il punto di incrocio è funzione dell'utilizzo piuttosto che del volume audio: una GPU che si tiene occupata è molto economica per ora di audio, mentre una che si tiene calda per il traffico di picco non lo è. Un team che elabora 20.000 ore al mese paga $2.000 per il percorso batch gestito e circa un mese di GPU di fascia media più il tempo di ingegneria per quello self-hosted, il che non è nemmeno paragonabile.
Il motivo per cui i calcoli vengono fatti male è che il lato self-hosted viene di solito confrontato a zero, e il lato managed viene di solito confrontato a listino. Nessuno dei due è un numero reale. Ciò che è reale è che i 3.332 RTFx di Parakeet TDT 0.6B — cifra di NVIDIA, in batch, su hardware da datacenter, e quella da trattare come limite superiore anziché come promessa — significano che una singola GPU modesta può elaborare più audio di quanto la maggior parte delle organizzazioni produca.
Dove Parakeet smette di essere la risposta giusta
Tre cose spingono un team ad abbandonare il modello aperto per passare a uno gestito, e nessuna di esse è l'accuratezza.
Il primo è il bias dei termini chiave. Se le tue trascrizioni sono piene di nomi di prodotti, cognomi, simboli ticker o gergo di settore, un modello privo di un meccanismo di bias li sbaglierà, senza altro rimedio che il fine-tuning. Grok Voice Transcribe 2.0 accetta fino a 100 termini chiave per richiesta. Parakeet TDT 0.6B non ha questa funzione. Per i centri di contatto, la sanità e il settore legale, quella singola lacuna è motivo di esclusione, indipendentemente da ciò che dice qualsiasi classifica.
Il secondo è la diarizzazione. Parakeet ti fornisce parole con timestamp; non ti dice chi le ha pronunciate. La trascrizione con più parlanti significa eseguire un modello di diarizzazione separato e allineare l'output, il che è un progetto più che un'opzione di configurazione. Il modello gestito restituisce testo con attribuzione del parlante nella stessa richiesta.
Il terzo è l'interfaccia di streaming stessa. Parakeet è abbastanza veloce che le persone costruiscono sistemi in tempo reale su di esso — suddividendo l'audio in blocchi, eseguendo il modello su ogni blocco, ricucendo l'output — ma il comportamento delle trascrizioni parziali, il rilevamento della fine del turno e la semantica di commit sono tutte cose che scrivi e mantieni. Grok Voice Transcribe 2.0 restituisce una prima trascrizione parziale 0,49 secondi dopo che hai smesso di parlare, come funzionalità del prodotto.
C'è anche un dettaglio di licenza che a volte sorprende i team: Parakeet TDT 0.6B V3 è CC-BY-4.0, che consente l'uso commerciale ma richiede l'attribuzione, e alcuni modelli vocali NVIDIA sono nel frattempo passati alla Open Model License dello stesso fornitore. Se l'attribuzione è un problema per il tuo prodotto, leggi la scheda relativa al checkpoint specifico invece di dare per scontato che si applichino i termini della famiglia.

Perché l'API di solito vince comunque, e quando non dovrebbe
Il pattern nell'ultimo anno è stato costante: i team iniziano con un modello aperto come Parakeet TDT 0.6B perché è gratuito e controllabile, rilasciano la funzionalità, poi scoprono che il costo continuativo non è la GPU ma la manutenzione, e migrano verso un endpoint gestito. Anche la migrazione inversa avviene, di solito quando il volume supera una soglia in cui il costo orario inizia a sembrare l'affitto di qualcosa che potresti possedere.
Entrambe le direzioni sono costose da eseguire se il modello è collegato direttamente alla tua applicazione, ed è questo l'argomento a favore del mantenere noioso il punto di chiamata. OrcaRouter espone oltre 200 modelli dietro un'unica chiave compatibile con OpenAI, con failover automatico tra provider e 0% di markup sul prezzo di listino del provider, così un deployment self-hosted e uno gestito possono stare dietro la stessa interfaccia ed essere scambiati con una stringa di modello. Questo conta più del solito nel parlato, dove la classifica cambia mani ogni poche settimane e un servizio gestito in una singola regione è un'interruzione in una singola regione — il percorso di failover è ciò che impedisce a una funzionalità di trascrizione di trasformarsi in un'interruzione della trascrizione.
Per i team che vogliono il throughput del modello aperto senza lo stack di serving, anche la decisione assume questa forma: fai un benchmark di Parakeet TDT 0.6B sul tuo audio, fai un benchmark di Grok Voice Transcribe 2.0 sullo stesso audio, e lascia che sia quello che vince a gestire il traffico, mentre smetti di preoccuparti di quale logo di fornitore ci sia sopra.

Se vuoi la versione in una riga: Parakeet TDT 0.6B resta la risposta migliore a «trascrivi qualsiasi cosa, ovunque, senza costi orari, su hardware che possiedo già», e Grok Voice Transcribe 2.0 è la risposta a «trascrivi con precisione con etichette dei parlanti e il mio vocabolario, senza eseguire nulla». Il dato del 13,7% che fa sembrare il divario enorme è una misurazione non più in uso, e il divario reale — tra uno e tre punti di WER su audio sovrapposto — è così piccolo che dovrebbe essere la questione operativa a deciderlo.
