Una scheda titolo hero generata per 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B: un challenger MIT non comprovato contro il campione Open ASR', con sottotitolo 'Il default collaudato contro il challenger nato da un giorno', con due schede modello — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 settembre 2026 · MIT · Nessun benchmark ancora pubblicato) e NVIDIA Parakeet TDT 0.6B (NVIDIA · 5 maggio 2025 · CC-BY-4.0 · Open ASR #1 da maggio 2025) — e tag che recitano '6.05% WER medio (Parakeet)', '16 mesi di distanza', e 'Chi-ha-detto-cosa + hotwords (Microsoft, non verificato)'. Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B: uno sfidante MIT non collaudato contro il campione Open ASR

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Se oggi ti serve uno speech-to-text open-weights in produzione, c’è un default, e si chiama NVIDIA Parakeet TDT 0.6B. Da maggio 2025, il Parakeet TDT 0.6B v2 da 600 milioni di parametri mantiene il primo posto nella leaderboard Open ASR di Hugging Face con un tasso medio di errore sulle parole del 6,05%, una posizione che terze parti hanno replicato per ben oltre un anno. Il più recente aspirante sfidante è VibeVoice-ASR-Streaming-1.5B, che Microsoft Research ha pubblicato il 2 settembre 2026 — sedici mesi dopo Parakeet — con licenza MIT, una proposta incentrata sull’attribuzione del parlante in streaming e, finora, nessun dato di accuratezza pubblicato. Questa pagina mette a confronto campione e sfidante su evidenze, architettura e ciò che ciascuno offre davvero già pronto all’uso.

Prima delle specifiche contano due etichette, perché rappresentano l'intera forma di questo confronto. I valori di Parakeet sono consolidati: il 6,05% di WER medio e il throughput di circa 3.386 RTFx dietro la sua affermazione di "un'ora di audio in circa un secondo" sono sui leaderboard pubblici e sui materiali NVIDIA da oltre un anno. La parte della pagina di VibeVoice-ASR-Streaming-1.5B è ciò che si può conoscere dal suo repository — model card, file di configurazione e documentazione streaming di Microsoft — perché Microsoft non ha pubblicato WER, latenza o throughput in forma testuale, e al momento in cui scriviamo non esiste alcun benchmark indipendente del checkpoint. In ogni confronto qui sotto, una colonna è stata testata sul campo; l'altra è una scheda tecnica.

A distanza di sedici mesi e di un regno in classifica

Parakeet TDT 0.6B v2 è arrivato il 5 maggio 2025 come risposta di NVIDIA al problema dell'ASR in streaming: un encoder FastConformer abbinato a un decoder basato su un transducer a token e durata (TDT) che prevede ogni token e la sua durata in un unico passaggio — un espediente di efficienza che elimina il sovraccarico dei token vuoti di un transducer convenzionale. È distribuito con licenza CC-BY-4.0 ed è adatto all'uso commerciale; ha conquistato il primo posto nella classifica Open ASR grazie al suo tasso medio di errori sulle parole del 6,05%. Ha inoltre introdotto funzionalità pensate per la produzione che la classifica non misura — punteggiatura, capitalizzazione, timestamp a livello di parola — e un encoder full-attention che accetta fino a 24 minuti di audio in un unico passaggio, il che lo rende utile per riunioni lunghe e podcast senza un'aggressiva suddivisione in blocchi.

VibeVoice-ASR-Streaming-1.5B è lo sfidante nel senso più puro: esiste, è documentato e non è stato stabilito nulla su quanto funzioni bene. L'annuncio sul canale GitHub di Microsoft, datato 3 settembre, presenta un modello ASR streaming unificato che "trascrive in continuazione chi ha detto cosa mentre il parlato arriva", con hotword e dieci lingue, e la configurazione del checkpoint descrive una tradizione ingegneristica del tutto diversa: un decoder basato su un language model della famiglia Qwen2, alimentato da tokenizzatori audio convoluzionali, con una testa diffusiva che produce output in blocchi di circa 2,9 secondi e circa 0,5 secondi di lookahead. Se Parakeet è un modello vocale dedicato, perfezionato in oltre un anno di distribuzioni reali, VibeVoice-ASR-Streaming-1.5B è un checkpoint di ricerca vecchio di due giorni.

L'asimmetria delle prove è la storia.

Leggi il resto di questa pagina tenendo presente un dato: questo confronto ha numeri su un solo lato. Dal lato di Parakeet TDT 0.6B c'è un anno di difesa della classifica — 6,05% di WER medio sui set pubblici inglesi in formato breve di Open ASR, circa 3.386 RTFx con batch 128 su hardware NVIDIA, e un ecosistema di strumenti di deployment NeMo, accelerazione TensorRT e quantizzazione FP8 collaudato in produzione. Dal lato di VibeVoice-ASR-Streaming-1.5B ci sono il valore di valutazione della model card, che è un'immagine e non testo, e il 7,77% di WER medio su otto set di test inglesi dichiarato dal fornitore nella scheda di VibeVoice-ASR batch — un numero che descrive il modello non in streaming e non può essere trasferito a questo checkpoint. Lo sfidante potrebbe anche essere eccellente; il punto è che «potrebbe anche essere» è l'intera base di evidenze.

Il controllo delle specifiche

• Parametri — NVIDIA Parakeet TDT 0.6B: 600M, encoder FastConformer + decoder TDT rispetto a VibeVoice-ASR-Streaming-1.5B: ~3B in totale (backbone Qwen di classe 1.5B più tokenizzatori e testa di diffusione).

• Rilasciato — 5 maggio 2025 vs 2 settembre 2026.

• Accuratezza — 6.05% WER medio, Open ASR #1 da maggio 2025, riprodotto da terze parti vs nessuno pubblicato.

• Velocità — ~3.386 RTFx con batch 128 su hardware NVIDIA, ~1 ora di audio al secondo rispetto a nessuna cifra di throughput pubblicata.

• Streaming — capace di streaming con contesto di attenzione completa fino a 24 minuti per passaggio, rispetto allo streaming a blocchi con blocchi di ~2,9 s e anticipo di ~0,5 s.

• Extra di output — punteggiatura, capitalizzazione, timestamp a livello di parola vs attribuzione streaming di chi-ha-detto-cosa (non verificata) e hotwords; dieci lingue.

• Licenza — CC-BY-4.0 vs MIT.

• Ecosistema — NVIDIA NeMo con TensorRT e FP8 rispetto alle demo del repository microsoft/VibeVoice e al plugin vLLM.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total, Architecture speech LLM + diffusion, WER none published, Streaming ~2.9 s chunks, Extras who-said-what + hotwords, License MIT. Right column NVIDIA Parakeet TDT 0.6B v2: Released May 5 2025, Params 600M, Architecture FastConformer + TDT, WER 6.05% Open ASR #1, Streaming full-attention up to 24 min, Extras punctuation + timestamps, License CC-BY-4.0. Footer reads 'Parakeet figures per the Open ASR leaderboard, settled since 2025; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Sotto il cofano: due idee su a cosa servono i modelli vocali

Le architetture codificano due diverse convinzioni sul compito. Parakeet TDT 0.6B tratta la trascrizione come un problema di elaborazione del segnale risolto in modo efficiente: un encoder FastConformer estrae l'acustica e il decoder TDT emette token di testo e durate in modo congiunto, motivo per cui è migliaia di volte più veloce del tempo reale e per cui si trova a suo agio nello stack di deployment NVIDIA. VibeVoice-ASR-Streaming-1.5B tratta la trascrizione come un problema linguistico: comprime l'audio in un flusso di token, lo passa a un modello linguistico che ha letto una quantità di contesto pari a un'intera trascrizione e lascia che sia la comprensione del LM — di chi dice cosa e di come le conversazioni si incastrano — a fare il lavoro. Il backbone LLM è anche il motivo per cui il checkpoint ha circa 3 miliardi di parametri invece di 600 milioni, e per cui Microsoft non ha dichiarato di avere un footprint edge: è un modello che vuole una GPU e usa la memoria per trasportare il contesto.

Per la trascrizione in tempo reale, la conseguenza pratica è il profilo della latenza. L'encoder full-attention di Parakeet può elaborare finestre lunghe in un'unica passata, una filosofia di streaming diversa dal contratto fisso chunk-and-lookahead di VibeVoice-ASR-Streaming-1.5B, che prevede circa 2,9 secondi di audio per ogni segmento emesso. Nessuno dei due è uno streamer di trascrizioni parziali parola per parola nello stile delle API commerciali a latenza più bassa; entrambi sono sistemi a chunk, e quello giusto dipende dal fatto che l'audio arrivi come file di durata definita o come sessione live senza una fine prestabilita.

La storia della funzionalità e i quartieri di distribuzione.

Pronto all'uso, Parakeet TDT 0.6B è il prodotto di trascrizione più completo: punteggiatura e maiuscole incluse nella trascrizione, timestamp a livello di parola per l'allineamento e finestre a singolo passaggio di 24 minuti che riducono gli errori di segmentazione su registrazioni lunghe. VibeVoice-ASR-Streaming-1.5B controbatte con funzionalità che Parakeet non elenca: output con attribuzione al parlante e hotwords, in dieci lingue. L'affermazione sulla diarizzazione in streaming è esattamente ciò che richiede una verifica indipendente — è ai confini dei segmenti che l'attribuzione diventa instabile — ma è il motivo per cui guardare al modello di Microsoft piuttosto che a quello di NVIDIA se la tua esigenza è sapere chi ha detto cosa in una riunione dal vivo.

A screenshot of the Hugging Face model card for nvidia/parakeet-tdt-0.6b-v2, showing the NVIDIA namespace, the model title 'Parakeet TDT 0.6B V2 (En)', the automatic-speech-recognition and NeMo pipeline tags, and the card description of the 600-million-parameter FastConformer model with TDT decoder, punctuation and timestamps, audio segments up to 24 minutes in a single pass, and an RTFx of 3380 on the Open ASR leaderboard at batch 128.

I quartieri sono diversi tanto quanto i modelli. Parakeet TDT 0.6B è un cittadino di NVIDIA NeMo: TensorRT, FP8 e strumenti di deployment ottimizzati per GPU NVIDIA, il che è eccellente se sei già sull'infrastruttura NVIDIA. VibeVoice-ASR-Streaming-1.5B vive in un repository di ricerca: i percorsi documentati sono le demo Python di Microsoft e un plugin vLLM, la sua classe di architettura non è ancora nella documentazione pubblica di Transformers, e metterlo in piedi significa un'installazione da sorgente e una tua verifica che il percorso di caricamento funzioni. Per un team che apprezza un deployment noioso e documentato, questa differenza da sola può pesare più del divario nei benchmark.

Le ragioni del candidato in carica, le ragioni dello sfidante

Il caso di NVIDIA Parakeet TDT 0.6B è il caso di una quantità nota: un anno di difesa delle posizioni in classifica, riproduzione da parte di terzi, una licenza commerciale, funzionalità di produzione e un ecosistema di distribuzione che ha assorbito traffico reale. Se questo trimestre stai per rilasciare una funzionalità di trascrizione in inglese e vuoi pesi aperti, questa è la scelta predefinita difendibile, e l'onere della prova spetta a qualsiasi cosa pretenda di sostituirla.

Le ragioni per adottare VibeVoice-ASR-Streaming-1.5B sono più circoscritte e specifiche: ti servono l’attribuzione del parlante in streaming o le hotword, ti servono lingue diverse dall’inglese, oppure credi che l’approccio language-model al parlato finirà per imporsi e vuoi essere tra i primi. È una scommessa, non una decisione: non c’è ancora una metrica che giustifichi lo spostamento del traffico di produzione su questo modello, e la stessa Microsoft ha un atteggiamento prima di tutto di ricerca. Nessuno dei due modelli è oggi disponibile tramite OrcaRouter, quindi il modo a basso costo per testare la scommessa è lo schema che vale per qualsiasi giovane modello open: tenere il layer ASR dietro un’unica API di routing che espone oltre 200 modelli al prezzo di listino dei provider, senza markup e con failover automatico, instradare una parte del traffico audio reale verso VibeVoice-ASR-Streaming-1.5B nel momento in cui un provider lo ospiterà, e lasciare che siano le trascrizioni del tuo traffico a decidere se lo sfidante merita la corona che Parakeet indossa da sedici mesi.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube