
Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B: Il numero che Microsoft non ha pubblicato
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
VibeVoice ASR Streaming 7B è il riconoscitore vocale streaming unificato di Microsoft, caricato su Hugging Face il 2 settembre 2026 e annunciato nel repository microsoft/VibeVoice un giorno dopo con licenza MIT, e fa qualcosa che né Grok Voice Transcribe 2.0 né la maggior parte dei suoi concorrenti fa: emette testo con attribuzione del parlante man mano che l'audio arriva, senza una fase separata di diarizzazione. Il rapporto tecnico di Microsoft afferma che il checkpoint 7B raggiunge i valori medi più bassi di WER e CER su cinque set di valutazione e la migliore o pari-merito attribuzione del parlante in 12 delle 13 impostazioni di valutazione. Ciò che la scheda del modello non fa è pubblicare un singolo numero in testo — nessun WER, nessun RTF, nessun valore di latenza; i risultati esistono solo come immagini nel rapporto. Grok Voice Transcribe 2.0, rilasciato sedici giorni dopo, il 18 settembre 2026, a 0,10 $ per ora di audio per il batch e 0,20 $ per ora per lo streaming, pubblica tutto: WER della trascrizione finale del 2,7% e WER del primo parziale del 3,4% nella classifica streaming di Artificial Analysis, 0,49 secondi per ciascuno. Quindi il punto di partenza onesto per questo confronto è che uno dei due modelli è documentato in modo misurabilmente migliore dell'altro, e che questa asimmetria è di per sé il fatto più rilevante per la decisione nel confronto.
Ciò che Microsoft ha pubblicato, e ciò che un lettore può farne
Il report VibeVoice è ricerca autentica e le affermazioni che contiene sono specifiche nella forma, se non nel valore. Ha valutato quattro benchmark per riunioni — AliMeeting, AISHELL-4, AMI-SDM e AMI-IHM — oltre a MLC-Challenge, su nove lingue, e riporta due risultati principali: il modello 7B aveva il WER/CER medio più basso sui cinque set e la migliore o ex aequo attribuzione del parlante in 12 delle 13 configurazioni di valutazione. Entrambe sono affermazioni relative, il che è un tipo di affermazione significativo: "il più basso tra questi cinque set" è un'affermazione sull'ordinamento, e l'ordinamento è ciò di cui un acquirente ha bisogno.
Ciò che è assente è ogni cifra assoluta. Non c'è alcuna percentuale di WER da confrontare con qualsiasi cosa, nessun numero di throughput, nessuna misurazione della latenza e nessuna ripartizione per set nel testo. Una tabella comparativa che mette VibeVoice accanto a Grok Voice Transcribe 2.0 e assegna un numero al modello Microsoft sta inventando quel numero. Ciò che si può dire è che VibeVoice ha vinto la propria valutazione su cinque set e che nessuno al di fuori di Microsoft lo ha rieseguito — nessun benchmark indipendente, nessuna valutazione di terze parti e, al momento in cui scriviamo, nessun fornitore di inferenza ospitata che elenchi il modello in alcun modo. Il confronto è quindi tra un numero documentato e una classifica non documentata, e la classifica non documentata non è la più debole delle due solo perché è priva di un punto decimale.
La documentazione di Grok Voice Transcribe 2.0 ha il problema opposto. Il suo 2,7% e 3,4% provengono dalla board AA-WER Streaming di Artificial Analysis, un composito ponderato di AA-AgentTalk al 50% con VoxPopuli ed Earnings22 al 25% ciascuno — circa otto ore di audio conversazionale in inglese di tipo agent, eseguito in modo indipendente, una provenienza genuinamente più solida rispetto alla valutazione di un fornitore. Ma è una fetta ristretta dell'inglese, e la pagina stessa della board traccia 27 dei 33 modelli che SpaceXAI conta quando rivendica il primo posto su 32. Un numero preciso su un test ristretto e un'affermazione imprecisa su uno più ampio non sono direttamente comparabili, e questo articolo non fingerà il contrario.
Due secondi e mezzo contro mezzo secondo
Il confronto della latenza è l'unico punto in cui i due modelli possono essere messi a confronto diretto senza alcuna riserva sui dataset, perché entrambi pubblicano la propria configurazione di streaming — e la differenza è di natura architetturale, non una scelta di ottimizzazione.
VibeVoice ASR Streaming 7B funziona a blocchi. I suoi checkpoint rilasciati usano 22 frame latenti per blocco, che, alla velocità di 7,5 frame latenti al secondo del modello, corrispondono a circa 2,9 secondi di audio per blocco, con un lookahead di quattro frame latenti — all'incirca 0,5 secondi di audio futuro — e una latenza prevista di attribuzione dell'oratore di circa 2,00 secondi. Emette testo una volta per blocco. Questo è un vero sistema di streaming, ma la cadenza si misura in secondi, non in millisecondi.
Grok Voice Transcribe 2.0 restituisce la sua prima trascrizione parziale 0,49 secondi dopo che l'oratore si ferma, e finalizza 0,49 secondi dopo la fine del discorso. Ha pagato quella velocità con l'accuratezza — il tasso di errore della prima trascrizione parziale è sceso dal 18,3% nella versione 1.0 al 3,4% nella 2.0, al costo di passare da 0,25 secondi a 0,49 secondi sulla stessa metrica.
Metti uno accanto all'altro:
• Cadenza di streaming — Grok Voice Transcribe 2.0 emette risultati parziali in modo continuo, con una latenza del primo parziale di 0,49 secondi, mentre VibeVoice ASR Streaming 7B emette un blocco di testo all'incirca ogni 2,9 secondi
• Latenza di attribuzione dell'oratore — inclusa nello stesso percorso da 0,49 secondi rispetto a circa 2,00 secondi per design
• Lookahead — non pubblicato vs quattro frame latenti, circa 0,5 secondi di audio futuro
• Effetto pratico — un agente vocale può agire su una frase in corso rispetto a un sistema che riceve un paragrafo con etichetta del parlante ogni tre secondi
Nessuna delle due è sbagliata. Un blocco da 2,9 secondi è una scelta progettuale del tutto ragionevole per la trascrizione di riunioni, dove l'output è un documento e il valore sta nel fatto che il documento arrivi durante la riunione anziché dopo. È la scelta progettuale sbagliata per un agente conversazionale, dove un silenzio di tre secondi non è una pausa, è un fallimento. Il divario tra le due cadenze è di circa sei volte, e corrisponde quasi esattamente alla differenza tra trascrivere una conversazione e parteciparvi.

Attribuzione del parlante come output, non come fase della pipeline
È qui che il modello Microsoft è davvero in vantaggio, e vale la pena comprendere il design, perché è la ragione per cui il chunking è grossolano.
VibeVoice utilizza due tokenizer pre-addestrati — un encoder acustico e un encoder semantico — che operano a 24 kHz con un downsampling di 3.200× per produrre 7,5 frame latenti al secondo, uno ogni 133 millisecondi. Tali frame vengono proiettati in una backbone di language model Qwen2.5, e il parlato in ingresso e il testo generato sono interlacciati come un'unica sequenza, con il parlato e il testo osservati in precedenza mantenuti nel contesto del modello. La conseguenza è che l'identità del parlante non è mai un problema separato: il modello non trascrive per poi decidere chi ha parlato, ma genera testo condizionato da una cronologia audio che contiene ancora le voci. Ecco perché non c'è una fase di diarizzazione da allineare, e perché l'affermazione di Microsoft sull'attribuzione del parlante in 12 delle 13 impostazioni è architettonicamente credibile anziché un risultato aggiunto a posteriori.
Il costo di quel design è una conservazione della cronologia che cresce linearmente con la durata della registrazione, ed è per questo che i checkpoint rilasciati si rivolgono a registrazioni fino a otto minuti. Questo è un limite reale ed è dichiarato apertamente. Esclude il modello dal lavoro di lunga durata — una chiamata sugli utili di due ore, un'intera giornata di audio di un contact center — a meno che non si costruisca la propria segmentazione e reinizializzazione, il che reintroduce esattamente la complessità che l'architettura era stata progettata per rimuovere.
Grok Voice Transcribe 2.0 risolve lo stesso problema in modo diverso e con una diversa serie di limiti. Include la diarizzazione senza costi aggiuntivi e supporta fino a otto canali audio indipendenti in una singola richiesta. Per la telefonia dei contact center, dove ogni partecipante spesso arriva sul proprio canale, la separazione dei canali è più affidabile della diarizzazione e non ha un tasso di errore associato. Per l'audio misto dipende dalla qualità della diarizzazione e, a differenza di Muse Voice Transcribe di Meta — che ha pubblicato un tasso medio di errore di diarizzazione del 17,5% — SpaceXAI non ha pubblicato alcun dato sulla diarizzazione. Quindi entrambi i modelli lasciano una lacuna nelle prove sulla diarizzazione: uno pubblica una classifica senza un valore, l'altro pubblica un elenco di funzionalità senza una misurazione.
Diciotto gigabyte, dieci lingue, MIT
I fatti relativi al deployment divergono così completamente che quasi non si possono mettere a confronto. VibeVoice ASR Streaming 7B pesa circa 18 GB di pesi bf16 — la scheda Hugging Face indica 9B parametri totali per il checkpoint denominato 7B, con una versione gemella da 1,5B di circa 5,6 GB — con licenza MIT, demo Python e un plugin vLLM per il serving. Dieci lingue: cinese, inglese, francese, tedesco, italiano, giapponese, coreano, portoghese, russo e spagnolo. Microsoft lo posiziona per la ricerca e lo sviluppo.
Grok Voice Transcribe 2.0 è un endpoint gestito senza pesi da scaricare, 12 formati di input dall'audio telefonico a 8 kHz fino a 48 kHz, fino a otto canali, 100 termini chiave per richiesta, rilevamento automatico della lingua con passaggio a metà registrazione, normalizzazione inversa del testo in 25 lingue, file fino a 500 MB e limiti di servizio di 10 richieste al secondo e 100 sessioni di streaming simultanee per team. Viene eseguito in us-east-1 e solo in us-east-1.
• Pesi — MIT, 18 GB, tuoi da eseguire ovunque vs nessuno, solo ospitati dal fornitore
• Lingue — 10 lingue denominate vs rilevamento automatico con supporto di formattazione su 25
• Bias dei termini chiave — supportato tramite hotwords rispetto a un massimo di 100 termini chiave per richiesta
• Durata della registrazione — circa otto minuti per checkpoint prima che la conservazione dello storico diventi il vincolo, rispetto a nessun limite massimo pubblicato, file fino a 500 MB
• Controllo della regione — qualunque cosa su cui esegui il deployment rispetto a us-east-1
• Costo — nessun costo di licenza, più 18 GB di memoria GPU e uno stack di serving, rispetto a 0,10 $ per ora di batch e 0,20 $ per ora di streaming
Un modello da 18 GB non è qualcosa che si fa girare su un laptop, e il plugin vLLM implica una GPU con memoria vera. Di contro, una licenza MIT su un modello di quelle dimensioni è insolita e preziosa: è l'unico dei due che puoi eseguire all'interno della tua rete senza alcun rapporto con il fornitore, il che, per l'audio regolamentato, non è una preferenza ma un requisito. L'alternativa gestita è economica su base oraria e impossibile da distribuire on-premises.

Dove spetta la decisione di routing
Il costo è il punto in cui i due modelli diventano finalmente comparabili in modo tale da produrre un numero. Il percorso batch di Grok Voice Transcribe 2.0 costa $0,10 per ora di audio, circa $1,67 per 1.000 minuti, mentre il suo percorso streaming costa $0,20, circa $3,33. VibeVoice ASR Streaming 7B non ha alcun costo di licenza; ciò che ha invece è circa 18 GB di memoria GPU residente e uno stack di serving vLLM che gestisci tu. Un modello di classe 7B di quelle dimensioni non sarà economico per ora di audio su hardware noleggiato, e la curva di utilizzo è implacabile: una GPU tenuta calda per il traffico di picco costa lo stesso sia che stia trascrivendo sia che resti inattiva.
Questa è la forma tipica dell'argomento costruire-o-acquistare, e si risolve diversamente a seconda del volume e del fatto che all'audio sia consentito uscire dalla tua rete. Quello che è cambiato nell'ultimo mese è la rapidità con cui la risposta si sposta: il leader dell'accuratezza nello streaming è passato di mano due volte in tre settimane, e un modello rilasciato all'inizio di settembre è stato superato entro metà settembre. Qualsiasi architettura che renda costoso invertire la scelta del modello è ora l'architettura sbagliata per questa categoria.
OrcaRouter è il luogo in cui quell'inversione diventa economica. Una sola chiave compatibile con OpenAI copre oltre 200 modelli con failover automatico tra i provider, così il guasto di un endpoint gestito in una singola regione è un evento di routing anziché un'interruzione, e il prezzo di listino del provider viene trasferito con 0% di ricarico — il che significa che una variazione di prezzo del fornitore o un nuovo checkpoint è attivo dalla nostra parte lo stesso giorno. Per un team che vuole testare VibeVoice contro Grok Voice Transcribe 2.0 sul proprio audio, o mantenere un fallback self-hosted dietro la stessa interfaccia di un primario gestito, il punto di chiamata smette di essere la cosa che deve cambiare.

Il verdetto onesto: VibeVoice ASR Streaming 7B è il modello più interessante e Grok Voice Transcribe 2.0 è il prodotto più utilizzabile, e il divario tra queste due affermazioni è interamente spiegato dal fatto che un fornitore pubblica grafici e l'altro pubblica numeri. Se la tua esigenza è la trascrizione on-premises con attribuzione del parlante di riunioni di durata inferiore a otto minuti, il checkpoint Microsoft è l'unico dei due che soddisfa il requisito. Se la tua esigenza è un voice agent che risponde entro una pausa conversazionale, una cadenza di chunk di 2,9 secondi lo esclude prima ancora che si parli di accuratezza. E se stai aspettando il confronto che lo risolverebbe — lo stesso audio attraverso entrambi i modelli, valutato da qualcuno che non lavora per nessuna delle due aziende — quella misurazione non esiste ancora, cosa che vale la pena ricordare la prossima volta che una tabella mette un numero accanto al nome di VibeVoice.
