Una hero card di confronto tra 'VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo', con sopratitolo 'Open-weights ASR - Sett 2026'{{1}}, sottotitolo{{2}} che descrive il checkpoint in streaming di Microsoft contro il default open-weights {{/2}}{{1}} — cosa aggiunge lo streaming{{3}}, e cosa costa passare da 0.8B a 9B parametri{{/3}}, chip 'MIT weights - 2 Set'{{4}}, 'MIT weights - 2024'{{5}} e 'Whisper: 99 lingue'{{/5}}{{/4}}, e una nota 'Il record di Whisper è pubblico'{{6}}. Il logo OrcaRouter è composto in basso a destra{{/6}}.
Guides & Insights

VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo: cosa aggiunge il checkpoint di streaming di Microsoft al default open-weight

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Per la maggior parte degli ultimi due anni, la risposta a "trascriverlo noi stessi, a basso costo" è stata Whisper Large v3 Turbo — il modello open-weights da 809 milioni di parametri di OpenAI, con licenza MIT, 99 lingue, abbastanza piccolo da girare su una workstation e gratuito una volta che possiedi l'hardware. Il 2 settembre 2026, Microsoft Research ha caricato un contendente a quella scelta predefinita: VibeVoice-ASR-Streaming-7B, un checkpoint di streaming con licenza MIT su Hugging Face che trascrive mentre l'audio arriva, dichiara di produrre output con attribuzione del parlante e — a differenza del modello che la maggior parte dei team già esegue — non è mai stato progettato come job batch. Entrambi i modelli sono open weights di grandi laboratori. Quasi tutto il resto è un compromesso, e questa pagina riguarda quale compromesso stai effettivamente facendo.

Un'asimmetria condiziona l'intero confronto, quindi va affrontata per prima. Whisper Large v3 Turbo è il modello vocale più riprodotto in modo indipendente al mondo: i suoi valori di errore sulle parole sono stati ricalcolati per anni da migliaia di team su benchmark pubblici e sui propri audio, e i suoi punti deboli sono documentati quanto i suoi punti di forza. VibeVoice-ASR-Streaming-7B ha un giorno di vita, non ha alcun benchmark indipendente da nessuna parte, e Microsoft non ha pubblicato un tasso di errore sulle parole in streaming in un testo leggibile. Tutto ciò che segue sul lato Microsoft è ricavato dal repository — config, scheda del modello e documentazione streaming di Microsoft — ed è etichettato come tale.

Il default open-weights, e perché perdura

Whisper Large v3 Turbo è la versione distillata di Whisper Large v3: mantiene l'encoder a 32 livelli e riduce il decoder da 32 a quattro livelli, il che fa scendere il numero di parametri a 809M e circa quadruplicare la produttività su GPU, restando comunque vicino in termini di accuratezza. Poiché i pesi sono sotto licenza MIT e il modello è contenuto, è diventato il motore di trascrizione embedded predefinito per i bot di riunioni, gli strumenti di sottotitolazione e le pipeline di registrazione delle chiamate. I suoi limiti sono altrettanto noti. È un modello batch: prende un file audio e restituisce una trascrizione, invece di produrre le parole mentre vengono pronunciate. Non è stato addestrato per la traduzione, e in quel compito degrada sensibilmente. La sua accuratezza su parlato con rumore, accento o sovrapposizioni è irregolare, e restituisce testo semplice: niente punteggiatura o maiuscole di default, nessuna diarizzazione dei parlanti, nessun timestamp in questa variante, nessun condizionamento per parole chiave. Gli stack in produzione costruiti su Whisper assemblano questi componenti separatamente, ognuno aggiungendo la propria latenza e i propri modi di guasto.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

Il divario delle specifiche

• Parametri — 809M (decoder distillato) contro circa 9B in totale (un backbone linguistico Qwen2-7B più encoder del parlato; il "7B" si riferisce al LLM, mentre la pagina Hugging Face riporta 9B).

• Licenza — MIT, pesi aperti, entrambi.

Streaming — batch by design: le implementazioni di streaming self-hosted tipicamente si attestano su 1–5 secondi di latenza rispetto allo streaming nativo: chunk di ~2,9 secondi con lookahead di ~0,5 secondi, testo emesso per chunk, contesto mantenuto in una cache KV.

• Lingue — 99 con anni di riproduzione comunitaria vs 10 dichiarate (en, zh, es, pt, de, ja, ko, fr, ru, it).

• Oltre la trascrizione — nessuna di default vs. presunte funzioni: output in streaming "chi ha detto cosa" e hotword personalizzate (non verificate).

• Accuratezza pubblicata — 2,1% WER su LibriSpeech test-clean, 4,2% su test-other, ~7,7% sul composito Open ASR, 8–12% su audio rumoroso nei test della community, tutti riprodotti in modo indipendente, mentre nessun valore WER in streaming è pubblicato come testo.

• Impronta — funziona su un laptop o su una singola GPU modesta, rispetto a circa 18 GB di pesi bf16 prima della cache KV; prevedere una GPU di classe 24 GB.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): parameters - about 9B (Qwen2-7B + encoders); streaming - native, ~2.9 s chunks; WER in print - none in text; output extras - claimed speaker IDs + hotwords; languages - 10 declared; hardware - ~18 GB bf16, 24 GB-class GPU. Right column Whisper Large v3 Turbo (open weights, released 2024): 809M distilled; batch, 1-5 s self-host streaming; 2.1% / 4.2% LibriSpeech, ~7.7% Open ASR; none by default; 99; laptop to small GPU. Footer: 'Whisper WER independently reproduced. VibeVoice specs read from the HF repo; no benchmark exists yet.'

Cosa aggiunge realmente lo streaming

Il motivo per cui vale la pena guardare oltre Whisper Large v3 Turbo è la corsia del live streaming, ed è qui che i due modelli smettono di essere confrontabili. Whisper è orientato al batch: per ottenere le parole mentre chi parla sta ancora parlando, i team aggiungono suddivisione in chunk, rilevamento dell'attività vocale e codice di collante, e le implementazioni di streaming self-hosted in genere si attestano su una latenza da uno a cinque secondi — mancando l'obiettivo del sub-secondo per agenti telefonici e sottotitolazione live senza un'ingegneria seria. VibeVoice-ASR-Streaming-7B è progettato per quella corsia. La sua configurazione mostra audio compresso 3.200 volte in un flusso di token a 7,5 frame al secondo, elaborato in chunk di 22 frame con una lookahead di quattro frame — circa 2,9 secondi di audio per chunk — con testo emesso a ogni risoluzione del chunk e il contesto precedente conservato nella cache KV, così una sessione non ricalcola da zero. Questa cadenza è un design derivato dalla configurazione, non una latenza misurata, e nessuno ha ancora pubblicato un numero end-to-end; ma l'architettura è inequivocabilmente un'architettura di trascrizione live in un modo in cui Whisper non lo è.

La storia di Whisper è lunga e pubblica; quella del nuovo checkpoint è vuota.

È nell'accuratezza che l'età di Whisper Large v3 Turbo si rivela un punto di forza. Il suo 2,1% di WER su LibriSpeech test-clean e il 4,2% su test-other sono valori open-weights riprodotti da innumerevoli team; il suo ~7,7% sul composito della classifica Open ASR si colloca circa un punto dietro il Large v3 completo; e il documentato 8–12% su audio disturbato nei test della community fa sì che non sorprenda nessuno. Queste debolezze fanno parte del curriculum del modello: indicano esattamente dove ha bisogno di supporto prima di costruirci sopra.

VibeVoice-ASR-Streaming-7B non ha alcun precedente del genere. La sua scheda modello presenta una metrica di valutazione come immagine e il report tecnico sullo streaming di Microsoft è un PDF, ma non esiste un tasso di errore su parola (WER) per lo streaming citabile in forma testuale. L'unico ancoraggio numerico nella famiglia è la tabella fornita dal produttore nella scheda del modello batch VibeVoice-ASR — 7,77% di WER medio su otto set di test inglesi e 2,20% su LibriSpeech clean — che però non è il numero di questo checkpoint, e la ricezione comunitaria del modello batch stesso è stata contrastante: lodato per la diarizzazione immediatamente funzionante, criticato per l'eccessiva pesantezza e una certa propensione alle allucinazioni. Nulla di tutto ciò si trasferisce al modello streaming, ed è proprio questo il punto: con Whisper conosci in anticipo le modalità di errore; con VibeVoice-ASR-Streaming-7B sei tu il primo collaudatore.

Lingue e impronta: 99 contro 10, 0,8B contro 9B

I due costi più concreti del passaggio sono le lingue e le dimensioni. Whisper Large v3 Turbo trascrive 99 lingue; le lingue a basse risorse e quelle tonali degradano — tailandese, cantonese e gallese sono i punti deboli più citati — ma l'elenco ha alle spalle anni di riproduzione da parte della community. VibeVoice-ASR-Streaming-7B ne dichiara dieci: inglese, cinese, spagnolo, portoghese, tedesco, giapponese, coreano, francese, russo e italiano. Se il tuo traffico rientra in queste dieci, la copertura non è un problema; se non rientra, il confronto finisce qui. Le dimensioni sono il secondo costo: 809M parametri gira su un laptop, mentre circa 9B di parametri totali in bf16 significa circa 18 GB di pesi prima della cache KV e una GPU di classe 24 GB per servirlo comodamente. Per i team che già eseguono Whisper su hardware modesto, questo è un vero passo avanti in termini di infrastruttura, giustificato solo da una reale esigenza di trascrizione dal vivo.

Quando gratis non è il punto

Whisper Large v3 Turbo è gratuito da eseguire; il costo è rappresentato dall'hardware e dall'ingegneria che lo circonda. Una distribuzione faster-whisper su una singola T4 costa all'incirca {{1}}$0.05–$0.10{{/1}} all'ora di audio alla tariffa corrente della GPU, e un carico di lavoro continuativo aggiunge lo stack di diarizzazione e punteggiatura che devi costruire perché Whisper restituisce testo semplice. Anche VibeVoice-ASR-Streaming-7B è gratuito da eseguire, su hardware più costoso, in cambio di un'architettura di streaming che dichiara di offrire {{2}}l'attribuzione degli interventi e i controlli contestuali{{/2}} che a Whisper mancano — dichiarazioni che dovresti verificare tu stesso, dato che non esiste alcun benchmark indipendente. Per la trascrizione batch ad alto volume, {{3}}la velocità effettiva e l'impronta minima di Whisper{{/3}} vincono ancora. Per l'audio live multi-relatore in cui la trascrizione deve arrivare durante la conversazione, Whisper lavora contro la propria progettazione e il checkpoint di streaming lavora a suo favore — se funziona del tutto, che è esattamente la domanda a cui rispondere con il tuo audio sulla tua GPU.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

Lo stack pragmatico

La risposta reale più comune nel mondo reale non è "o/o" ma "entrambi", ed è questo il consiglio qui: mantenere Whisper Large v3 Turbo come corsia batch ad alto volume, dove il suo storico e la sua impronta lo rendono imbattibile, e valutare VibeVoice-ASR-Streaming-7B sulla corsia live che Whisper non può servire alla latenza richiesta — con un gate di valutazione esplicito, perché non c'è alcun benchmark su cui fare affidamento. I due possono condividere un unico budget GPU e un'unica base di codice. Laddove un livello di routing dimostra il suo valore in quello stack è il livello sopra le trascrizioni, non la trascrizione stessa: OrcaRouter oggi non instrada il riconoscimento vocale e nessuno dei due modelli è nel suo catalogo, ma i riassuntori, le regole di alerting e i planner per agenti che consumano una trascrizione live sono esattamente i 200+ modelli linguistici che esso interfaccia con una sola API ai prezzi di listino dei provider, trasferiti senza alcun ricarico, e con failover automatico tra i provider. Un checkpoint in streaming che viene rilasciato senza un singolo benchmark merita lo stesso trattamento di qualsiasi modello non provato — una porzione di traffico reale dietro un fallback, che conquista o perde la tua fiducia sulla base delle evidenze delle tue stesse riunioni, piuttosto che su una scheda modello.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube