Una card titolo hero che confronta 'VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe', sopratitolo 'Streaming ASR - Sett 2026', un sottotitolo che recita due sfidanti dello streaming a un giorno di distanza - l'API di Meta a $0,18 l'ora e il checkpoint MIT di Microsoft senza una piattaforma che lo ospiti, chip 'Pesi MIT - 2 Sett', 'API Meta - 1 Sett' e 'Entrambi non verificati', e una nota a piè di pagina 'La stessa promessa del titolo'. Il logo OrcaRouter è sovrimpresso in basso a destra.
Guides & Insights

VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe: due sfidanti in streaming, a un giorno di distanza

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Nell'arco di circa trentasei ore all'inizio di settembre 2026, due grandi laboratori hanno rilasciato modelli di riconoscimento vocale in streaming che fanno la stessa promessa da titolo: una trascrizione in tempo reale che dice anche chi ha detto cosa, mentre le parole vengono pronunciate. Il 1° settembre, Meta Superintelligence Labs ha lanciato Muse Voice Transcribe come API ospitata al prezzo di $3,00 per 1.000 minuti audio, circa $0,18 all'ora, con riconoscimento in streaming, diarizzazione di oltre 20 parlanti e rilevamento dei turni di parola in un unico passaggio. Il 2 settembre, Microsoft Research ha caricato VibeVoice-ASR-Streaming-7B su Hugging Face: pesi aperti con licenza MIT, nessun annuncio, una scheda del modello che dichiara trascrizione in streaming con attribuzione ai parlanti, hotwords e dieci lingue, e nessuna piattaforma di hosting da nessuna parte. Stessa proposta, modelli di business opposti, e prove da entrambe le parti più scarse di quanto entrambi i laboratori vorrebbero farvi notare.

Questa pagina è scritta come ciò che sappiamo finora, perché nessuno dei due modelli ha una cifra di accuratezza verificata in modo indipendente. I dati di Muse Voice Transcribe sono dichiarazioni del giorno del lancio da parte di Meta, riportate dal fornitore e non riprodotte; VibeVoice-ASR-Streaming-7B non ha pubblicato alcuna cifra di accuratezza in streaming in formato testuale. Il confronto qui sotto si basa quindi su ciò che è strutturale e conoscibile — architettura, prezzo, licenza, comportamento documentato — ed etichetta le poche cifre del fornitore dove compaiono.

Due sfidanti per la pipeline batch, a distanza di un giorno

Entrambi i modelli attaccano lo stesso presupposto: che la trascrizione vocale sia qualcosa che si esegue su una registrazione già completata. Muse Voice Transcribe è il primo prodotto che Meta definisce un "modello di percezione audio in tempo reale" — un singolo passaggio in streaming che esegue riconoscimento vocale, diarizzazione dei parlanti su più di venti voci e rilevamento dell'endpoint, cioè il compito di decidere quando un parlante ha davvero finito invece di essersi semplicemente fermato. È disponibile su tre fronti contemporaneamente: la Meta Model API a 0,18 dollari per ora di audio, Meta AI for Mac, dove tenendo premuto il tasto Fn si detta in qualsiasi applicazione, e Muse Code. Il modello VibeVoice-ASR-Streaming-7B di Microsoft è il componente in streaming della famiglia open source VibeVoice, e le tracce del suo rilascio sono molto più discrete: un repository Hugging Face creato il 2 settembre (i timestamp mostrano le 15:46 UTC, con l'ultima modifica tre minuti dopo), otto shard di safetensors con licenza MIT e una riga del news-log del repository GitHub microsoft/VibeVoice, datata 3 settembre, che lo definisce "un modello ASR unificato in streaming che trascrive continuamente chi ha detto cosa man mano che il parlato arriva, con supporto per hotword personalizzate e 10 lingue." Un giorno dopo il caricamento mostrava ancora zero download.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

La collisione delle funzionalità

• Meccanismo di streaming — Muse Voice Transcribe consuma audio in blocchi da 80 millisecondi e conferma le parole man mano che si stabilizzano, mentre VibeVoice-ASR-Streaming-7B elabora blocchi di ~2,9 secondi con ~0,5 secondi di lookahead, emettendo testo una volta per ogni blocco risolto.

• Attribuzione dei parlanti — 20+ parlanti in una sola passata, errore medio di diarizzazione del 17,5% riportato dal fornitore rispetto all'output in streaming "chi ha detto cosa", dichiarato sulla scheda del modello, non verificato.

• Endpointing — integrato: lo stream trasporta un confine di fine enunciato vs non documentato come segnale di uscita.

• Controlli di contesto — bias linguistico, di parole chiave e contestuale rispetto a hotword personalizzate tramite un prompt di contesto (--context_info).

• Lingue — addestrato su oltre 70 lingue, 25 ampiamente verificate al lancio, code-switching nativo rispetto alle 10 dichiarate (en, zh, es, pt, de, ja, ko, fr, ru, it).

• Prove — dichiarazioni del fornitore al lancio: 3.1% WER sulle ipotesi finali a 0.16 s dopo il parlato, 3.6% sulle prime ipotesi parziali, citando la classifica streaming di Artificial Analysis, contro nessun dato di WER o latenza in streaming pubblicato come testo.

• Costo e licenza — $0,18 per ora audio, hosted, pesi chiusi, contro $0 per i pesi (MIT), circa 18 GB di bf16, self-hosted.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): business model - open weights MIT self-hosted; streaming cadence - ~2.9 s chunks, config-derived; speaker output - claimed who-said-what, unverified; endpointing - not documented; languages - 10 declared; price - $0 weights, ~18 GB bf16. Right column Muse Voice Transcribe (released Sep 1, 2026 - Meta Model API): hosted API closed weights; 80 ms chunks, adaptive delay, finals 0.16 s (vendor); 20+ speakers, 17.5% avg DER (vendor); built-in turn-end signal; 25 verified (70+ trained); $0.18 per audio-hour. Footer: 'Muse figures are vendor-reported launch-day claims. VibeVoice specs read from the HF repo. Neither is independently benchmarked.'

Due idee molto diverse di "streaming"

Il termine streaming copre un'ampia gamma di cadenze, e il divario tra questi due estremi è sufficientemente ampio da cambiare ciò che puoi costruire su ciascuno di essi. Muse Voice Transcribe trasmette con granularità di parola. L'architettura di Meta consuma audio in blocchi da 80 millisecondi e utilizza quello che definisce "ritardo adattivo" — una politica di ritardo appresa tramite apprendimento per rinforzo che finalizza ogni parola non appena il modello è confidente, trattenendo più contesto per le parole di cui è meno certo anziché applicare un budget di latenza fisso. Il fornitore dichiara trascrizioni finali 0,16 secondi dopo che chi parla si ferma e prime trascrizioni parziali a 0,13 secondi dall'inizio. Questa cadenza è pensata per loop interattivi: sottotitoli in tempo reale, dettatura, un agente vocale che deve rispondere a un enunciato completato quasi immediatamente.

VibeVoice-ASR-Streaming-7B opera a una granularità più grossolana per lo streaming. La sua configurazione del preprocessore mostra audio in arrivo a 24 kHz, compresso 3.200× in token a circa 7,5 frame al secondo, poi elaborato in blocchi da 22 frame con 4 frame di lookahead — circa 2,9 secondi di audio per blocco, circa mezzo secondo di lookahead, valori derivati dalla configurazione piuttosto che da una latenza misurata. Il testo viene emesso man mano che ogni blocco viene risolto, con il contesto dei blocchi precedenti preservato tramite la cache KV, così una sessione lunga non ricalcola da zero. Una trascrizione che cresce con incrementi di circa tre secondi va bene per note di riunioni e analisi delle chiamate; è un prodotto diverso dallo streaming di parole in meno di un secondo per conversazioni dal vivo. Nessuno dei due laboratori ha pubblicato una misurazione della latenza end-to-end per il checkpoint di streaming, quindi trattate la cadenza come il progetto previsto e la sensazione nel mondo reale come non testata.

Etichette dei parlanti ed endpointing: integrati sull'uno, dichiarati sull'altro

L’attribuzione dei parlanti è l’ambito in cui i prodotti di trascrizione in streaming fanno più spesso affermazioni eccessive, ed entrambi questi prodotti affermano di offrirla. La versione di Muse Voice Transcribe è concreta e strutturale: la diarizzazione avviene nella stessa passata in streaming del riconoscimento, quindi una registrazione di una chiamata con venti partecipanti può riportare etichette per singolo parlante senza un passaggio separato del tipo “carica, attendi, ricevi i parlanti”, e Meta riporta un tasso medio di errore di diarizzazione del 17,5% — un numero dichiarato dal fornitore, mai replicato, ma un numero comunque legato a un meccanismo reale. Emette inoltre i confini di turno, la capacità più discreta: un’applicazione riceve un segnale pulito che indica “il turno di questo parlante è terminato” senza dover costruire un rilevatore di attività vocale, ed è per questo che gli agenti vocali basati su ASR grezzo interrompono così spesso chi sta parlando.

VibeVoice-ASR-Streaming-7B dichiara sulla sua scheda del modello un output in streaming di chi-ha-detto-cosa, in linea con l'output strutturato Who/When/What del batch VibeVoice-ASR — ma per il checkpoint di streaming l'affermazione non è verificata, nessun test indipendente l'ha riprodotta, e non esiste un segnale di endpointing documentato del tipo che Muse offre. Se il tuo carico di lavoro è realmente audio live multi-parlante, Muse oggi offre un meccanismo più completo; se stai valutando se un modello a pesi aperti possa fare lo stesso lavoro su hardware che controlli tu, l'affermazione di VibeVoice è esattamente il tipo di cosa da testare con le tue registrazioni di riunioni prima di crederci.

Le prove: affermazioni del giorno di lancio contro una carta vuota.

Vale la pena essere precisi su ciò che ciascuna parte offre, perché nessuna delle due ha ciò che un acquirente vuole davvero. Muse Voice Transcribe presenta una serie fitta di numeri forniti dal venditore — 3,1% di tasso di errore sulle parole nelle trascrizioni finali, 3,6% sulle prime trascrizioni parziali, latenza finale di 0,16 secondi, 17,5% di errore medio di diarizzazione — tutti pubblicati da Meta il giorno del lancio e che puntano alla classifica dello streaming speech-to-text di Artificial Analysis, dove Meta sostiene di occupare il primo posto. Queste sono affermazioni, non riprodotte da nessuno al di fuori del laboratorio, ma sono abbastanza specifiche da poter essere falsificate, il che è una forma di progresso.

VibeVoice-ASR-Streaming-7B non ha nulla di tutto ciò. La sua model card presenta una figura di valutazione come immagine e il report tecnico di streaming è un PDF, ma non c'è alcun valore di WER in streaming o di latenza citabile nel testo discorsivo. L'unico riferimento numerico nella famiglia VibeVoice è la tabella riportata dal vendor nella scheda del batch VibeVoice-ASR — 7,77% di WER medio su otto set di test inglesi, 2,20% su LibriSpeech clean — che esplicitamente non è il numero di questo checkpoint. Quando una dichiarazione del giorno del lancio incontra una scheda vuota, il criterio onesto per dirimere la questione è tutto tranne il WER di punta: prezzo, licenza, cadenza di streaming e le funzionalità che ciascuna parte documenta davvero.

Lingue: 25 verificate rispetto a 10 dichiarate

La copertura linguistica distingue i due modelli più di quanto facciano le dichiarazioni di accuratezza principali. Muse Voice Transcribe è stata addestrata su 70+ lingue, ma Meta ne valida 25 al lancio — e l'elenco verificato, non quello di addestramento, è la copertura effettiva in produzione, con il code-switching nativo come elemento distintivo: è progettata per passare da una lingua all'altra a metà frase senza che le venga detto. VibeVoice-ASR-Streaming-7B dichiara 10 lingue nella sua scheda modello — inglese, cinese, spagnolo, portoghese, tedesco, giapponese, coreano, francese, russo, italiano — contro le 50+ della versione batch VibeVoice-ASR. Se il tuo traffico include conversazioni con code-switching, Muse ha la proposta più specifica; se si colloca all'interno di quelle dieci lingue, la copertura del modello Microsoft è quantomeno esplicita, il che è più di quanto offrano la maggior parte dei materiali di lancio.

Costo e ciò che conservi

La differenza di modello di business è il criterio di scelta più chiaro. Muse Voice Transcribe, a $0,18 per ora di audio, batte sul prezzo di listino tutte le principali API di trascrizione in streaming — niente GPU, zero gestione operativa, pesi chiusi, prezzo fissato da Meta. VibeVoice-ASR-Streaming-7B è gratuito da scaricare, ma richiede circa 18 GB di pesi bf16, prima ancora della cache KV, per l'auto-hosting su una GPU di classe 24 GB; i percorsi di serving documentati sono gli script demo di microsoft/VibeVoice o il plugin vLLM, e nessun provider di inferenza lo ospita ancora. La licenza MIT è il vantaggio durevole: i pesi restano tuoi, da conservare e mettere a punto, cosa che nessun abbonamento API può offrire. Ed è anche qui che il quadro dei prezzi potrebbe farsi interessante: quando un provider ospita il checkpoint aperto, la tariffa di $0,18 l'ora diventa un prezzo di mercato, non più il prezzo di listino di un singolo fornitore — ed è esattamente la situazione in cui un router pass-through dimostra il suo valore. OrcaRouter oggi non instrada il riconoscimento vocale e nessuno di questi due modelli figura nel suo catalogo; ciò che invece fa è inoltrare i prezzi di listino dei provider con un ricarico dello 0% sui 200+ modelli linguistici che usano una trascrizione in tempo reale, così un taglio di prezzo da parte di un fornitore in qualsiasi punto di quello stack è effettivo per l'acquirente lo stesso giorno in cui viene annunciato.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

Domande frequenti

Il 3,1% di WER di Muse Voice Transcribe significa che è più accurato di VibeVoice-ASR-Streaming-7B?

No, e il confronto non è ancora significativo. Il 3,1% di Meta è un'affermazione del giorno del lancio per il percorso di streaming, riportata dal fornitore e non riprodotta. VibeVoice-ASR-Streaming-7B non ha pubblicato alcuna cifra di accuratezza per lo streaming in alcun testo. Finché entrambi i modelli non saranno stati eseguiti con lo stesso benchmark pubblico sugli stessi audio, l'unica dichiarazione onesta è che Muse ha un'affermazione specifica che può essere testata e VibeVoice non ne ha ancora una.

Posso usare uno dei due modelli su audio già registrato?

Sì a entrambi, con forme diverse. Muse Voice Transcribe gestisce registrazioni più lunghe di un'ora tramite la stessa API di streaming. Il plugin vLLM di VibeVoice-ASR-Streaming-7B espone un endpoint di trascrizione dell'intero file accanto al proprio endpoint di streaming WebSocket. Ma entrambi sono progettati e tariffati per il caso live — Muse dato il suo modello di business incentrato esclusivamente sullo streaming, VibeVoice data la sua architettura a chunk che emette man mano che l'audio arriva — quindi, se il tuo carico di lavoro consiste unicamente in file batch, un'API di trascrizione file dedicata sarà di solito più economica e meglio misurabile rispetto a entrambi.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube