
VibeVoice-ASR-Streaming-1.5B vs Gemini 3.5 Transcribe: l'ASR in streaming di Microsoft, arrivato in sordina, contro la nuova API di Google
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
Sette giorni e un divario filosofico separano i due più recenti sistemi di sintesi vocale in streaming. Il 26 agosto 2026 Google ha messo Gemini 3.5 Transcribe in anteprima pubblica: un'API di sintesi vocale hosted e chiusa, con tariffazione per token audio e un endpoint Live separato per le sessioni in tempo reale. Il 2 settembre 2026 Microsoft Research ha caricato VibeVoice-ASR-Streaming-1.5B su Hugging Face nello namespace microsoft — pesi con licenza MIT, nessun comunicato stampa, nessun post di lancio e, al momento in cui scriviamo, nessuna copertura da parte di terzi. Entrambi trascrivono il parlato mentre sta ancora arrivando. Quasi tutto il resto — chi può eseguirli, quanto costano, quali prove esistono che funzionino — è diverso.
Questa pagina confronta i due prodotti così come esistono realmente oggi, il che significa che le evidenze disponibili sui due lati del confronto non sono simmetriche. Gemini 3.5 Transcribe è un prodotto Google attivo, con prezzi dei token pubblicati e dati di accuratezza di terze parti da Artificial Analysis; sono i valori etichettati come AA qui di seguito. VibeVoice-ASR-Streaming-1.5B è un checkpoint la cui scheda del modello non riporta in forma testuale alcun tasso di errore sulle parole né alcun valore di latenza — la valutazione della scheda è un'immagine, e l'unico annuncio finora per la famiglia streaming è una riga di notizia datata 3 settembre nel repository GitHub VibeVoice di Microsoft. Tutto ciò che riguarda il lato Microsoft qui di seguito è quanto si può sapere dal repository: i file di configurazione, la scheda del modello e la documentazione di streaming di Microsoft. Non è stato ancora sottoposto ad alcun benchmark indipendente.
I due modelli a colpo d'occhio
• Cos'è — VibeVoice-ASR-Streaming-1.5B: checkpoint aperto, licenza MIT, auto-hostato vs Gemini 3.5 Transcribe: API ospitata, pesi chiusi.
• Rilascio — pesi del 2 settembre 2026, notizie repository del 3 settembre rispetto all'anteprima pubblica del 26 agosto 2026 con materiali di lancio completi.
• Modalità di streaming — emette testo in blocchi di circa 2,9 secondi con un lookahead di circa 0,5 s, stato della sessione mantenuto in una prefix cache, rispetto alla sessione live WebSocket fatturata per token audio, con un massimo di 10 minuti di audio per sessione.
• Accuratezza nella documentazione — nessun valore di WER o latenza pubblicato come testo, rispetto al 2,6% di WER misurato da AA sull’endpoint pre-registrato e al 4,0% sull’endpoint Live.
• Output degli speaker — afferma l'attribuzione in streaming di chi ha detto cosa (non verificata) vs nessuna diarizzazione dei parlanti e nessun timestamp a livello di parola sull'endpoint Live.
• Hotwords — supportate, tramite lo stesso prompt di contesto del batch VibeVoice-ASR, mentre non risultano tra le funzionalità elencate dell'endpoint Live.
• Costo — $0 per i pesi, ~5,6 GB per l'auto-hosting rispetto a ~$0,30 per ora audio in modalità combinata sull'endpoint preregistrato e ~$0,54 su Live, secondo i prezzi dei token indicati da Google.

Un'API ospitata e un upload silenzioso, a sette giorni di distanza.
Gemini 3.5 Transcribe è il modello di trascrizione di Google di livello sostitutivo e viene distribuito come due prodotti. L'endpoint per file pre-registrati, servito tramite l'API Interactions, accetta un file audio completo e restituisce una trascrizione con gli extra previsti. L'endpoint Live, gemini-3.5-transcribe-live, funziona su un WebSocket bidirezionale ed è quello che compete con VibeVoice-ASR-Streaming-1.5B per la natura del compito: trascrivere una sessione in tempo reale. Google lo ha annunciato con il normale meccanismo — un lancio in anteprima pubblica il 26 agosto, i prezzi sulla pagina del modello e classifiche di terze parti che lo hanno adottato entro pochi giorni.
Il rilascio in streaming di Microsoft non aveva nulla di tutto ciò. Il 2 settembre l'account Microsoft su Hugging Face ha creato due checkpoint nello stesso minuto: VibeVoice-ASR-Streaming-7B e VibeVoice-ASR-Streaming-1.5B. La tabella dei modelli del repository GitHub ora elenca VibeVoice-ASR-Streaming come membro della famiglia, e la sua sezione News riporta la riga del 3 settembre che annuncia "un modello ASR di streaming unificato che trascrive in modo continuo chi ha detto cosa mentre il parlato arriva, con supporto per hotwords personalizzate e 10 lingue" — ma quell'annuncio menziona il 7B, mentre il 1.5B è il fratello più piccolo pubblicato insieme senza essere citato. Quando abbiamo controllato un giorno dopo il caricamento, entrambi i checkpoint mostravano ancora zero download.

Cosa significa "streaming" da ogni lato
La parola streaming nasconde una reale differenza di design. La configurazione del preprocessore di Microsoft rende concreto il ritmo di VibeVoice: l'audio arriva a 24 kHz e viene compresso 3.200× in un flusso di token vocali a circa 7,5 Hz (un token ogni ~133 ms). La configurazione dichiara quindi un chunk di 22 frame e un lookahead di 4 frame — circa 2,9 secondi di audio per chunk, con circa mezzo secondo di audio futuro usato per consolidare il segmento corrente. Il modello emette testo una volta per chunk risolto, e la documentazione Microsoft nota che il contesto dei chunk precedenti viene preservato tramite la KV cache, quindi una sessione lunga non ricalcola da zero. L'aritmetica è nella configurazione; la conseguenza pratica è una trascrizione che cresce in incrementi di circa tre secondi, non in risultati parziali parola per parola.
L'endpoint Live di Google ha una forma di streaming diversa: una sessione WebSocket bidirezionale in cui l'audio viene fatturato a 25 token audio al secondo, progettata per l'uso interattivo, ma limitata a 10 minuti di audio per sessione e — specificamente sull'endpoint Live — senza diarizzazione dei parlanti né timestamp a livello di parola. Per chi confronta i due come motori di trascrizione live, le differenze che contano sono il limite di sessione (10 minuti sul lato Live di Google, limitato solo dalla propria GPU e memoria sul lato Microsoft), la cadenza di emissione (blocchi di circa 3 secondi rispetto a ciò che la sessione WebSocket consegna) e gli extra di output (attribuzione dei parlanti e hotwords dichiarati nella scheda Microsoft, assenti dall'elenco delle funzionalità di Google Live).
Precisione: un lato ha i numeri, l'altro ha un'immagine.
Questo è il divario più ampio del confronto, ed è un divario nelle prove, non necessariamente nella qualità. Artificial Analysis misura Gemini 3.5 Transcribe con un tasso di errore sulle parole del 2,6% sull'endpoint preregistrato e del 4,0% sull'endpoint Live — il sovrapprezzo che paghi per la consegna in tempo reale si riflette nel tasso di errore, che è un compromesso comune e onesto per i sistemi di streaming. Questi sono numeri di terze parti su una classifica neutrale, pubblicati giorni dopo il lancio.
VibeVoice-ASR-Streaming-1.5B non ha alcuna cifra paragonabile in giro. La scheda del modello include una figura dei risultati di valutazione come immagine, ma nessun WER, RTF o valore di latenza numerico in prosa — nulla di citabile e nulla di verificabile in modo indipendente. Microsoft non ha messo numeri di accuratezza in streaming in forma testuale né per il 7B né per il 1.5B. L'unico riferimento numerico dell'intera famiglia è la scheda del modello batch VibeVoice-ASR, che riporta un WER medio del 7,77% calcolato dal fornitore su otto set di test inglesi e del 2,20% su LibriSpeech clean — ma questo descrive il modello non in streaming, e i modelli in streaming in genere sacrificano un po' di accuratezza per ottenere il vantaggio in termini di latenza. Finché qualcuno non eseguirà il checkpoint in streaming su un banco di prova pubblico, la posizione onesta è che il modello di Google è misurato e quello di Microsoft no.
Costo: per ora-audio rispetto a per ora-GPU
Google vende Gemini 3.5 Transcribe a token e il prezzo si divide nettamente tra i due endpoint. L'endpoint pre-registrato elenca $2 per 1 milione di token audio in input e $12 per 1 milione di token di testo in output, il che equivale a circa $0,30 all'ora audio in modalità mista. L'endpoint Live elenca $3,50 per 1 milione di token audio e $21 per 1 milione di token di testo — circa $0,54 all'ora audio in modalità mista, ovvero circa l'80% in più rispetto al pre-registrato, che è il prezzo della consegna in tempo reale. Google fattura l'audio a 25 token al secondo, quindi il silenzio è gratuito solo se il tuo client non lo trasmette in streaming; riconnessioni, audio duplicato e logging possono tutti aumentare la bolletta reale. Esiste un livello gratuito, con l'avvertenza che i contenuti del livello gratuito possono essere utilizzati per migliorare i prodotti Google.

Il modello di Microsoft è invece tariffato in base alle ore di GPU. Il checkpoint da 1,5B è di circa 5,6 GB di pesi bf16 (un backbone linguistico Qwen di classe 1,5B più i tokenizer audio e la testa di diffusione — i metadati safetensors ammontano a circa 3B parametri), e i percorsi documentati per eseguirlo sono self-hosted: le demo Python nel repository microsoft/VibeVoice, oppure il plugin vLLM che Microsoft descrive per servire endpoint compatibili con OpenAI e WebSocket. Non esiste ancora un prezzo hosted perché nessun provider di inferenza elenca ancora il modello. La questione dei costi è interamente se il tuo tempo GPU sia più conveniente della tariffa oraria di Google, e per qualsiasi volume sostenuto di trascrizione quasi certamente lo è — e la questione della licenza è separata da quella dei costi, perché i pesi MIT sono tuoi da conservare in un modo che nessun abbonamento API può offrire.
I due approcci non si escludono a vicenda in uno stack di produzione. Il pattern pragmatico per un team che oggi ha bisogno di trascrizione in tempo reale è tenere il layer ASR dietro un unico endpoint, così la scelta resta reversibile: un'API di routing che espone oltre 200 modelli ai prezzi di listino dei provider — nessun ricarico, quindi una variazione di prezzo del fornitore diventa attiva il giorno stesso — con failover automatico, è esattamente il level che consente di usare l'API misurata di Google come predefinita mentre una parte del traffico reale testa VibeVoice-ASR-Streaming-1.5B nel momento in cui un provider lo ospita. Questo è il modello di OrcaRouter, ed è il modo a basso rischio per adottare un checkpoint di cui nessuno ha ancora verificato l'accuratezza.
Chi dovrebbe scegliere cosa
Scegli Gemini 3.5 Transcribe se vuoi un'API di trascrizione che funziona oggi, con accuratezza pubblicata, prezzi prevedibili a ore, e nessuna GPU da gestire — e soprattutto se il tuo audio non rientra nelle dieci lingue elencate da Microsoft, o se hai bisogno della diarizzazione dell'endpoint pre-registrato e dei timestamp a livello di parola per la trascrizione di file. Il limite di 10 minuti per le sessioni Live è un vincolo reale da testare sul tuo caso d'uso prima di impegnarti per le sessioni live.
Scegli VibeVoice-ASR-Streaming-1.5B se fai self-hosting, se vuoi i pesi e il controllo dei dati offerti dalla licenza MIT, se ti serve una durata di sessione senza limiti, o se l'output in streaming con indicazione di chi ha parlato e le hotwords sono funzionalità che intendi valutare di proposito. Considera un'installazione da sorgente, circa 5,6 GB di pesi su una GPU NVIDIA e un tuo criterio di valutazione: non c'è alcun benchmark a cui fare riferimento, quindi la questione dell'accuratezza spetta a te e al tuo audio.
Il verdetto dopo una settimana: Google ha rilasciato il prodotto misurato, Microsoft la scommessa interessante. Gemini 3.5 Transcribe è il default più sicuro, ed è quello con numeri di terze parti alle spalle; VibeVoice-ASR-Streaming-1.5B è l'alternativa open, self-hostable e del tutto priva di verifiche. Ciò che rende la scelta poco costosa è che non deve essere definitiva: basta mantenere l'endpoint ASR sostituibile, e un checkpoint distribuito senza un solo benchmark può guadagnarsi o perdere il vostro traffico sulla base dell'evidenza delle vostre trascrizioni.
