
Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe: la corsia dello streaming appartiene a uno dei due
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 e Gemini 3.5 Transcribe sono i due più recenti modelli di trascrizione vocale all'avanguardia di laboratori rivali, e il modo onesto di confrontarli è ammettere fin da subito che non sono progettati per lo stesso compito. Grok Voice Transcribe 2.0 di SpaceXAI, rilasciato il 18 settembre 2026, è un modello streaming-first con una modalità batch annessa: è in cima alla classifica AA-WER Streaming con un tasso di errore di parola del 2,7% per le trascrizioni finali e del 3,4% per i primi parziali, entrambi arrivano 0,49 secondi dopo la fine del parlato. Gemini 3.5 Transcribe, rilasciato il 26 agosto 2026, è un modello batch-first con uno SKU streaming annesso, e le sue due metà si comportano in modo molto diverso — il percorso preregistrato misura 2,6% AA-WER nella classifica non-streaming di Artificial Analysis, mentre l'endpoint separato gemini-3.5-transcribe-live misura 4,0% nella classifica streaming a 0,40 secondi. Metti quei quattro numeri uno accanto all'altro e la forma di questo confronto è ovvia: sono vicini in accuratezza dove Gemini 3.5 Transcribe è forte, e non sono vicini dove lo è Grok Voice Transcribe 2.0.
L'unica corsia in cui combattono entrambi
Entrambi i modelli possono trascrivere audio dal vivo, quindi lo streaming è l'unico ambito in cui un confronto diretto ha un senso. Lì, Grok Voice Transcribe 2.0 supera Gemini 3.5 Transcribe Live di 1,3 punti in termini di accuratezza della trascrizione finale — 2,7% contro 4,0% di WER sullo stesso banco di prova, le stesse circa otto ore di audio e la stessa ponderazione 50/25/25 su AA-AgentTalk, VoxPopuli ed Earnings22. Non è una differenza di arrotondamento; a quei tassi di errore è all'incirca una parola sbagliata in più ogni settantacinque trascritte dal modello Google. Sulle prime trascrizioni parziali il divario è ancora più ampio, 3,4% contro 5,8%, e le parziali sono le trascrizioni su cui un agente vocale dal vivo deve agire prima che l'oratore abbia finito.
La latenza taglia nella direzione opposta, ed è questa la parte del confronto che si perde. Gemini 3.5 Transcribe Live restituisce la sua trascrizione finale 0,40 secondi dopo la fine del parlato, rispetto ai 0,49 di Grok, e il suo primo parziale in 0,25 secondi, rispetto ai 0,49 di Grok — circa il doppio più veloce ad arrivare alla prima parola utilizzabile. Nessuno dei due modelli compete con l'estremità davvero veloce di questa classifica, dove Deepgram Flux segna 0,02 secondi e Soniox v5 0,05, ma tra questi due il compromesso è esplicito: Google è più rapido a parlare, SpaceXAI ha più probabilità di avere ragione quando lo fa. Per un agente che gestisce l'alternanza dei turni e non deve parlare sopra a chi chiama, 0,24 secondi di latenza parziale in più sono un costo reale che il guadagno in accuratezza deve giustificare.

Dove Gemini 3.5 Transcribe vince davvero
La copertura linguistica è l'aspetto più evidente, e non c'è confronto. Il modello di Google gestisce oltre 85 lingue; Grok Voice Transcribe 2.0 ne supporta decine, con la formattazione della forma scritta — la normalizzazione inversa del testo che converte numeri, date, valute e indirizzi email pronunciati nella loro forma scritta — documentata in 25 lingue. Se il tuo audio è in portoghese, in vietnamita o è un misto con commutazione di codice tra due lingue all'interno di una stessa frase, la domanda su quale modello sia più accurato nella classifica di Artificial Analysis è in gran parte accademica, perché quella classifica è sbilanciata verso l'inglese e piena di conversazioni tra agenti. Google riporta un WER del 5,50% in streaming e del 5,04% non in streaming su FLEURS nell'ambito della propria suite multilingue, cifre dichiarate dal fornitore e non riprodotte in modo indipendente, ma che almeno descrivono il caso multilingue.
Il secondo vantaggio è il piano gratuito. Gemini 3.5 Transcribe offre token di input e output gratuiti sull'API di Google, con l'avvertenza che i contenuti del piano gratuito vengono utilizzati per migliorare i prodotti Google, mentre quelli del piano a pagamento no. Per un prototipo, un progetto secondario o uno strumento interno che elabora audio che altrimenti non pagheresti per trascrivere, è un'opzione reale che nessun fornitore a ore può eguagliare. Grok Voice Transcribe 2.0 è a pagamento dalla prima ora di audio.
E il terzo è che Gemini 3.5 Transcribe è un modello multimodale generico con una modalità di trascrizione, non un servizio ASR creato appositamente. Può ricevere prompt, può accettare testo come contesto e vive nella stessa superficie API di tutto il resto di ciò che Google distribuisce. Se la trascrizione è un passaggio in una pipeline che richiede anche ragionamento sulla trascrizione, tenere entrambi in un'unica chiamata al modello vale qualcosa che un tasso di errore per parola non cattura.
Il calcolo del prezzo, per mille minuti
Artificial Analysis normalizza entrambi i modelli al costo per 1.000 minuti di audio, che è l'unico modo per confrontare una tariffa oraria fissa con la fatturazione a token:
• Batch, preregistrato — Grok Voice Transcribe 2.0 a 1,67 $ per 1.000 minuti (0,10 $/ora) vs Gemini 3.5 Transcribe a 5,00 $ per 1.000 minuti (0,30 $/ora, da 2,00 $ per 1M di token di input e 12,00 $ per 1M di token di output)
• Streaming — Grok Voice Transcribe 2.0 a 3,33 $ per 1.000 minuti (0,20 $/ora) vs Gemini 3.5 Transcribe Live a circa 5,40 $ per 1.000 minuti, derivato da 3,50 $ per 1M di token di input audio e 21,00 $ per 1M di token di output testuale
• Throughput in batch — Grok Voice Transcribe 2.0 a circa 162× il tempo reale contro Gemini 3.5 Transcribe a circa 88× sulla stessa scheda, quindi il modello più economico è anche il più veloce per il lavoro su file
• Limite di sessione live — Grok Voice Transcribe 2.0 trasmette in streaming su un WebSocket senza alcun limite di sessione pubblicato oltre le 100 sessioni simultanee per team, mentre Gemini 3.5 Transcribe Live è limitato a 10 minuti per sessione
Quell'ultima riga è il dettaglio operativo che decide più architetture di quanto facciano i numeri di accuratezza. Un limite massimo di 10 minuti su una sessione dal vivo significa che chiamate lunghe, riunioni lunghe e stream lunghi devono essere spezzati e ristabiliti, e ogni ristabilimento è una giuntura in cui il contesto va perso. L'endpoint di streaming di Grok presenta un limite massimo di dimensione del file di 500 MB sul percorso batch e un limite di concorrenza per team di 100 sessioni sul percorso di streaming, che è un tipo diverso di vincolo — throughput anziché durata.
Vale la pena capire la fatturazione a token prima di impegnarsi sul fronte Google, perché trasforma la tua bolletta in una funzione di due variabili anziché di una sola. Gemini addebita separatamente l'input audio e l'output testuale, quindi un modello che produce una formattazione prolissa o che si ripete costa più di uno che non lo fa, e una lingua con parole più lunghe costa più di una con parole più corte. La tariffa fissa oraria di Grok non varia in base a nulla di tutto questo. Per carichi di lavoro ad alto volume, la tariffa fissa è più facile da prevedere e, poiché OrcaRouter trasmette i prezzi di listino dei fornitori con uno 0% di ricarico, una variazione da parte di uno dei due vendor arriva sulla tua bolletta il giorno stesso in cui avviene, anziché al rinnovo contrattuale successivo.

Forme delle funzionalità: ciò che ciascuna si rifiuta di fare
Gli elenchi delle capacità divergono più di quanto suggeriscano i numeri di accuratezza, e le lacune si trovano in ambiti che contano per applicazioni specifiche:
• Diarizzazione dei parlanti — inclusa senza costi aggiuntivi su Grok Voice Transcribe 2.0; non supportata su Gemini 3.5 Transcribe Live, quindi le trascrizioni live con attribuzione dei parlanti non sono disponibili su quell'endpoint.
• Timestamp a livello di parola — Grok Voice Transcribe 2.0 li restituisce con punteggi di confidenza per parola; Gemini 3.5 Transcribe Live non ne restituisce alcuno, il che esclude l'applicazione di soglie di confidenza e l'allineamento preciso dei sottotitoli
• Audio multicanale — Grok Voice Transcribe 2.0 trascrive fino a 8 canali indipendenti in un'unica passata; Gemini 3.5 Transcribe Live non ha un equivalente, quindi le registrazioni delle chiamate multicanale richiedono sessioni separate per canale
• Bias dei termini chiave — Grok Voice Transcribe 2.0 accetta fino a 100 termini di dominio per richiesta; Gemini 3.5 Transcribe accetta vocabolario personalizzato e suggerimenti linguistici opzionali
• Infrastruttura di base per gli agenti vocali — Grok Voice Transcribe 2.0 include la rimozione delle parole di riempimento e il rilevamento di fine turno Smart Turn; Gemini 3.5 Transcribe Live copre il caso dello streaming ma lascia la logica dei turni all'applicazione
• Gestione dell'input — Grok Voice Transcribe 2.0 accetta il caricamento diretto di file fino a 500 MB in 12 formati audio; il percorso per registrazioni preregistrate di Gemini 3.5 Transcribe prevede un URL HTTPS pubblico con un limite di 15 minuti e 300 MB, e non può combinare la sua modalità Smart formatting con i timestamp delle parole o le etichette dei parlanti
Il filo conduttore di quell'elenco è che SpaceXAI ha costruito un prodotto di trascrizione e Google ha costruito una capacità di trascrizione. La diarizzazione, i timestamp, la suddivisione dei canali e il rilevamento dei turni sono le funzionalità di cui hai bisogno quando la trascrizione è l'intera applicazione; la possibilità di usare prompt, l'ampiezza linguistica e un'unica API per tutto sono ciò che vuoi quando la trascrizione è un passaggio dentro un'applicazione più ampia. Nessuno dei due elenchi è migliore in astratto, e un team che sceglie basandosi solo sull'accuratezza finirà per ritrovarsi privo di qualunque insieme di cui non avesse bisogno.

Scegliere tra loro, e cosa cambia la risposta
Scegli Grok Voice Transcribe 2.0 quando la trascrizione deve essere corretta mentre l'audio è ancora in riproduzione: turni di conversazione tra agenti in tempo reale, sottotitolazione in tempo reale che non può permettersi errori, flussi di contact centre in cui l'attribuzione del parlante e la separazione dei canali fanno parte dei requisiti, o qualsiasi pipeline batch in cui contano sia $1,67 per 1.000 minuti sia una velocità di elaborazione di 162×. Scegli Gemini 3.5 Transcribe quando l'audio è multilingue in una lingua al di fuori dell'insieme documentato di Grok, quando la trascrizione alimenta un modello che deve anche ragionarci sopra, quando vuoi un piano gratuito su cui prototipare, o quando il 2,6% di AA-WER del percorso batch è semplicemente sufficiente per quello che stai facendo e la copertura linguistica aggiuntiva vale più della differenza di prezzo.
Quello che la maggior parte dei team fa davvero in questo caso non è scegliere. Entrambi i modelli sono raggiungibili tramite un'unica chiave API OrcaRouter insieme ad altri 200+ modelli, il che significa che puoi instradare il traffico degli agenti in tempo reale verso Grok Voice Transcribe 2.0 e archivi multilingue lunghi verso Gemini 3.5 Transcribe senza dover mantenere due contratti con i fornitori, due rapporti di fatturazione e due set di credenziali. È anche così che risolvi la questione dell'accuratezza per il tuo audio: esegui entrambi sulle stesse registrazioni, confronta le trascrizioni che hai effettivamente ottenuto e lascia che il DSL di routing instradi il traffico dove deve andare. La classifica ti dice quale modello vince su otto ore di conversazioni in inglese di qualcun altro; solo il tuo audio ti dice quale vince sul tuo.
La questione aperta è cosa accadrà a quel divario in streaming quando Google rivedrà il prossimo endpoint Live. Gemini 3.5 Transcribe Live è stato lanciato in anteprima pubblica e il suo valore del 4,0% è stato misurato circa un giorno dopo che è diventato richiamabile — un forte segnale iniziale, ma che ha avuto meno tempo per consolidarsi rispetto al dato di Grok dietro cui ora si colloca. Se Google colma il divario in streaming di 1,3 punti mantenendo la latenza parziale di 0,25 secondi, il compromesso smette di essere tale e il vantaggio di Grok si riduce a prezzo e funzionalità. Fino ad allora la distinzione è netta: i parziali più veloci sono di Google, quelli più accurati sono di SpaceXAI, e nessun modello sul tabellone è entrambe le cose.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
