Card hero dell'articolo che riporta 'Grok Voice Transcribe 2.0', con il badge 'NOTIZIE' e il sottotitolo 'Lo slot n. 1 per l'accuratezza dello streaming, a un prezzo invariato', con chip che riportano 2,7% WER trascrizione finale, 3,4% primo parziale, 0,49 s dopo la fine del parlato e 0,20 $ per ora di streaming, su un gradiente dal bianco al blu con il logo OrcaRouter in basso a destra.
Engineering & Research

Grok Voice Transcribe 2.0 conquista il primo posto nella classifica di precisione in streaming a un prezzo invariato

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Grok Voice Transcribe 2.0 è il modello speech-to-text che SpaceXAI ha rilasciato il 18 settembre 2026, e l'unico numero che conta al riguardo non è quello con cui si apre il post di lancio. È questo: la prima trascrizione parziale — il testo su cui un voice agent può effettivamente agire mentre si sta ancora parlando sopra il chiamante — è passata da un word error rate del 18,3% in Grok Voice Transcribe 1.0 al 3,4%. Questa è la misurazione sulla board AA-WER Streaming di Artificial Analysis, dove il nuovo modello ora occupa il primo posto sia nella classifica Final Transcript (2,7% WER, 0,49 secondi dopo la fine del parlato) sia in quella First Partial Transcript (3,4%, 0,49 secondi). È migliorata anche l'accuratezza della trascrizione finale, dal 3,9% al 2,7%, il che è reale ma modesto. Il balzo della trascrizione parziale è quello che cambia ciò che puoi costruire.

Che cosa è cambiato effettivamente tra la 1.0 e la 2.0

Le due versioni sono lo stesso prodotto nella stessa API, e SpaceXAI non ha apportato modifiche all'interfaccia: Grok Voice Transcribe 2.0 si seleziona passando grok-voice-transcribe-2.0 a /v1/stt invece di grok-voice-transcribe-1.0, oppure scegliendolo quando viene creata la connessione WebSocket per lo streaming. Le integrazioni esistenti che omettono il parametro model continuano a ottenere la 1.0 finché SpaceXAI non inverte l'impostazione predefinita, cosa che l'azienda afferma che avverrà nelle prossime settimane insieme alla deprecazione della versione precedente. Fino ad allora la 2.0 è opt-in e la 1.0 può essere fissata deliberatamente, che è il modo giusto per un cambiamento come questo: puoi fare A/B test sul tuo audio prima che diventi la tua impostazione predefinita di produzione, che tu l'abbia chiesto o no.

I numeri di Artificial Analysis, letti fianco a fianco, raccontano una storia più specifica rispetto a «due volte più accurato»:

• Accuratezza finale della trascrizione — Grok Voice Transcribe 2.0 al 2,7% di WER rispetto a Grok Voice Transcribe 1.0 al 3,9% su AA-WER Streaming, entrambi misurati dopo la fine del parlato

• Accuratezza della prima trascrizione parziale — 3,4% WER rispetto al 18,3%, il divario singolo più ampio tra le due versioni

• Tempo alla trascrizione finale — 0,49 s contro 0,37 s, quindi il nuovo modello è più lento a finalizzare rispetto a quello che sostituisce

• Tempo al primo parziale — 0,49s vs 0,25s, anch'esso più lento

• Precisione batch (non in streaming) — 2,3% AA-WER sulla classifica non in streaming di Artificial Analysis, contro il 4,07% di Whisper Large v3 e il 3,31% di GPT Transcribe

• Throughput in batch — circa 162× il tempo reale sulla stessa scheda, dietro il 333× di MAI-Transcribe-2 e davanti all'88× di Gemini 3.5 Transcribe

Quella quarta e quinta riga sono l'onesto caveat in questa release. SpaceXAI ha comprato accuratezza con la latenza. Il nuovo modello è circa un terzo di secondo più lento nel restituire il suo primo parziale e la sua trascrizione finale rispetto alla versione 1.0. In una classifica in cui Deepgram Flux restituisce un parziale in 0,02 secondi e Soniox v5 in 0,05, Grok Voice Transcribe 2.0 non compete affatto sulla velocità — compete sull'essere corretto, e vince questo scambio con un ampio margine. Se questo sia lo scambio giusto dipende interamente dal fatto che la tua applicazione sia un agente vocale dal vivo che deve iniziare a rispondere a voce, o una pipeline di trascrizione in cui mezzo secondo è invisibile.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Grok Voice Transcribe 1.0 — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% final transcript WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives Grok Voice Transcribe 1.0 3.9%, 18.3%, 0.37s and the same two prices, with throughput not measured; the footer credits both columns to Artificial Analysis.

L'affermazione «due volte più preciso», verificata

Il punto di forza dichiarato da SpaceXAI è che 2.0 è due volte più accurato di 1.0 allo stesso prezzo, e la sua stessa tabella di valutazione lo conferma sui set che ha scelto. Su chiamate di assistenza clienti in inglese a 8 kHz, il tasso di errore sulle parole è sceso dal 10,6% al 7,1%. Su conversazioni con Grok, dall'8,7% al 3,3%. Su credenziali pronunciate — codici account, numeri di telefono, indirizzi email — dal 7,2% al 3,2%. Su comandi brevi in 19 lingue, dal 20,6% al 6,8%, una riduzione degli errori di circa due terzi. Questi quattro set sono tratti dal traffico di produzione di SpaceXAI e i confronti sono di SpaceXAI stessa; nessuno al di fuori dell'azienda li ha riprodotti. Considera la tabella come una mappa di dove il modello è stato ottimizzato, non come una garanzia generale di accuratezza.

Il risultato di Artificial Analysis è la parte che non è dichiarata dall'azienda: un banco di prova indipendente eseguito su circa otto ore di audio, ponderate al 50% sul set privato AA-AgentTalk e al 25% ciascuno su VoxPopuli ed Earnings22. Supporta un'affermazione più circoscritta e più utile rispetto a "due volte più accurato" — e cioè che su quella specifica combinazione questo modello è il trascrittore in streaming più accurato mai misurato. Una sfumatura che vale la pena menzionare: il post di SpaceXAI descrive un primo posto "tra 32 modelli in streaming", mentre la pagina della classifica stessa ne rappresenta 27 su 33. La posizione è reale; la dimensione del campo nel testo di marketing è il conteggio dell'azienda, non quello della classifica.

Vale anche la pena essere precisi su cosa copre e cosa non copre un primo posto su AA-WER Streaming. La classifica è ponderata sull'inglese e contiene molte conversazioni tra agenti. Non misura il tuo accento, il tuo codec, il vocabolario del tuo dominio o l'audio a otto canali del tuo call center. Un modello che la domina può comunque perdere nettamente sulle tue registrazioni, ed è esattamente per questo che la finestra di opt-in conta.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first on both the Final Transcription ranking at 2.728% word error rate and 0.490s and the First Partial Transcription ranking at 3.359% and 0.489s, with Grok Voice Transcribe 1.0 further down at 18.275% on partials.

I prezzi restano invariati, e questo è il secondo fatto più importante qui

Grok Voice Transcribe 2.0 costa quanto costava la 1.0: $0,10 per ora di audio per batch e file registrati tramite l'endpoint REST, $0,20 per ora di audio per lo streaming tramite WebSocket. Sul listino prezzi di Artificial Analysis lo SKU streaming si attesta a $3,33 per 1.000 minuti e lo SKU batch a $1,67 — la stessa tariffa batch che Microsoft applica per MAI-Transcribe-2, e circa un terzo di quanto costa ElevenLabs Scribe v2 Realtime per minuto di streaming.

La diarizzazione, i timestamp a livello di parola con punteggi di confidenza e il biasing dei termini chiave sono tutti inclusi a quella tariffa anziché fatturati separatamente, cosa non universale in questo mercato. Gemini 3.5 Transcribe Live fattura per token sia sull'input audio sia sull'output testuale, quindi il costo varia in base a quanto dice il modello, non solo a quanto è durato l'audio. Una tariffa fissa oraria è più facile da prevedere e da confrontare tra fornitori — e poiché OrcaRouter riporta i prezzi di listino dei provider con markup dello 0%, una modifica di quella tariffa da parte del fornitore comparirebbe dalla nostra parte lo stesso giorno, anziché dopo un ciclo di riprezzamento.

Cosa ti offre effettivamente l'API

L'elenco delle capacità è ampio e per lo più ereditato anziché nuovo, il che è utile sapere se stai valutando l'aggiornamento solo in base alle funzionalità:

• Batch e streaming in un unico modello — REST per file registrati fino a 500 MB, WebSocket su wss://api.x.ai/v1/stt con risultati intermedi emessi all'incirca ogni 500 ms

• Diarizzazione dei parlanti inclusa, oltre alla trascrizione multicanale di fino a 8 canali indipendenti

• Timestamp a livello di parola con punteggi di confidenza, così puoi applicare una soglia agli intervalli a bassa confidenza invece di fidarti dell'intera trascrizione in modo uniforme

• Ponderazione dei termini chiave fino a 100 termini di dominio per richiesta, ciascuno fino a 50 caratteri

• Normalizzazione inversa del testo per numeri, date, valute, numeri di telefono e indirizzi email, con formattazione in forma scritta supportata in 25 lingue

• Rimozione delle parole riempitive e rilevamento della fine del turno Smart Turn, mirati espressamente agli agenti vocali

• Rilevamento automatico della lingua con cambio di lingua durante la registrazione in un'unica passata, su 12 formati audio e frequenze di campionamento da 8 kHz a 48 kHz

• Limiti di servizio di 10 richieste al secondo sia su REST sia in streaming, e 100 sessioni di streaming simultanee per team, ospitati in us-east-1

L'unica nota di produzione che non compare nell'elenco delle funzionalità: il servizio viene eseguito in un'unica regione. Se il tuo audio ha origine al di fuori degli Stati Uniti, il segmento di rete ora fa parte del tuo budget di latenza, e AA-WER Streaming include esplicitamente il ritardo di rete nella propria temporizzazione. SpaceXAI offre termini di conservazione zero dei dati e cita SOC 2 Type II, BAA e opzioni di residenza dei dati nell'UE, quindi la storia di conformità è più sviluppata di quella geografica.

Screenshot of the SpaceXAI docs.x.ai Speech-to-Text page listing the Grok Voice Transcribe 2.0 REST and WebSocket endpoints, the grok-voice-transcribe-2.0 model parameter, the 500 MB file limit, key-term biasing and the published rate limits.

Chi dovrebbe muoversi e cosa tenere d'occhio

Se sei già su Grok Voice Transcribe 1.0 e la tua applicazione agisce su trascrizioni parziali — rilevamento del turno, barge-in, risposte dell'agente in tempo reale — il divario di accuratezza parziale dal 18,3% al 3,4% è abbastanza ampio che testare la 2.0 non è opzionale. Quel numero che passa da "di solito sbagliato" a "di solito giusto" è la differenza tra una trascrizione parziale su cui puoi instradare e una che puoi solo visualizzare. Se la tua applicazione attende trascrizioni finali su file registrati, il miglioramento è reale ma più piccolo, e i 0,12 secondi aggiunti di latenza di commit sono il costo.

Se lavori con un fornitore del tutto diverso, il motivo per guardare questa release non è la posizione in classifica: è che un laboratorio di frontiera ha appena migliorato il proprio modello di trascrizione con un margine ampio senza aumentare il prezzo, ed è questo l'aspetto che ha un mercato quando la precisione smette di essere ciò per cui si fa pagare. Anche il percorso di aggiornamento è del tipo più economico: un solo parametro, nessuna modifica al codice, nessun nuovo contratto e un pin disponibile se qualcosa va storto.

La prossima cosa da tenere d'occhio è il cambio di default. Quando SpaceXAI renderà la 2.0 predefinita e inizierà a deprecare la 1.0, ogni integrazione che non ha mai specificato un parametro del modello passerà subito al nuovo modello, cambiamento di latenza incluso. I team che dipendono dal vecchio timing parziale di 0,25 secondi dovrebbero fissare la versione adesso invece di scoprire il cambiamento in produzione. La seconda cosa da tenere d'occhio è la riproduzione indipendente: la voce su Artificial Analysis è una misurazione reale, ma è una singola classifica su un singolo mix audio, e nessuna terza parte ha ancora pubblicato un'esecuzione comparabile 1.0 contro 2.0 su audio di produzione.