
Grok Voice Transcribe 2.0 conquista il primo posto nella classifica di precisione in streaming a un prezzo invariato
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 è il modello speech-to-text che SpaceXAI ha rilasciato il 18 settembre 2026, e l'unico numero che conta al riguardo non è quello con cui si apre il post di lancio. È questo: la prima trascrizione parziale — il testo su cui un voice agent può effettivamente agire mentre si sta ancora parlando sopra il chiamante — è passata da un word error rate del 18,3% in Grok Voice Transcribe 1.0 al 3,4%. Questa è la misurazione sulla board AA-WER Streaming di Artificial Analysis, dove il nuovo modello ora occupa il primo posto sia nella classifica Final Transcript (2,7% WER, 0,49 secondi dopo la fine del parlato) sia in quella First Partial Transcript (3,4%, 0,49 secondi). È migliorata anche l'accuratezza della trascrizione finale, dal 3,9% al 2,7%, il che è reale ma modesto. Il balzo della trascrizione parziale è quello che cambia ciò che puoi costruire.
Che cosa è cambiato effettivamente tra la 1.0 e la 2.0
Le due versioni sono lo stesso prodotto nella stessa API, e SpaceXAI non ha apportato modifiche all'interfaccia: Grok Voice Transcribe 2.0 si seleziona passando grok-voice-transcribe-2.0 a /v1/stt invece di grok-voice-transcribe-1.0, oppure scegliendolo quando viene creata la connessione WebSocket per lo streaming. Le integrazioni esistenti che omettono il parametro model continuano a ottenere la 1.0 finché SpaceXAI non inverte l'impostazione predefinita, cosa che l'azienda afferma che avverrà nelle prossime settimane insieme alla deprecazione della versione precedente. Fino ad allora la 2.0 è opt-in e la 1.0 può essere fissata deliberatamente, che è il modo giusto per un cambiamento come questo: puoi fare A/B test sul tuo audio prima che diventi la tua impostazione predefinita di produzione, che tu l'abbia chiesto o no.
I numeri di Artificial Analysis, letti fianco a fianco, raccontano una storia più specifica rispetto a «due volte più accurato»:
• Accuratezza finale della trascrizione — Grok Voice Transcribe 2.0 al 2,7% di WER rispetto a Grok Voice Transcribe 1.0 al 3,9% su AA-WER Streaming, entrambi misurati dopo la fine del parlato
• Accuratezza della prima trascrizione parziale — 3,4% WER rispetto al 18,3%, il divario singolo più ampio tra le due versioni
• Tempo alla trascrizione finale — 0,49 s contro 0,37 s, quindi il nuovo modello è più lento a finalizzare rispetto a quello che sostituisce
• Tempo al primo parziale — 0,49s vs 0,25s, anch'esso più lento
• Precisione batch (non in streaming) — 2,3% AA-WER sulla classifica non in streaming di Artificial Analysis, contro il 4,07% di Whisper Large v3 e il 3,31% di GPT Transcribe
• Throughput in batch — circa 162× il tempo reale sulla stessa scheda, dietro il 333× di MAI-Transcribe-2 e davanti all'88× di Gemini 3.5 Transcribe
Quella quarta e quinta riga sono l'onesto caveat in questa release. SpaceXAI ha comprato accuratezza con la latenza. Il nuovo modello è circa un terzo di secondo più lento nel restituire il suo primo parziale e la sua trascrizione finale rispetto alla versione 1.0. In una classifica in cui Deepgram Flux restituisce un parziale in 0,02 secondi e Soniox v5 in 0,05, Grok Voice Transcribe 2.0 non compete affatto sulla velocità — compete sull'essere corretto, e vince questo scambio con un ampio margine. Se questo sia lo scambio giusto dipende interamente dal fatto che la tua applicazione sia un agente vocale dal vivo che deve iniziare a rispondere a voce, o una pipeline di trascrizione in cui mezzo secondo è invisibile.

L'affermazione «due volte più preciso», verificata
Il punto di forza dichiarato da SpaceXAI è che 2.0 è due volte più accurato di 1.0 allo stesso prezzo, e la sua stessa tabella di valutazione lo conferma sui set che ha scelto. Su chiamate di assistenza clienti in inglese a 8 kHz, il tasso di errore sulle parole è sceso dal 10,6% al 7,1%. Su conversazioni con Grok, dall'8,7% al 3,3%. Su credenziali pronunciate — codici account, numeri di telefono, indirizzi email — dal 7,2% al 3,2%. Su comandi brevi in 19 lingue, dal 20,6% al 6,8%, una riduzione degli errori di circa due terzi. Questi quattro set sono tratti dal traffico di produzione di SpaceXAI e i confronti sono di SpaceXAI stessa; nessuno al di fuori dell'azienda li ha riprodotti. Considera la tabella come una mappa di dove il modello è stato ottimizzato, non come una garanzia generale di accuratezza.
Il risultato di Artificial Analysis è la parte che non è dichiarata dall'azienda: un banco di prova indipendente eseguito su circa otto ore di audio, ponderate al 50% sul set privato AA-AgentTalk e al 25% ciascuno su VoxPopuli ed Earnings22. Supporta un'affermazione più circoscritta e più utile rispetto a "due volte più accurato" — e cioè che su quella specifica combinazione questo modello è il trascrittore in streaming più accurato mai misurato. Una sfumatura che vale la pena menzionare: il post di SpaceXAI descrive un primo posto "tra 32 modelli in streaming", mentre la pagina della classifica stessa ne rappresenta 27 su 33. La posizione è reale; la dimensione del campo nel testo di marketing è il conteggio dell'azienda, non quello della classifica.
Vale anche la pena essere precisi su cosa copre e cosa non copre un primo posto su AA-WER Streaming. La classifica è ponderata sull'inglese e contiene molte conversazioni tra agenti. Non misura il tuo accento, il tuo codec, il vocabolario del tuo dominio o l'audio a otto canali del tuo call center. Un modello che la domina può comunque perdere nettamente sulle tue registrazioni, ed è esattamente per questo che la finestra di opt-in conta.

I prezzi restano invariati, e questo è il secondo fatto più importante qui
Grok Voice Transcribe 2.0 costa quanto costava la 1.0: $0,10 per ora di audio per batch e file registrati tramite l'endpoint REST, $0,20 per ora di audio per lo streaming tramite WebSocket. Sul listino prezzi di Artificial Analysis lo SKU streaming si attesta a $3,33 per 1.000 minuti e lo SKU batch a $1,67 — la stessa tariffa batch che Microsoft applica per MAI-Transcribe-2, e circa un terzo di quanto costa ElevenLabs Scribe v2 Realtime per minuto di streaming.
La diarizzazione, i timestamp a livello di parola con punteggi di confidenza e il biasing dei termini chiave sono tutti inclusi a quella tariffa anziché fatturati separatamente, cosa non universale in questo mercato. Gemini 3.5 Transcribe Live fattura per token sia sull'input audio sia sull'output testuale, quindi il costo varia in base a quanto dice il modello, non solo a quanto è durato l'audio. Una tariffa fissa oraria è più facile da prevedere e da confrontare tra fornitori — e poiché OrcaRouter riporta i prezzi di listino dei provider con markup dello 0%, una modifica di quella tariffa da parte del fornitore comparirebbe dalla nostra parte lo stesso giorno, anziché dopo un ciclo di riprezzamento.
Cosa ti offre effettivamente l'API
L'elenco delle capacità è ampio e per lo più ereditato anziché nuovo, il che è utile sapere se stai valutando l'aggiornamento solo in base alle funzionalità:
• Batch e streaming in un unico modello — REST per file registrati fino a 500 MB, WebSocket su wss://api.x.ai/v1/stt con risultati intermedi emessi all'incirca ogni 500 ms
• Diarizzazione dei parlanti inclusa, oltre alla trascrizione multicanale di fino a 8 canali indipendenti
• Timestamp a livello di parola con punteggi di confidenza, così puoi applicare una soglia agli intervalli a bassa confidenza invece di fidarti dell'intera trascrizione in modo uniforme
• Ponderazione dei termini chiave fino a 100 termini di dominio per richiesta, ciascuno fino a 50 caratteri
• Normalizzazione inversa del testo per numeri, date, valute, numeri di telefono e indirizzi email, con formattazione in forma scritta supportata in 25 lingue
• Rimozione delle parole riempitive e rilevamento della fine del turno Smart Turn, mirati espressamente agli agenti vocali
• Rilevamento automatico della lingua con cambio di lingua durante la registrazione in un'unica passata, su 12 formati audio e frequenze di campionamento da 8 kHz a 48 kHz
• Limiti di servizio di 10 richieste al secondo sia su REST sia in streaming, e 100 sessioni di streaming simultanee per team, ospitati in us-east-1
L'unica nota di produzione che non compare nell'elenco delle funzionalità: il servizio viene eseguito in un'unica regione. Se il tuo audio ha origine al di fuori degli Stati Uniti, il segmento di rete ora fa parte del tuo budget di latenza, e AA-WER Streaming include esplicitamente il ritardo di rete nella propria temporizzazione. SpaceXAI offre termini di conservazione zero dei dati e cita SOC 2 Type II, BAA e opzioni di residenza dei dati nell'UE, quindi la storia di conformità è più sviluppata di quella geografica.

Chi dovrebbe muoversi e cosa tenere d'occhio
Se sei già su Grok Voice Transcribe 1.0 e la tua applicazione agisce su trascrizioni parziali — rilevamento del turno, barge-in, risposte dell'agente in tempo reale — il divario di accuratezza parziale dal 18,3% al 3,4% è abbastanza ampio che testare la 2.0 non è opzionale. Quel numero che passa da "di solito sbagliato" a "di solito giusto" è la differenza tra una trascrizione parziale su cui puoi instradare e una che puoi solo visualizzare. Se la tua applicazione attende trascrizioni finali su file registrati, il miglioramento è reale ma più piccolo, e i 0,12 secondi aggiunti di latenza di commit sono il costo.
Se lavori con un fornitore del tutto diverso, il motivo per guardare questa release non è la posizione in classifica: è che un laboratorio di frontiera ha appena migliorato il proprio modello di trascrizione con un margine ampio senza aumentare il prezzo, ed è questo l'aspetto che ha un mercato quando la precisione smette di essere ciò per cui si fa pagare. Anche il percorso di aggiornamento è del tipo più economico: un solo parametro, nessuna modifica al codice, nessun nuovo contratto e un pin disponibile se qualcosa va storto.
La prossima cosa da tenere d'occhio è il cambio di default. Quando SpaceXAI renderà la 2.0 predefinita e inizierà a deprecare la 1.0, ogni integrazione che non ha mai specificato un parametro del modello passerà subito al nuovo modello, cambiamento di latenza incluso. I team che dipendono dal vecchio timing parziale di 0,25 secondi dovrebbero fissare la versione adesso invece di scoprire il cambiamento in produzione. La seconda cosa da tenere d'occhio è la riproduzione indipendente: la voce su Artificial Analysis è una misurazione reale, ma è una singola classifica su un singolo mix audio, e nessuna terza parte ha ancora pubblicato un'esecuzione comparabile 1.0 contro 2.0 su audio di produzione.
