
Grok Voice Think Fast 2.0: l'agente vocale più veloce e più costoso di xAI, spiegato
- qwenNUOVOQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 per 1M di token · 56 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligenza69Codice
- qwenNUOVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 201 tok/s
- orcaNUOVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNUOVOAnthropic: Claude Opus 52026-07-2461Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2150Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1651Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1557Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0854Intelligenza72Codice
- tencentTencent: Hy32026-07-0641Intelligenza59Codice
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenza42Codice
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenza39Codice
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligenza72Codice
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenza52Codice57Matematica
- z-aiZ.ai: GLM 5.22026-06-1651Intelligenza69Codice60Matematica
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligenza61Codice61Matematica
xAI ha rilasciato Grok Voice Think Fast 2.0 il 29 luglio 2026 — il "modello vocale da voce a voce più capace" come lo definisce la stessa xAI, e il nuovo modello di punta della sua linea di agenti vocali. Risponde più velocemente di qualsiasi rivale tra i primi cinque (0,70 secondi al primo audio), è in cima al benchmark della voce agentica e trascrive con maggiore precisione rispetto alla generazione precedente. Costa anche il 60% in più al minuto rispetto al modello che sostituisce, viene fornito con un contatore al minuto che fa lievitare silenziosamente la fattura e include un alias di versione che verrà commutato automaticamente tra una settimana. Questa guida spiega cos'è realmente Think Fast 2.0, cosa ha cambiato xAI sotto il cofano, come la storia dei benchmark si divide tra punteggi indipendenti e dichiarazioni del fornitore, quanto costa davvero, calcoli alla mano, e come chiamarlo — oltre alle avvertenze che fareste bene a leggere prima di instradare un flusso di chiamate in produzione attraverso di esso.
Nota sull'accuratezza: i dettagli del lancio, i prezzi, l'accuratezza del titolo e le dichiarazioni aziendali provengono dall'annuncio e dalla documentazione di xAI (2026-07-29). I punteggi compositi di Artificial Analysis sono indipendenti e misurati da terze parti. Le dichiarazioni riportate da xAI — i risultati A/B di Starlink, i moltiplicatori di trascrizione, il "60% in meno di token di ragionamento" e l'affermazione "quasi 5 volte più veloce" — non sono supportate da dati sottostanti pubblicati; trattatele come cifre indicative del fornitore ed eseguite le vostre valutazioni. Specifiche, prezzi e comportamento degli alias possono cambiare; verificate prima di sviluppare.
TL;DR. Grok Voice Think Fast 2.0 è il modello end-to-end da voce a voce di xAI per gli agent vocali: audio in ingresso, audio in uscita tramite WebSocket, nessuna pipeline separata ASR→LLM→TTS. È davvero veloce (0.70s di time-to-first-audio, l'unico modello tra i primi cinque a scendere sotto il secondo) e davvero forte nel lavoro vocale agentico, classificandosi primo nel benchmark τ-Voice per agenti di Artificial Analysis (56.5%) mentre è secondo nell'indice complessivo di qualità speech-to-speech (82.9%), dietro a Qwen Audio 3.0 Realtime Plus (84.1%). Ragiona mentre parla — riducendo l'uso mediano dei reasoning-token a circa il 40% rispetto al vecchio modello — e costa $0.08 al minuto, in aumento rispetto a $0.05. Il rovescio della medaglia è il contatore: la voce viene fatturata al minuto di audio effettivo, quindi un aumento del 60% su un modello che è più economico da servire ricade direttamente sulla tua fattura. E il 5 agosto l'alias grok-voice-latest inizierà a instradare automaticamente verso la 2.0, quindi i team sulla vecchia versione devono bloccarla deliberatamente prima di allora.
Punti chiave
• Sintesi vocale nativa da voce a voce: un unico modello dal microfono all'altoparlante, nessuna catena ASR→LLM→TTS — ecco perché il primo audio arriva in 0,70 s.
Leader agentico: #1 nel benchmark agent τ-Voice di Artificial Analysis (56.5%), ben davanti a GPT-Realtime-2.1 (45.7%) e Gemini 3.1 Flash (37.7%).
• Non il leader assoluto: #2 nell'indice di qualità speech-to-speech (82,9%), dietro a Qwen Audio 3.0 Realtime Plus (84,1%); OpenAI vince ancora nelle dinamiche conversazionali (95,7% vs 95,1%).
• 60% più caro: $0,08/min (~$4,80/ora) contro $0,05/min per Think Fast 1.0 — nonostante il modello utilizzi, secondo quanto riportato, circa il 60% in meno di token di ragionamento.
• Cambio alias il 5 agosto: grok-voice-latest instrada automaticamente alla 2.0; fissa grok-voice-think-fast-1.0 prima di allora per rimanere sulla versione più economica.
• Etichetta ogni affermazione: i punteggi di Artificial Analysis sono indipendenti; il test A/B di Starlink, i moltiplicatori di trascrizione e l'inquadramento della velocità sono riportati da xAI e non pubblicati.
Cos'è Grok Voice Think Fast 2.0
{{1}}Grok Voice{{/1}} è la famiglia di modelli speech-to-speech in tempo reale di {{2}}xAI{{/2}}. "{{3}}Think Fast{{/3}}" è la linea a risposta rapida, lanciata originariamente con {{4}}Voice Agent Builder{{/4}} nell'aprile 2026; {{5}}Think Fast 2.0{{/5}} è la seconda generazione di quella linea, rilasciata il 29 luglio 2026. Il modello è {{6}}end-to-end{{/6}}: consuma audio grezzo, ragiona ed emette audio direttamente, invece di eseguire una pipeline composta da un modello di {{7}}riconoscimento vocale{{/7}} che alimenta un {{8}}LLM testuale{{/8}} che alimenta un modello {{9}}text-to-speech{{/9}}. Questa scelta architetturale è all'origine del suo vantaggio in termini di latenza — non ci sono passaggi seriali né testo intermedio, quindi il modello può iniziare una risposta mentre è ancora in ascolto.
xAI la posiziona esplicitamente per gli agenti AI vocali: linee di assistenza clienti, vendite telefoniche, reception, telefonia e altre applicazioni in cui un sistema parla con una persona in tempo reale e deve davvero portare a termine delle cose — prenotare una chiamata, qualificare un lead, aggiornare un record, cercare sul web — piuttosto che limitarsi a chattare. L'enfasi agentica, non la mera trascrizione o sintesi, è il campo di battaglia a cui mira il lancio.
Novità rispetto a Think Fast 1.0
L'aggiornamento dalla 1.0 è più di un semplice incremento numerico; xAI descrive tre cambiamenti strutturali:
• Ragionamento vocale parallelo. Il modello elabora una query mentre sta parlando, piuttosto che pensare prima e parlare dopo. In pratica, le chiamate agli strumenti possono essere attivate prima che l'agente abbia terminato la prima frase — un aspetto importante per i flussi vocali sensibili alla latenza.
• Molti meno token di ragionamento. xAI riporta che l'uso mediano di token di ragionamento è sceso a circa 0,4x rispetto al predecessore (circa il 60% in meno), il che è parte del motivo per cui afferma che il modello è più economico da servire nonostante il prezzo sia aumentato.
• Stile di conversazione appreso tramite rinforzo. L'RL ha rimodellato il suo modo di parlare: frasi più brevi, una domanda alla volta, niente riempitivi — uno stile di chiamata più conciso e più "umano", adatto al lavoro telefonico dove divagare brucia minuti (e, con tariffa al minuto, denaro).
Sulla velocità misurabile, il tempo per il primo audio è sceso da 1,25 s nella 1.0 a 0,70 s nella 2.0. Sulla trascrizione, xAI riporta un miglioramento di circa 1,4x in 24 lingue (dato dichiarato dal fornitore, di seguito).

I benchmark, benchmark per benchmark
Il lancio è ancorato ad Artificial Analysis, una società indipendente di benchmark di terze parti. Questo è importante: a differenza della maggior parte degli altri numeri nell'annuncio, questi sono misurati da una parte neutrale, e sono quelli che vale la pena confrontare su base omogenea. Il quadro complessivo è migliore di un singolo dato di punta.
Indice di qualità Speech-to-Speech: 82,9% (secondo posto). Questo è il punteggio complessivo speech-to-speech, in aumento rispetto al 75,7% di Think Fast 1.0. Supera GPT-Realtime-2.1 (79,1%) e Gemini 3.1 Flash (69,5%) — ma non è primo. Qwen Audio 3.0 Realtime Plus è in testa con l'84,1%. Quindi "miglior modello vocale complessivo" è un'esagerazione che i dati non supportano; "modello vocale agentico più veloce nella fascia alta" è accurato.
Benchmark agent τ-Voice: 56.5% (primo posto). Questa è la metrica a cui xAI tiene di più, e la classifica è reale: 56.5% batte Think Fast 1.0 (52.1%), GPT-Realtime-2.1 (45.7%) e Gemini 3.1 Flash (37.7%). τ-Voice misura le prestazioni vocali agentiche — quanto bene un modello completa le attività su un canale vocale, incluso l'uso di strumenti durante la conversazione. Sul ristretto asse "sa fare il lavoro", Grok è in testa. Musk ha promosso esattamente questa classifica.
Big Bench Audio: 97,2%. Un benchmark di ragionamento vocale; solido, anche se Qwen ha registrato un record del 99,2%.
Full Duplex Bench: 95,1%. Dinamiche conversazionali — gestione delle interruzioni, alternanza dei turni, barge-in. È un grande salto rispetto al 77,8% della 1.0, ma OpenAI lo supera ancora di poco con il 95,7%, e Qwen è in testa con il 98,4%.
Tempo per il primo audio: 0,70s. Il numero più rilevante per i prodotti vocali reali. È sceso da 1,25s ed è l'unico valore sotto il secondo tra i primi cinque modelli classificati; test indipendenti confermano ampiamente una risposta sub-secondo. La latenza del primo token del TTS in streaming è di circa 285ms. Per l'uso telefonico e in tempo reale, la latenza è la metrica che gli utenti percepiscono a ogni singolo turno, ed è qui che la 2.0 è decisamente la migliore.
Leggendo orizzontalmente le righe, il profilo è specifico: il più rapido a parlare, il migliore nel completare le attività, secondo in assoluto, terzo per finezza conversazionale. Questo è un eccellente modello di agente vocale e una mediocre affermazione di "miglior voce chatbot". Sceglilo per i compiti che corrispondono alla riga superiore.
Precisione della trascrizione
Oltre alla conversazione, xAI afferma una trascrizione significativamente migliore. La sua valutazione interna su 24 lingue e migliaia di frasi mostrerebbe circa 1,4 volte la precisione di Think Fast 1.0, e 1,5–2 volte la precisione di modelli di trascrizione dedicati come Deepgram Nova 3 e ElevenLabs Scribe v2. In condizioni reali e rumorose — rumore di fondo, compressione telefonica, chiamate a bassa larghezza di banda — il divario di precisione riportato rispetto ai modelli STT dedicati si amplia fino a circa 10 volte.
Queste sono esattamente le affermazioni da trattare con cautela. Provengono da xAI; l'harness di valutazione, i set di frasi e i profili di rumore non sono pubblicati. Un test indipendente della trascrizione di chiamate telefoniche rumorose della 2.0 rispetto a Deepgram o ElevenLabs sarebbe prezioso e, al momento in cui scriviamo, non è stato ancora pubblicato. In termini di tendenza, i modelli end-to-end che assorbono più telefonia nell'addestramento rappresentano un plausibile miglioramento reale — ma "10x" dovrebbe essere verificato, non ripetuto come dato di fatto.
Prezzi: $0.08 al minuto e la questione del 60%
È qui che il lancio diventa controverso. Think Fast 2.0 costa $0.08 al minuto di audio — circa $4.80 all'ora — più $0.004 per messaggio di testo in input. Think Fast 1.0 costava $0.05 al minuto ($3.00/ora). Si tratta di un aumento del 60%, arrivato nello stesso mese in cui OpenAI ha tagliato i prezzi di GPT-5.6 Luna dell'80% e di Terra del 20%, citando gli stessi costi di servizio in calo che xAI sostiene per questo modello.
{{1}}Il contatore è tutta la storia.{{/1}} {{2}}I modelli di testo fatturano per token, quindi quando un modello diventa più efficiente, la fattura del cliente si riduce automaticamente.{{/2}} {{3}}I modelli vocali fatturano al minuto di audio effettivo, e la durata di una conversazione è stabilita dalla persona che parla, non dal modello.{{/3}} {{4}}I guadagni di efficienza in un prodotto fatturato al minuto vanno al fornitore, non all'acquirente.{{/4}} {{5}}Ecco perché un modello che, secondo quanto riportato, utilizza ~60% in meno di token di ragionamento — e quindi è più economico da servire per xAI — costa il 60% in più da noleggiare.{{/5}}
Fai i conti su un flusso di chiamate reale. Una chiamata di 4 minuti con 1.0 costa $0,20; la stessa chiamata con 2.0 costa $0,32. Diecimila chiamate di questo tipo al mese equivalgono a 40.000 minuti: $2.000/mese con 1.0 contro $3.200/mese con 2.0 — una differenza di $1.200/mese, o circa $14.400/anno, che deriva solo da un cambio di instradamento, non dal volume delle chiamate. Anche un guadagno di velocità generoso incide a malapena: ridurre di ben 10 secondi ogni chiamata fa risparmiare circa $0,013, mentre l'aumento di prezzo aggiunge $0,12 — recuperi all'incirca un nono dell'aumento. Qualsiasi business case che vende 2.0 come il modello più economico ha confuso "più veloce" con "più economico".
Per contesto, la 2.0 è ancora circa 2,2 volte più economica di GPT-Realtime-2.1 High, a circa $10,75/ora. Quindi non è costosa in termini assoluti — è costosa rispetto al suo stesso predecessore e rispetto alla direzione in cui tutti gli altri fornitori di modelli si stavano muovendo quel mese.
La trappola della migrazione del 5 agosto
C'è una scadenza da rispettare. Il 5 agosto 2026, l'alias grok-voice-latest inizierà automaticamente a instradare verso Think Fast 2.0. Se sei in produzione su Think Fast 1.0 tramite quell'alias, "non fare nulla" ti aggiorna — e la tua bolletta — alla nuova versione in quella data. Per rimanere su 1.0, devi fissare esplicitamente l'ID del modello grok-voice-think-fast-1.0 prima del 5 agosto.
Le due posizioni difendibili richiedono entrambe un'azione prima della scadenza: o bloccare deliberatamente la 1.0 perché i tuoi flussi scriptati hanno funzionato bene a 3,00 $/ora, oppure passare deliberatamente alla 2.0 e riformulare le previsioni a 4,80 $/ora, giustificato dalla qualità piuttosto che dal risparmio. Ciò che è indifendibile è scoprire il cambiamento in una fattura di settembre. Una buona regola: trattare qualsiasi alias che termina in "latest" come un'istruzione permanente ad accettare qualunque cosa il fornitore spedisca successivamente — incluso il suo prezzo.
Come accedervi e utilizzarlo
Think Fast 2.0 è disponibile tramite l'API Speech-to-Speech di xAI con l'ID modello grok-voice-think-fast-2.0, con grok-voice-latest come alias dinamico. È un modello in tempo reale, full-duplex, su WebSocket: wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0, autenticato con un header Authorization: Bearer durante l'handshake. Per le app browser, genera token effimeri lato server tramite l'endpoint delle sessioni in tempo reale, così che la chiave API principale non raggiunga mai il client.
L'API è compatibile con OpenAI Realtime, quindi il codice esistente per la voce in tempo reale generalmente richiede solo la sostituzione dell'URL di base e della chiave. La configurazione della sessione avviene tramite un evento session.update: scegli una voce preimpostata (eve, ara, rex, sal, leo), imposta il formato audio di input e output (PCM16 a 24kHz per impostazione predefinita; μ-law per la telefonia), abilita il rilevamento dell'attività vocale lato server e registra gli strumenti — incluso uno strumento di ricerca web integrato — così l'agente può agire durante la conversazione. Il flusso di eventi segue lo schema standard: il client aggiunge frame al buffer audio, il server trasmette i delta audio di risposta e gli eventi degli argomenti delle chiamate agli strumenti vengono attivati quando il modello decide di agire, con i risultati inviati come output delle chiamate di funzione. Il modello supporta oltre 25 lingue e la clonazione vocale personalizzata a partire da circa un minuto di parlato.
Nota ciò che non è: si tratta di un modello agente speech-to-speech, non di un servizio generale di trascrizione o traduzione. Se il compito principale del tuo prodotto è convertire l'audio in testo a basso costo, un modello STT dedicato è uno strumento diverso — e con il contatore al minuto paghi l'intera conversazione, quindi i carichi di lavoro di sola trascrizione diventano rapidamente costosi.

Come si inserisce in uno stack di agenti vocali.
Think Fast 2.0 è un modello vocale in tempo reale specializzato, accessibile tramite l'API dedicata di xAI, non un LLM generico ospitato da un router di modelli. Il canale vocale gira direttamente sul WebSocket di xAI — è lì che vive la latenza sub-secondo, e non sopravvive a un salto intermedio.
Tutto il resto attorno a un prodotto vocale — la logica in linguaggio naturale che non è critica in termini di tempo, il ragionamento di riserva quando una conversazione esce dal copione, la sintesi, l'analisi, l'email di follow-up che l'agente innesca dopo una chiamata — è lavoro testuale e multimodale di uso generale. Per quella parte, un endpoint neutrale rispetto al fornitore come OrcaRouter ti offre un'unica API compatibile con OpenAI su molti LLM, così non sei vincolato a un solo fornitore per le parti dello stack che non richiedono il canale vocale in tempo reale. La separazione netta: l'API dedicata di xAI per lo streaming vocale stesso, OrcaRouter (o simile) per il ragionamento testuale e multimodale che lo circonda.
La competizione: velocità agentica vs intelligenza grezza
Think Fast 2.0 arriva nel bel mezzo del mercato più competitivo dell'IA in questo momento — gli agenti vocali in tempo reale — e la tabella dei benchmark rende i compromessi insolitamente visibili.
Qwen Audio 3.0 Realtime Plus è il leader in termini di intelligenza: 84,1% sull'indice di qualità speech-to-speech (primo), un record del 99,2% su Big Bench Audio e 98,4% su full duplex. Ma il suo tempo medio al primo audio è di circa 4,02 secondi, ovvero circa 5,7 volte più lento dei 0,70 secondi di Grok. Per conversazioni in auto, dispositivi indossabili e telefonate, questa differenza non è "veloce vs lento", ma utilizzabile vs inutilizzabile. Qwen si divide anche in un livello Plus (qualità) e un livello Flash (primo pacchetto in circa 300 ms) per diversi scenari, il che rappresenta una risposta ponderata alla stessa tensione.
GPT-Realtime-2.1 occupa una posizione intermedia nella maggior parte delle righe (qualità 79,1%, agenticità 45,7%) e vince nelle dinamiche conversazionali (95,7%). Il suo livello High costa circa 2,2 volte il prezzo orario di Grok. Per i team già immersi nell'ecosistema OpenAI, rimane la scelta predefinita con il minor attrito.
Gemini 3.1 Flashè in ritardo sui compositi di qualità e agentività (69,5%, 37,7%), ma fa parte di uno stack vocale Gemini più ampio e dell'ecosistema Google che molti team preferiscono per altri motivi.
In pratica: scegli in base al carico di lavoro. Se il tuo agente vocale deve risultare istantaneo e deve completare in modo affidabile attività supportate da strumenti (assistenza, qualificazione, prenotazione), Think Fast 2.0 è l'opzione più performante misurata oggi. Se la tua priorità è il ragionamento più profondo e puoi tollerare una latenza di più secondi, Qwen Plus vince. Se la raffinatezza conversazionale e l'adattamento all'ecosistema contano di più, GPT-Realtime-2.1 resta il leader da battere.

Tre scenari in cui si adatta
1. Supporto telefonico e telefonia
La combinazione che conta di più: primo audio in meno di un secondo, trascrizione robusta in chiamate con rumore di fondo (riportata dal fornitore) e gestione delle interruzioni full-duplex. Una linea di assistenza in cui l'agente inizia a parlare quasi immediatamente e può recuperare le informazioni sull'account a metà turno è esattamente ciò per cui 2.0 è stato ottimizzato. Il suo stile di conversazione RL più breve, una domanda alla volta, si adatta bene anche alla telefonia, dove i minuti sono l'unità di fatturazione — su entrambi i contatori dei fornitori.
2. Qualificazione dei lead e follow-up post-chiamata
L'agentic voice è il campo in cui la 2.0 è davvero la prima, e la qualificazione dei lead è il compito canonico dell'agentic voice: qualificare, instradare e attivare il follow-up mentre l'intento è ancora fresco. La sua chiamata agli strumenti può scattare prima che termini la prima frase, quindi un agente può creare un record CRM mentre sta ancora parlando con il prospect. Prevedi attribuzione a livello di sessione e permessi rigorosi per gli strumenti: un agente vocale può sbagliare in tempo reale, e la correzione spetta a te.
3. Prodotti voice-agent in fase di sviluppo attivo.
Per gli sviluppatori che distribuiscono i propri agenti vocali — le integrazioni Tradecraft e GrokTerm citate da xAI hanno esattamente questa forma — la velocità della 2.0 e la sua API compatibile con OpenAI la rendono una sostituzione diretta a basso attrito per il codice GPT-Realtime. {{1}}Fissa la versione, avvia un pilot limitato con una condizione di successo chiara (ad es. "qualifica e instrada i visitatori della pagina prezzi"){{/1}}, e misura il costo per outcome completato, non il costo al minuto. {{2}}Questo è il modo in cui si costruisce — non inseguendo ogni novità, ma scegliendo con cura ciò che sblocca valore. {{/2}}
Limitazioni e avvertenze
Think Fast 2.0 ha cinque giorni di vita al momento in cui scrivo, e questo si riflette nelle avvertenze. I risultati A/B di Starlink (maggiore conversione e contenimento del supporto) sono riportati da xAI senza cifre pubblicate; i moltiplicatori di trascrizione e l'inquadramento "quasi 5 volte più veloce" sono anch'essi affermazioni del fornitore, non benchmark indipendenti. L'unico articolo che vedrete, che denuncia "regressione delle prestazioni e rapporti di test fabbricati", si riferisce a questa stessa non verificabilità: i numeri pubblicati da xAI non sono stati riprodotti in modo indipendente, e la comunità vocale sensibile all'affidabilità è giustamente sospettosa delle metriche non pubblicate del fornitore. I benchmark inoltre non possono misurare la tua chiamata peggiore: una risposta di 0,70 secondi è inutile se l'agente instrada con sicurezza un lead al team sbagliato. La fatturazione vocale è al minuto con un aumento di prezzo già incorporato, quindi l'esposizione ai costi è reale. E come per qualsiasi modello realtime nuovissimo, aspettati che le API cambino di frequente. Verifica le affermazioni sull'accuratezza sul tuo audio, blocca le versioni in produzione e predisponi escalation e registrazione prima della prima chiamata dal vivo.
Domande frequenti
Cos'è Grok Voice Think Fast 2.0?
Il modello speech-to-speech di punta di xAI per agenti vocali, rilasciato il 29 luglio 2026: audio-audio end-to-end nativo su WebSocket, con 0,70 secondi di time-to-first-audio e primo posto nel benchmark agentico τ-Voice.
Quanto costa Grok Voice Think Fast 2.0?
$0,08 al minuto di audio (circa $4,80/ora) più $0,004 per messaggio di testo in ingresso — un aumento del 60% rispetto ai $0,05/minuto di Think Fast 1.0.
Think Fast 2.0 è il miglior modello vocale?
È il più veloce e il migliore nei compiti agentici (56.5% τ-Voice, primo posto) e secondo in assoluto nell'indice di qualità speech-to-speech (82.9%), dietro a Qwen Audio 3.0 Realtime Plus (84.1%). "Il migliore" dipende dal carico di lavoro.
Cosa è cambiato rispetto a Think Fast 1.0?
Ragionamento vocale parallelo (pensa mentre parla), circa il 60% in meno di token di ragionamento, stile conversazionale più breve ottimizzato con RL, un miglioramento della trascrizione di 1.4x (segnalato dal fornitore) e tempo al primo audio ridotto da 1.25s a 0.70s.
Il mio switch del traffico Think Fast 1.0 commuterà automaticamente?
Sì, il 5 agosto 2026, se usi l'alias grok-voice-latest. Blocca grok-voice-think-fast-1.0 prima di allora per rimanere sulla 1.0, oppure passa deliberatamente alla 2.0 e ricalcola le previsioni di costo.
Come faccio a chiamare Grok Voice Think Fast 2.0?
Tramite l'API Speech-to-Speech di xAI — un WebSocket in tempo reale (wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0) compatibile con l'API Realtime di OpenAI, con voci preimpostate, VAD lato server e tool calling.
Con quali modelli vocali compete?
Qwen Audio 3.0 Realtime Plus (più intelligente, di gran lunga più lento con 4,02 s per il primo audio), GPT-Realtime-2.1 (migliori dinamiche conversazionali, circa 2,2 volte più costoso al livello High) e Gemini 3.1 Flash.
Le affermazioni sui benchmark sono affidabili?
Gli score di Artificial Analysis sono indipendenti e affidabili. I risultati A/B di Starlink, i moltiplicatori di trascrizione e il framing della velocità sono riportati da xAI senza dati pubblicati — trattali come indicativi e verifica sul tuo audio.
Grok Voice è adatto per la trascrizione?
Trascrive all'interno di una conversazione, e xAI dichiara notevoli miglioramenti rispetto ai modelli STT dedicati in presenza di rumore — ma viene fatturato al minuto di conversazione, quindi i carichi di lavoro di trascrizione dedicati sono meglio serviti da un modello STT dedicato.
Il risultato finale
Grok Voice Think Fast 2.0 è il modello vocale agentico più potente misurato finora, e il più veloce nella fascia alta con un ampio margine: 0,70 secondi al primo audio è una vittoria autentica, indipendente e tangibile per l'utente, e il primo posto su τ-Voice è una classifica reale. Il riepilogo onesto è specifico: è il miglior strumento nella sua classe per agenti vocali in tempo reale basati su strumenti, non il miglior modello vocale per ogni metrica — Qwen guida per intelligenza e OpenAI per finezza conversazionale. Le controversie non riguardano la velocità. Riguardano il metro: un aumento di prezzo del 60% per un modello che xAI afferma essere più economico da servire, una migrazione automatica di alias con scadenza rigida e dichiarazioni di punta che si basano su dati di fornitori non pubblicati. Usalo per la velocità agentica, fissa la tua versione, etichetta le affermazioni del fornitore e verifica l'accuratezza sulle tue chiamate — e tieni il testo generico e il ragionamento attorno al tuo prodotto vocale su un endpoint neutrale come OrcaRouter.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
