Scheda del titolo per l'articolo GPT-Live-1 Speech to Speech Index che mostra i tre punteggi migliori: GPT-Live-1 con GPT-6 Astra a sforzo medio a 81,5, Grok Voice Think Fast 2.0 High a 81,3 e GPT-Live-1 con GPT-5.6 Sol a sforzo basso a 80,1
Guides & Insights

GPT-Live-1 è in cima allo Speech to Speech Index con 81,5 — ma la classifica appartiene al suo backend

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

GPT-Live-1, il modello vocale full-duplex che è stato distribuito per la prima volta all'interno di ChatGPT l'8 luglio 2026, è ora primo nell'Artificial Analysis Speech to Speech Index con 81,5 — una riga che esiste solo perché il modello è stato indirizzato a GPT-6 Astra per svolgere il suo ragionamento. Esegui lo stesso front end vocale con GPT-5.6 Sol come backend delegato a basso sforzo di ragionamento e ottiene 80,1, che è terzo. Il secondo posto, con 81,3, appartiene a Grok Voice Think Fast 2.0 High.

Due precisazioni oneste prima dei numeri. Il modello non è nuovo: GPT-Live-1 ha raggiunto l'API per sviluppatori il 10 settembre 2026, dopo due mesi come voce predefinita di ChatGPT. Ciò che è nuovo, misurato il 15 settembre, è che un valutatore esterno gli ha assegnato un punteggio — l'unica cosa che mancava in ogni analisi di questo modello finora, compresa la nostra, dove le uniche cifre disponibili erano quelle che OpenAI aveva pubblicato su se stessa. E il margine di 0,2 punti sul secondo posto è inferiore al divario di 1,4 punti tra le due configurazioni di GPT-Live-1, che è il numero più utile sul tabellone.

Quindi il titolo «GPT-Live-1 è il miglior modello vocale» non è esattamente ciò che dice l'indice. Dice che GPT-Live-1 con GPT-6 Astra a impegno medio lo è, per un quinto di punto, e che la scelta del backend sposta il risultato più di quanto faccia qualsiasi modello concorrente.

Che cosa misura effettivamente l'indice

Artificial Analysis costruisce lo Speech to Speech Index come un composito ponderato equamente di quattro parti: Speech Reasoning, misurato da Big Bench Audio; Agentic Performance, misurato da τ-Voice; Arena Preference, un Elo di preferenza umana a coppie; e Task Success Rate. Solo i modelli con tutte e quattro le componenti disponibili ottengono un valore dell'indice — tutto il resto mostra un trattino, ed è per questo che la tabella ha molte più righe che punteggi. L'indice stesso è stato lanciato il 23 giugno 2026 ed è stato revisionato due volte da allora, più recentemente per sostituire Conversational Dynamics con Task Success, quindi un punteggio di una revisione non è strettamente comparabile con un punteggio di un'altra.

Quando si legge la classifica, contano altri due dettagli metodologici. Arena Elo è congelata al valore che aveva quando un modello è diventato pubblicabile per la prima volta, perciò la componente di preferenza premia chi arriva presto anziché chi è il migliore oggi. E l'indice valuta un intero sistema anziché un singolo modello: per GPT-Live-1, il numero comprende il front end vocale più qualunque modello di backend a cui passa il lavoro. È una scelta di progettazione deliberata, ed è il motivo per cui lo stesso modello compare due volte con punteggi diversi.

I migliori del campo, come pubblicato:

• GPT-Live-1 (Astra, medio) — indice 81,5, primo

• Grok Voice Think Fast 2.0 High — indice 81,3, secondo

• GPT-Live-1 (Sol, basso) — indice 80.1, terzo

• GPT-Realtime-2.1 High — indice 73.9, quarto

• GPT-Realtime-2 High — indice 73.6, quinto

• Grok Voice Think Fast 1.0 — indice 72,3, sesto

• Gemini 3.1 Flash Live High — indice 71,5, settimo

Artificial Analysis Speech to Speech leaderboard showing GPT-Live-1 with Astra at medium effort first at 81.5, Grok Voice Think Fast 2.0 High second at 81.3, and GPT-Live-1 with Sol at low effort third at 80.1, with the rest of the field from GPT-Realtime-2.1 High at 73.9 down to GPT-Realtime-2.1 Mini Minimal at 52.8

Per dare un termine di paragone, il modello che GPT-Live-1 sostituisce si colloca 7,6 punti al di sotto. Si tratta di un vero divario generazionale, e non è in discussione.

La vittoria di 0,2 punti deriva esattamente da una sola componente.

Scomponi il composito e i due leader smettono di sembrare lo stesso tipo di modello. Sulle singole componenti, secondo Artificial Analysis:

• Prestazioni agentiche (τ-Voice) — GPT-Live-1 67,9% rispetto a Grok Voice Think Fast 2.0 High 56,5%

• Ragionamento vocale (Big Bench Audio) — 90% vs 97%

• Tasso di successo delle attività — 87,4% vs 94,6%

• Arena Elo — 1048 contro 1011

• Tempo al primo audio — 1,34 s vs 0,70 s

• Costo per ora, backend incluso — 5,83 $ vs 4,80 $

Comparison scoreboard for GPT-Live-1 with Astra at medium effort against Grok Voice Think Fast 2.0 High, contrasting their Speech to Speech Index scores of 81.5 and 81.3, agentic performance of 67.9% and 56.5%, speech reasoning of 90% and 97%, task success of 87.4% and 94.6%, time to first audio of 1.34 and 0.70 seconds, and cost per hour of $5.83 and $4.80

GPT-Live-1 vince due delle sei righe e ne perde quattro, eppure si aggiudica l'indice. L'aritmetica non è un mistero: il divario τ-Voice è di 11,4 punti, molto più ampio di qualsiasi altra separazione nella tabella, e con pesi uguali trascina il composito oltre la linea. In parole semplici, GPT-Live-1 è l'agente migliore e Grok Voice Think Fast 2.0 High è il migliore in ascolto e il più veloce — e capita che l'indice attribuisca proprio alla cosa in cui GPT-Live-1 è bravo un peso sufficiente a farlo arrivare primo.

Se il tuo prodotto è un voice agent che prenota, risolve o esegue transazioni, il vantaggio di 11,4 punti su τ-Voice è il numero che predice la tua esperienza. Se il tuo prodotto è una conversazione che deve sembrare istantanea e non deve mai sovrapporsi all'utente, il tempo al primo audio di 0,70 secondi è il numero che predice la tua esperienza, e Grok lo vince di circa un fattore due. Sull'esecuzione di attività regolamentate c'è un secondo avvertimento: il tasso di successo del 94,6% di Grok è il più alto nella tabella visibile, e l'87,4% di GPT-Live-1 significa che circa un compito su otto non viene completato. Entrambi sono miglioramenti rispetto alla generazione precedente. Nessuno dei due è un problema risolto.

La riga #1 è una configurazione di routing, non un modello

Ecco la parte che merita più attenzione della posizione in classifica. GPT-Live-1 è un livello vocale full-duplex che gestisce da sé ascolto, parlato, interruzioni e alternanza dei turni, e delega ragionamento, chiamate agli strumenti e ricerca a un modello backend separato mentre la conversazione continua. Artificial Analysis ha valutato due di quegli abbinamenti come voci separate. Astra con sforzo medio ha prodotto 81,5. Sol con sforzo basso ha prodotto 80,1.

Quel divario di 1,4 punti è la vera notizia. Il divario tra il primo e il secondo posto è di 0,2 punti. Il divario tra le due configurazioni valutate di GPT-Live-1 è sette volte più grande. Nulla del modello vocale è cambiato tra quelle righe — è cambiato solo quale modello pensava, e con quale livello di sforzo. Una classifica che ordina i sistemi ti sta dicendo, con precisione, che la configurazione è il prodotto.

Rivede anche la nostra stessa reportistica. L'11 settembre 2026 abbiamo registrato GPT-Live-1 al 69,8% su questo indice, dietro sia a GPT-Realtime-2.1 sia a Grok. Era la lettura disponibile all'epoca, e supportava una conclusione ragionevole — che OpenAI aveva costruito le migliori meccaniche conversazionali, non il miglior agente vocale. L'indice ora riporta due configurazioni delegate di GPT-Live-1 all'81,5 e all'80,1. Artificial Analysis non pubblica un changelog, e in agosto ha revisionato i componenti dell'indice, quindi non possiamo dire con certezza se la cifra precedente fosse una configurazione non valutata o parzialmente valutata, oppure un'esecuzione con la ponderazione precedente; ciò che è osservabile è che gli abbinamenti delegati ora compaiono come righe complete a sé stanti, e che la risposta è cambiata quando sono cambiati.

La conseguenza pratica è che "quale modello vocale" è la domanda sbagliata e "quale modello vocale più quale backend, con quale livello di effort" è quella giusta. Questa è una questione di routing, ed è proprio quella a cui il nostro prodotto stesso è pensato per rispondere. OrcaRouter espone il backend di delega di GPT-Live-1, GPT-6 Astra, attraverso lo stesso endpoint compatibile con OpenAI di oltre 200 altri modelli, quindi cambiare il livello di pensiero è un cambio di ID modello anziché un'integrazione. Il DSL di routing compone diversi modelli in un'unica chiamata, e il failover automatico significa che un abbinamento non collaudato non è una scommessa di produzione — se il backend si degrada, la richiesta finisce altrove invece di fallire. Per essere precisi su ciò che non facciamo: GPT-Live-1 stesso non è nel nostro catalogo e non lo serviamo. Il backend a cui delega è una questione diversa.

Quanto costa un'ora di questo

Il front end di GPT-Live-1 è fatturato a $0,05 per minuto vocale, addebitato al secondo, che equivale a $3,00 per un'ora di linea aperta. Non è l'intero conto: il ragionamento delegato, le chiamate agli strumenti e la ricerca web sono misurati separatamente in base a quanto addebita il modello backend. Artificial Analysis ha misurato la cifra complessiva, ed è per questo che la sua colonna dei costi è quella da usare:

• GPT-Live-1 (Sol, low) — $4,47 all'ora

• Grok Voice Think Fast 2.0 High — 4,80 $ all'ora

• GPT-Live-1 (Astra, medio) — $5,83 all'ora

• GPT-Realtime-2.1 High — 10,75 $ all'ora

Il vincitore della classifica è la più costosa delle tre opzioni attuali, e la configurazione che ha vinto costa il 30% in più all'ora rispetto alla configurazione che si è classificata terza. Letto al contrario, la ripartizione è istruttiva: 3,00 $ di ogni ora sono il livello voce, e il resto — 1,47 $ su Sol, 2,83 $ su Astra — sono token di backend. Il livello di ragionamento si colloca tra un terzo e la metà della tua bolletta, una quota ampia per un componente che la classifica tratta come una nota a piè di pagina.

OrcaRouter model page for GPT-6 Astra showing the model id openai/gpt-6-astra, a 1M-token context window, 128K max output, a p50 time to first token of 6.75 seconds, and pricing of $10.00 per million input tokens and $50.00 per million output tokens

Rispetto al modello che sostituisce, però, l'intera famiglia costa circa la metà — il front end da 0,05 $ al minuto è un vero taglio, non un'operazione di repackaging. Poiché i token del backend vengono fatturati alle tariffe del backend, il costo di un deployment di GPT-Live-1 dipende principalmente dal modello di ragionamento verso cui si instradano le richieste, e i backend possono essere modelli di OpenAI o di terze parti. Su OrcaRouter quei backend vengono passati al prezzo di listino del provider con markup dello 0%, quindi una variazione di prezzo del fornitore sul livello di ragionamento è attiva lo stesso giorno anziché al ciclo di fatturazione successivo.

Ciò che l'indice non risolve

Tre avvertenze, dichiarate dalla fonte anziché dedotte. Sia entrambe le voci GPT-Live-1 sia Grok Voice Think Fast 2.0 High sono segnalate come basate su un singolo test, il che è esiguo per una decisione da 0,2 punti — una nuova esecuzione potrebbe riordinare primo e secondo senza che nulla cambi in nessuno dei due modelli. Arena Elo, come notato, è stato congelato alla prima misurazione pubblicabile di ciascun modello. E l'indice non ha alcuna voce su come questi sistemi si comportano in una chiamata lunga: i componenti sono a breve orizzonte per costruzione, mentre la modalità di guasto che effettivamente uccide gli agenti vocali in produzione è la deriva nell'arco di una conversazione di venti minuti.

Separatamente, e dal fornitore anziché dall'indice: l'API di GPT-Live-1 è stata rilasciata senza input di immagini o video, senza output strutturati e senza un piano gratuito, e i suoi limiti di frequenza sono conteggiati in sessioni simultanee anziché in richieste al minuto. Sono vincoli del giorno di lancio che potrebbero essere già cambiati; verificateli prima di progettare tenendone conto.

Cosa fare con questo

Se questa settimana stai scegliendo un'architettura piuttosto che un modello, l'indice premia il pattern delegato sul lavoro agentico e il pattern a cascata sulla latenza. GPT-Live-1 a 81,5 è la prova più forte finora che separare la conversazione dal ragionamento sia la forma giusta per gli agenti vocali che completano attività. Grok Voice Think Fast 2.0 High a 81,3, con 0,70 secondi al primo audio e un tasso di successo del 94,6%, è la prova più forte che la forma delegata non è l'unica che funziona — e che non è ancora la più veloce.

La decisione che segue dai numeri è più economica di quanto sembri. Entrambe le configurazioni di GPT-Live-1, e il modello che l'ha battuto su quattro componenti su sei, si collocano a meno di $1.36 l'ora di distanza tra loro. Con un divario simile, la mossa giusta è smettere di leggere le classifiche e far passare le proprie trascrizioni attraverso entrambi. L'indice ti dice la forma del compromesso; non può dirti da quale lato di esso si trovino i tuoi utenti.

Domande che il numero invita

GPT-Live-1 è il miglior modello vocale adesso?

Sul composito, sì — per 0,2 punti e con un'unica prova a supporto. Sui componenti, dipende interamente da ciò che stai costruendo: è in vantaggio su prestazioni agentiche e preferenza in arena, mentre è in svantaggio su ragionamento sul parlato, tasso di successo dei task e tempo al primo audio. Un vantaggio di 0,2 punti sul composito che poggia su un unico vantaggio di 11,4 punti su un componente è un primo posto difendibile, non decisivo.

Devi per forza usare GPT-6 Astra per ottenere l'81,5?

Per quella riga esatta, sì — l'81,5 appartiene a GPT-Live-1 configurato con Astra a sforzo di ragionamento medio. Sol a sforzo basso è un'alternativa documentata a 80,1 e costa 1,36 $ in meno all'ora, e OpenAI supporta l'uso di modelli di terze parti come backend, quindi le voci della classifica sono due punti su una curva più che le uniche opzioni. Quale abbinamento sia il migliore per il tuo carico di lavoro non è qualcosa a cui un indice pubblico possa rispondere al posto tuo.

Perché lo stesso modello ha ottenuto 69,8 nella nostra precedente copertura e 81,5 ora?

Le due cifre riguardano cose diverse. La lettura precedente collocava GPT-Live-1 sull'indice come singola voce; la tabella attuale riporta le sue due configurazioni delegate come righe separate, con punteggio completo, con l'abbinamento Astra a 81.5 e l'abbinamento Sol a 80.1. Artificial Analysis ha revisionato i componenti dell'indice in agosto e non pubblica un changelog, quindi considera il delta come un cambiamento in ciò che è stato misurato anziché come prova che il modello sia migliorato — e considera qualsiasi singolo punteggio composito per un modello delegante come un'affermazione su una configurazione.