
GPT-Live-1 vs Cartesia Sonic 3.6: la classifica TTS numero uno non misura l’interruzione
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Cartesia Sonic 3.6 attualmente guida entrambe le arene text-to-speech di Artificial Analysis — 1.275 Elo sulla board Provider Voice e prima anche sulla board Controlled Voice, davanti a ogni motore commerciale con una piattaforma più grande attorno a sé. GPT-Live-1 non è classificato su nessuna delle due, perché non è un modello text-to-speech. Si trova a pari merito al sesto posto su quattordici in un'altra board di Artificial Analysis, lo Speech to Speech Index, al 70,3%. Lette insieme, queste due informazioni descrivono l'effettiva divisione tra questi prodotti: Sonic 3.6 è molto probabilmente la voce migliore, e GPT-Live-1 è l'unico dei due che può sentire il chiamante iniziare a parlare e fermarsi.
Entrambi sono attivi e disponibili in commercio — Sonic 3.6 sull'API proprietaria di Cartesia da quando il suo snapshot stabile è stato rilasciato il 27 agosto 2026, GPT-Live-1 sull'API per sviluppatori di OpenAI dal 10 settembre 2026, a $0,05 al minuto vocale. Scegliere tra i due non è una decisione sulla qualità. È una decisione su quale metà di un agente vocale stai acquistando.
Due arene, due domande, e perché la divisione è reale
Artificial Analysis gestisce le sue classifiche vocali in un modo che vale la pena capire prima che ti venga citato l'uno o l'altro Elo. L'arena Provider Voice classifica i motori usando le voci native di ciascun fornitore — misura la voce che si ottiene effettivamente così come viene fornita, il dato che interessa a chi acquista. L'arena Controlled Voice clona ogni modello sulle stesse otto voci di riferimento, così che gli ascoltatori confrontino il motore di sintesi anziché il talento vocale. Sonic 3.6 è in testa in entrambe, cosa più rara di quanto sembri: le due classifiche hanno avuto campioni diversi per la maggior parte del 2026.
Nessuna delle due classifiche contiene un solo campione di un modello interrotto. Misurano come suona il parlato, in isolamento, a un ascoltatore. Lo Speech to Speech Index è costruito diversamente: mette insieme ragionamento vocale, prestazioni agentiche, preferenze dell’arena e successo nei compiti in un unico valore, e ammette solo modelli nativamente speech-to-speech. Cartesia non ha alcuna voce lì. Non perché Sonic 3.6 sia scarso, ma perché un motore text-to-speech non ha nulla da presentare.
Quindi 1.275 e il 70,3% non sono numeri in competizione, e qualsiasi confronto che li mette sulla stessa riga ti sta mentendo silenziosamente. Ciò che stabiliscono congiuntamente è che la qualità ha smesso di essere l'asse su cui ruota questa decisione.

Dimensione per dimensione
• Tipo — GPT-Live-1: voce-a-voce full-duplex, un unico modello per l'intero ciclo vs Cartesia Sonic 3.6: sintesi vocale in streaming, abbinata al riconoscimento vocale Ink-2 per gli agenti
• Qualità indipendente — GPT-Live-1: 70,3% sullo Speech to Speech Index, sesto a pari merito su quattordici contro Cartesia Sonic 3.6: 1.275 Elo sulla classifica Provider Voice, da 1.755 campioni, e primo anche sulla classifica Controlled Voice
• Gestione delle interruzioni — GPT-Live-1: una proprietà del modello, che decide molte volte al secondo se cedere il turno vs Cartesia Sonic 3.6: un pattern di integrazione, in cui il client annulla il contesto di sintesi e si affida a timestamp a livello di parola per tagliare al momento giusto
• Prezzo — GPT-Live-1: $0,05 per minuto vocale, fatturato al secondo, backend di reasoning conteggiato separatamente rispetto a Cartesia Sonic 3.6: circa $49 per milione di caratteri con i piani a crediti, più $0,06 al minuto di durata delle chiamate dell'agente e $0,014 al minuto per un numero di telefono Cartesia
• Latenza — GPT-Live-1: nessun dato a livello di modello pubblicato; latenza di turn-taking indicata come 0,798 secondi nei test interni di OpenAI rispetto a Cartesia Sonic 3.6: meno di 90 millisecondi di tempo al primo audio, dichiarato dal fornitore e non misurato in modo indipendente end-to-end
• Throughput — GPT-Live-1: sessioni simultanee, limitate a 25 sul livello 1 e 500 sul livello 5, senza livello gratuito vs Cartesia Sonic 3.6: circa 132 caratteri al secondo, all'incirca il doppio della velocità di v3 di ElevenLabs nello stesso confronto, con un livello gratuito di 20.000 crediti mensili
• Lingue — GPT-Live-1: fluidità disomogenea al di fuori delle principali lingue coperte al lancio rispetto a Cartesia Sonic 3.6: 44 lingue su 61 locale, con l'aggiunta di odia e urdu in questa versione
• Controllo vocale — GPT-Live-1: dodici preset, tono e ritmo tramite prompting, nessuna clonazione rispetto a Cartesia Sonic 3.6: più di 500 voci preset, clonazione istantanea, clonazione professionale nei livelli superiori, timestamp di parole e fonemi e nessun SSML — il modello adatta il ritmo dal testo stesso

Il barge-in è una caratteristica dell'architettura, non una casella da spuntare.
La cosa che più spesso gli acquirenti sbagliano in questo confronto è trattare il supporto all'interruzione come un valore booleano. La documentazione di Cartesia è schietta su come funziona la sua versione: quando il chiamante parla sopra l'agente, il client invia una cancellazione per il contesto di sintesi corrente, e sono i timestamp a livello di parola restituiti sulla connessione WebSocket a permetterti di interrompere la riproduzione sulla sillaba corretta. È un design competente ed è così che la maggior parte degli agenti vocali in produzione gestisce il barge-in oggi.
È ancora un design in cui la decisione di smettere di parlare veniva presa dalla tua applicazione, usando un segnale di attività vocale, con qualunque latenza il round trip consenta. GPT-Live-1 sposta quella decisione all'interno del modello. Decide continuamente se continuare ad ascoltare, fare una pausa, prendere il turno o cederlo, ed è per questo che i dati di OpenAI stesso riportano un'interattività dell'80,1% contro il 45,4% di GPT-Realtime-2.1 su Full Duplex Bench v1.5, con una latenza di turn-taking di 0,798 secondi contro 1,41. Quei numeri sono di OpenAI, pubblicati con il rilascio e non riprodotti da nessuno al di fuori dell'azienda — ma la differenza architetturale dietro di essi non è in discussione, ed è l'unica cosa che una cascata non può approssimare tramite il tuning.
Dove la cascata vince è in tutto ciò che sta a valle della frase. Il time-to-first-audio sotto i 90 millisecondi di Cartesia è un dato del fornitore e misura il modello, non la conversazione: il numero che un chiamante sperimenta include anche il riconoscimento vocale, il rilevamento del turno, il tempo di generazione del modello linguistico, il transito in rete e il buffering audio. È esattamente per questo che vale la pena costruire una cascata quando devi controllare ogni fase — un modello piccolo e veloce per i turni semplici, un modello di frontiera per quelli difficili e un sintetizzatore che non ti fa mai aspettare.
Quella fase intermedia è l'unica parte di entrambi gli stack che sia realmente portabile, ed è la parte che determina sia la qualità sia il costo della chiamata. All'incirca 190 modelli da undici fornitori upstream stanno dietro un'unica chiave OrcaRouter al prezzo di listino del fornitore, senza alcun ricarico, e il DSL di routing consente a un singolo endpoint di inviare i turni semplici a un modello economico e di far scalare quelli complicati a un modello di frontiera — il pattern che un agente vocale desidera davvero, applicato alla fase che varia di più. Né Sonic 3.6 né GPT-Live-1 sono raggiungibili tramite un livello di routing; i livelli vocali appartengono ai rispettivi fornitori.

Gestire il denaro
I due modelli di prezzo non coincidono, quindi vale la pena fare bene la conversione. Il parlato va a circa 150 parole al minuto e, poiché l’inglese ha in media circa cinque caratteri e mezzo per parola, un minuto di output parlato è di circa 800-900 caratteri. A 49 dollari per milione di caratteri, la sintesi di Cartesia costa circa quattro centesimi al minuto di audio.
Poi arriva il resto della cascata. Cartesia addebita 0,06 $ al minuto di durata della chiamata dell'agente vocale e 0,014 $ al minuto se usi il suo numero di telefono, oltre ai caratteri. Aggiungi il riconoscimento vocale e un modello linguistico per il testo e superi già i dieci centesimi al minuto prima che qualcuno abbia detto qualcosa di difficile. I 0,05 $ al minuto vocale di GPT-Live-1 coprono l'ascolto, la gestione dei turni e il parlato, mentre il ragionamento delegato viene fatturato separatamente alla tariffa normale del modello backend — che per una chiamata di prenotazione con una o due ricerche allegate è un numero reale, non un errore di arrotondamento.
Il crossover si colloca sul volume e sulla difficoltà. Le chiamate brevi, ripetitive e ad alto volume — conferme, notifiche, semplici ricerche — favoriscono la cascata, perché un modello economico che risponde a una domanda prestabilita è la cosa più economica in questo confronto. Le chiamate in cui l'interlocutore esce dal copione, parla sopra l'agente o cambia idea a metà frase favoriscono il modello end-to-end, perché la modalità di fallimento della cascata in quel caso non è una risposta sbagliata, ma una risposta goffa.
Quale scegliere?
Scegli Cartesia Sonic 3.6 se vuoi la voce dal punteggio migliore disponibile e sei disposto a gestire da solo la logica della conversazione. È la scelta giusta per la narrazione, per agenti scriptati ad alto volume, per team con una pipeline di riconoscimento vocale già esistente e per chiunque abbia bisogno di timestamp a livello di parola che rendono possibile una gestione precisa delle interruzioni. Ottieni un piano gratuito, più di 500 voci, la clonazione, 44 lingue e la vetta di entrambe le classifiche di qualità, e mantieni il controllo di ogni fase.
Scegli GPT-Live-1 se l'interruzione è il prodotto. Qualsiasi situazione in cui essere parlati sopra sia la norma invece che un caso limite, e in cui un cambio di turno di 0,8 secondi batta un avvio di 90 millisecondi su una frase che nessuno aveva finito di chiedere. Accetti un modello chiuso, ospitato, a consumo al minuto con dodici voci e senza clonazione, e accetti che il suo punteggio di qualità indipendente sia a metà classifica.
La tentazione è leggere 1.275 rispetto a 70,3% e considerarla una questione risolta. Non lo è, e la differenza tra quei due numeri è tutto il nocciolo della questione: uno misura come suona una voce, l'altro misura se vale la pena parlarci.
