
GPT-Live-1 vs Inworld Realtime TTS-2: una guerra dei prezzi sulle voci, un premio per l'ascolto
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Inworld Realtime TTS-2 ha raggiunto la disponibilità generale con qualcosa che mancava al mercato vocale: un listino prezzi pubblicato. Il modello di punta costa 25 $ per milione di caratteri on demand, il suo fratello più veloce Inworld Realtime TTS-2 Flash ne costa 15 $, ed entrambi scendono attraverso fasce di volume fino a 12,50 $ e 7 $. Con un Elo di 1.244 e il secondo posto nell'arena vocale di Artificial Analysis, questo rende il modello di punta circa la metà del prezzo dell'attuale leader dell'arena e uno dei modi più economici per acquistare una voce tra le prime cinque. GPT-Live-1 è l'altro modello in questo confronto e la proposta opposta: 0,05 $ al minuto di voce, nessun carattere coinvolto, e nessun modo di acquistarlo senza acquistare anche l'ascolto, la gestione dei turni e la gestione delle interruzioni che comporta.
La cosa interessante nel confrontarli è che il divario di prezzo sembra enorme e poi per lo più svanisce. La sintesi è in una guerra dei prezzi. La conversazione no.
Cosa ha effettivamente rilasciato Inworld
La linea TTS-2 è nata come anteprima di ricerca a maggio 2026 con un'affermazione specifica: che si tratta di un modello che non genera il parlato in isolamento. Prende i turni precedenti di una conversazione come input audio, ragiona sul tono e sul ritmo, e adatta il modo in cui risponde. Quel posizionamento — consapevolezza conversazionale piuttosto che un audio più pulito — è ciò che lo ha distinto dai motori di narrazione che hanno dominato la sintesi vocale fino al 2025.
La disponibilità generale ha trasformato l'anteprima in una famiglia e vi ha allegato un listino prezzi. Flash è la scelta puntata sul throughput, con Inworld che dichiara circa 20 millisecondi di tempo al primo byte lato server al 90° percentile contro i 100 millisecondi del flagship e una mediana inferiore a 200 millisecondi fino al primo audio. Si tratta di cifre del fornitore tratte dalla documentazione di Inworld; l'unica misurazione di terze parti in circolazione, di Coval, colloca Flash a circa 25 millisecondi e il flagship nella fascia bassa delle centinaia. Nessuno dei due è stato sottoposto a un audit indipendente end to end.
La funzionalità più degna di nota non ha nulla a che fare con la latenza. Inworld ha aggiunto una modalità verbatim in modo che numeri d'ordine, codici di conferma, indirizzi e seriali vengano riletti carattere per carattere invece di essere normalizzati in qualcosa che suona naturale ma è sbagliato. Per un agente vocale che ha appena preso una prenotazione, quel singolo tag è la differenza tra un prodotto funzionante e una demo che viene escalata a un umano.

Dimensione per dimensione
• Tipo — GPT-Live-1: speech-to-speech full-duplex in un unico modello vs Inworld Realtime TTS-2: un modello text-to-speech, con duplex disponibile separatamente tramite l'API Realtime di Inworld
• Unità di prezzo — GPT-Live-1: 0,05 $ al minuto vocale, fatturato al secondo, backend di ragionamento misurato separatamente vs Inworld Realtime TTS-2: 25 $ per milione di caratteri su richiesta, 20 $ nel piano Creator e 12,50 $ al livello più alto, con Flash a 15, 10 e 7 $
• Qualità indipendente — GPT-Live-1: 70,3% sullo Speech to Speech Index, sesto a pari merito su quattordici vs Inworld Realtime TTS-2: Elo 1.244 da 1.091 campioni e secondo nell'Artificial Analysis Provider Voice arena, con Flash a Elo 1.211 da 1.626 campioni e sesto
• Interruzione — GPT-Live-1: nativo, deciso all'interno del modello molte volte al secondo vs Inworld Realtime TTS-2: non è una proprietà del modello TTS; l'API Realtime di Inworld supporta il barge-in con una latenza di interruzione di circa 100 millisecondi, su un singolo socket che parla il protocollo OpenAI Realtime
• Latenza — GPT-Live-1: 0,798 secondi di latenza nel turn-taking nei test condotti da OpenAI, nessun time-to-first-audio pubblicato vs Inworld Realtime TTS-2: 100 millisecondi lato server al 90° percentile, Flash a 20, con una mediana inferiore a un secondo per il primo chunk audio lungo l'intera pipeline della Realtime API
• Lingue — GPT-Live-1: le lingue principali sono ben coperte, ma la copertura è disomogenea al di fuori di esse, rispetto a Inworld Realtime TTS-2: oltre 200 localizzazioni, con 15 di qualità Tier 1 e altre 79 di Tier 2, e un'unica identità vocale preservata in tutte.
• Voci e clonazione — GPT-Live-1: dodici preset, nessuna clonazione vs Inworld Realtime TTS-2: 282 voci integrate, clonazione istantanea zero-shot da 5 a 15 secondi di audio autorizzato, clonazione professionale e controllo completo della resa solo sul modello di punta
• Deployment — GPT-Live-1: solo hosted, un unico endpoint, nessun piano gratuito, concorrenza limitata da 25 a 500 sessioni rispetto a Inworld Realtime TTS-2: API hosted più un container on-premises ad accesso controllato che richiede una H100, e un piano gratuito on-demand che include fino a circa 70 minuti di sintesi

La questione duplex, risolta con precisione
Sarebbe facile scrivere questo confronto come "uno ascolta, l'altro si limita a parlare", e sarebbe sbagliato in un modo che conta. I modelli text-to-speech di Inworld sono text-in, audio-out. Ma Inworld vende anche una Realtime API che funziona su un'unica connessione WebSocket, WebRTC o SIP ed è full-duplex nel senso che interessa a chi sviluppa: prevede il rilevamento semantico dell'attività vocale con un'impostazione di solerzia regolabile, supporta il controllo manuale del turno e interrompe in caso di barge-in in circa 100 millisecondi. È compatibile a livello di protocollo con l'interfaccia OpenAI Realtime, il che rende la migrazione un esercizio di configurazione anziché una riscrittura.
Ciò che l'API Realtime di Inworld non è: un modello nativo speech-to-speech. È una cascata — un modello di riconoscimento vocale intercambiabile, un modello linguistico a tua scelta e un sintetizzatore — orchestrata all'interno di un'unica connessione. Questa è una scelta architetturale legittima ed è la stessa che fanno la maggior parte degli agenti vocali in produzione. È semplicemente diversa da quella di GPT-Live-1, dove un singolo modello decide quando cedere il turno.
La differenza pratica si manifesta quando il chiamante interrompe a metà frase. In una cascata, l'interruzione viene rilevata, la generazione viene annullata e inizia un nuovo turno — una sequenza che funziona bene e ti costa un round trip. Nel modello end-to-end, la decisione veniva già presa in modo continuo. Il primo è un sistema che risponde rapidamente. Il secondo è un sistema che non ha mai smesso di ascoltare.

Fare i calcoli, perché le unità nascondono la risposta
Il parlato scorre a circa 150 parole al minuto, e l'inglese ha in media circa cinque caratteri e mezzo per parola, quindi un minuto di output vocale è di circa 800-900 caratteri. A 25 $ per milione, Inworld Realtime TTS-2 produce un minuto di parlato per circa due centesimi. Con Flash a 15 $, è meno di un centesimo e mezzo.
Rispetto ai $0,05 al minuto di voce di GPT-Live-1, sembra una disfatta — finché non si calcola il resto di ciò che fa GPT-Live-1. La Realtime API di Inworld ha comunque bisogno di riconoscimento vocale e di un modello linguistico, entrambi fatturati separatamente e ciascuno con la propria latenza. Se si includono anche questi, il costo al minuto della cascata supera i cinque centesimi per qualsiasi chiamata che comporti una vera domanda. Il sovrapprezzo del modello end-to-end non è per la voce. È per la gestione dei turni di parola, ed è all'incirca il costo della fase di riconoscimento vocale che non si acquista più.
Dove la cascata vince in modo decisivo è nel volume senza conversazione. Chiamate di notifica, conferme di consegna, promemoria di appuntamenti, IVR con script — qualsiasi cosa in cui il testo sia noto prima che la chiamata inizi e nessuno abbia intenzione di interrompere. Lì, il prezzo per carattere da 7 a 15 $ per milione è semplicemente più economico del duplex al minuto, e pagare per la gestione dei turni che non usi mai è uno spreco.
Esiste anche un percorso intermedio che l'inquadramento a due modelli nasconde. Se state comunque assemblando una cascata, lo strato vocale non deve per forza provenire da un fornitore dedicato di voce: i modelli TTS di OpenAI stesso e i modelli TTS in anteprima di Gemini di Google sono normali endpoint API, e sono instradati. Dietro 190 modelli di undici fornitori upstream c'è un'unica chiave OrcaRouter, al prezzo di listino del fornitore e senza alcun ricarico: così un modello di sintesi può stare nello stesso catalogo, sulla stessa chiave e sulla stessa fattura del modello di ragionamento che alimenta, con failover automatico se un endpoint si degrada nel corso del deployment. È la fase meno appariscente di uno stack vocale e la più facile da consolidare. Né il Realtime TTS-2 di Inworld né l'endpoint Live Sessions di GPT-Live-1 sono disponibili in questo modo; quei due appartengono ai rispettivi fornitori.
Quale scegliere?
Scegli Inworld Realtime TTS-2 se il volume è ciò che conta e la conversazione è scriptata. Agenti ad alto throughput, notifiche, prodotti multilingue in cui contano 200 locale e un'identità vocale preservata, o qualsiasi deployment che necessiti del container on-premises. Ottieni una voce da arena tra le prime due a circa metà del prezzo del leader, un tier gratuito su cui prototipare, la clonazione che GPT-Live-1 non offre affatto, e una Realtime API che gestisce le interruzioni in modo competente nel pattern a cascata che probabilmente già usi.
Scegli GPT-Live-1 se l'interruzione è il prodotto. Chiamate che escono dal copione, utenti che parlano sopra l'agente, flussi di lavoro in cui l'alternanza dei turni è la differenza tra una conversazione e un menu. Paghi una tariffa al minuto che non scende quando la voce costa poco, rinunci alla clonazione e a 200 lingue, e ricompri le cuciture.
La guerra dei prezzi nella sintesi è reale ed è una buona notizia per chiunque costruisca un agente vocale: una voce tra le prime cinque ora costa un quinto di quanto costava diciotto mesi fa. Ma questo non risolve il confronto, perché ciò per cui GPT-Live-1 fa pagare non è ciò su cui Inworld sta applicando lo sconto.
