Titolo principale per 'GPT-Live-1 vs Inworld Realtime TTS-2', con sottotitolo 'La sintesi costa sempre meno; l'ascolto è ancora caro', con tre schede che recitano 'Inworld Realtime TTS-2: 25 $ per 1 milione di caratteri, a scaglioni fino a 12,50 $', 'Inworld Realtime TTS-2 Flash: 15 $ per 1 milione di caratteri, a scaglioni fino a 7 $', 'GPT-Live-1: 0,05 $ per minuto di voce, più il ragionamento che vi sta dietro', sopra una striscia a piè di pagina che recita 'Prezzi Inworld pubblicati dal fornitore, settembre 2026; prezzi GPT-Live-1 secondo la documentazione OpenAI.' Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

GPT-Live-1 vs Inworld Realtime TTS-2: una guerra dei prezzi sulle voci, un premio per l'ascolto

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Inworld Realtime TTS-2 ha raggiunto la disponibilità generale con qualcosa che mancava al mercato vocale: un listino prezzi pubblicato. Il modello di punta costa 25 $ per milione di caratteri on demand, il suo fratello più veloce Inworld Realtime TTS-2 Flash ne costa 15 $, ed entrambi scendono attraverso fasce di volume fino a 12,50 $ e 7 $. Con un Elo di 1.244 e il secondo posto nell'arena vocale di Artificial Analysis, questo rende il modello di punta circa la metà del prezzo dell'attuale leader dell'arena e uno dei modi più economici per acquistare una voce tra le prime cinque. GPT-Live-1 è l'altro modello in questo confronto e la proposta opposta: 0,05 $ al minuto di voce, nessun carattere coinvolto, e nessun modo di acquistarlo senza acquistare anche l'ascolto, la gestione dei turni e la gestione delle interruzioni che comporta.

La cosa interessante nel confrontarli è che il divario di prezzo sembra enorme e poi per lo più svanisce. La sintesi è in una guerra dei prezzi. La conversazione no.

Cosa ha effettivamente rilasciato Inworld

La linea TTS-2 è nata come anteprima di ricerca a maggio 2026 con un'affermazione specifica: che si tratta di un modello che non genera il parlato in isolamento. Prende i turni precedenti di una conversazione come input audio, ragiona sul tono e sul ritmo, e adatta il modo in cui risponde. Quel posizionamento — consapevolezza conversazionale piuttosto che un audio più pulito — è ciò che lo ha distinto dai motori di narrazione che hanno dominato la sintesi vocale fino al 2025.

La disponibilità generale ha trasformato l'anteprima in una famiglia e vi ha allegato un listino prezzi. Flash è la scelta puntata sul throughput, con Inworld che dichiara circa 20 millisecondi di tempo al primo byte lato server al 90° percentile contro i 100 millisecondi del flagship e una mediana inferiore a 200 millisecondi fino al primo audio. Si tratta di cifre del fornitore tratte dalla documentazione di Inworld; l'unica misurazione di terze parti in circolazione, di Coval, colloca Flash a circa 25 millisecondi e il flagship nella fascia bassa delle centinaia. Nessuno dei due è stato sottoposto a un audit indipendente end to end.

La funzionalità più degna di nota non ha nulla a che fare con la latenza. Inworld ha aggiunto una modalità verbatim in modo che numeri d'ordine, codici di conferma, indirizzi e seriali vengano riletti carattere per carattere invece di essere normalizzati in qualcosa che suona naturale ma è sbagliato. Per un agente vocale che ha appena preso una prenotazione, quel singolo tag è la differenza tra un prodotto funzionante e una demo che viene escalata a un umano.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Dimensione per dimensione

• Tipo — GPT-Live-1: speech-to-speech full-duplex in un unico modello vs Inworld Realtime TTS-2: un modello text-to-speech, con duplex disponibile separatamente tramite l'API Realtime di Inworld

• Unità di prezzo — GPT-Live-1: 0,05 $ al minuto vocale, fatturato al secondo, backend di ragionamento misurato separatamente vs Inworld Realtime TTS-2: 25 $ per milione di caratteri su richiesta, 20 $ nel piano Creator e 12,50 $ al livello più alto, con Flash a 15, 10 e 7 $

• Qualità indipendente — GPT-Live-1: 70,3% sullo Speech to Speech Index, sesto a pari merito su quattordici vs Inworld Realtime TTS-2: Elo 1.244 da 1.091 campioni e secondo nell'Artificial Analysis Provider Voice arena, con Flash a Elo 1.211 da 1.626 campioni e sesto

• Interruzione — GPT-Live-1: nativo, deciso all'interno del modello molte volte al secondo vs Inworld Realtime TTS-2: non è una proprietà del modello TTS; l'API Realtime di Inworld supporta il barge-in con una latenza di interruzione di circa 100 millisecondi, su un singolo socket che parla il protocollo OpenAI Realtime

• Latenza — GPT-Live-1: 0,798 secondi di latenza nel turn-taking nei test condotti da OpenAI, nessun time-to-first-audio pubblicato vs Inworld Realtime TTS-2: 100 millisecondi lato server al 90° percentile, Flash a 20, con una mediana inferiore a un secondo per il primo chunk audio lungo l'intera pipeline della Realtime API

• Lingue — GPT-Live-1: le lingue principali sono ben coperte, ma la copertura è disomogenea al di fuori di esse, rispetto a Inworld Realtime TTS-2: oltre 200 localizzazioni, con 15 di qualità Tier 1 e altre 79 di Tier 2, e un'unica identità vocale preservata in tutte.

• Voci e clonazione — GPT-Live-1: dodici preset, nessuna clonazione vs Inworld Realtime TTS-2: 282 voci integrate, clonazione istantanea zero-shot da 5 a 15 secondi di audio autorizzato, clonazione professionale e controllo completo della resa solo sul modello di punta

• Deployment — GPT-Live-1: solo hosted, un unico endpoint, nessun piano gratuito, concorrenza limitata da 25 a 500 sessioni rispetto a Inworld Realtime TTS-2: API hosted più un container on-premises ad accesso controllato che richiede una H100, e un piano gratuito on-demand che include fino a circa 70 minuti di sintesi

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Inworld Realtime TTS-2 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Languages: major languages only'. The right column, labelled Inworld Realtime TTS-2, reads 'Kind: text-to-speech; duplex via the separate Realtime API', 'Price: $25 per 1M characters, from $12.50 on volume', 'Time to first byte: 100 ms p90, 20 ms for Flash (vendor)', 'Barge-in: ~100 ms, cascade-level', 'Independent score: Elo 1,244, #2 on the AA Provider Voice arena', 'Languages: 200+ locales, 15 at Tier 1 quality'. The footer reads 'Inworld latency and pricing vendor-published; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

La questione duplex, risolta con precisione

Sarebbe facile scrivere questo confronto come "uno ascolta, l'altro si limita a parlare", e sarebbe sbagliato in un modo che conta. I modelli text-to-speech di Inworld sono text-in, audio-out. Ma Inworld vende anche una Realtime API che funziona su un'unica connessione WebSocket, WebRTC o SIP ed è full-duplex nel senso che interessa a chi sviluppa: prevede il rilevamento semantico dell'attività vocale con un'impostazione di solerzia regolabile, supporta il controllo manuale del turno e interrompe in caso di barge-in in circa 100 millisecondi. È compatibile a livello di protocollo con l'interfaccia Open​AI Realtime, il che rende la migrazione un esercizio di configurazione anziché una riscrittura.

Ciò che l'API Realtime di Inworld non è: un modello nativo speech-to-speech. È una cascata — un modello di riconoscimento vocale intercambiabile, un modello linguistico a tua scelta e un sintetizzatore — orchestrata all'interno di un'unica connessione. Questa è una scelta architetturale legittima ed è la stessa che fanno la maggior parte degli agenti vocali in produzione. È semplicemente diversa da quella di GPT-Live-1, dove un singolo modello decide quando cedere il turno.

La differenza pratica si manifesta quando il chiamante interrompe a metà frase. In una cascata, l'interruzione viene rilevata, la generazione viene annullata e inizia un nuovo turno — una sequenza che funziona bene e ti costa un round trip. Nel modello end-to-end, la decisione veniva già presa in modo continuo. Il primo è un sistema che risponde rapidamente. Il secondo è un sistema che non ha mai smesso di ascoltare.

A screenshot of Inworld AI's official pricing page, showing per-million-character rates for its speech models. The On-Demand column lists TTS-2 at $25 per 1M characters, TTS-2 Flash at $15, STT-1 at $0.15 per hour and LLMs at cost, alongside the inclusions 'Up to 70 min TTS included', '100 custom voices', 'Voice cloning & voice design', 'Realtime API access', '220+ LLM models via Router' and 'Commercial license'. The Creator column at $25 per month shows TTS-2 reduced to $20 and Flash to $10, with 500 custom voices and up to 33% off TTS and STT rates.

Fare i calcoli, perché le unità nascondono la risposta

Il parlato scorre a circa 150 parole al minuto, e l'inglese ha in media circa cinque caratteri e mezzo per parola, quindi un minuto di output vocale è di circa 800-900 caratteri. A 25 $ per milione, Inworld Realtime TTS-2 produce un minuto di parlato per circa due centesimi. Con Flash a 15 $, è meno di un centesimo e mezzo.

Rispetto ai $0,05 al minuto di voce di GPT-Live-1, sembra una disfatta — finché non si calcola il resto di ciò che fa GPT-Live-1. La Realtime API di Inworld ha comunque bisogno di riconoscimento vocale e di un modello linguistico, entrambi fatturati separatamente e ciascuno con la propria latenza. Se si includono anche questi, il costo al minuto della cascata supera i cinque centesimi per qualsiasi chiamata che comporti una vera domanda. Il sovrapprezzo del modello end-to-end non è per la voce. È per la gestione dei turni di parola, ed è all'incirca il costo della fase di riconoscimento vocale che non si acquista più.

Dove la cascata vince in modo decisivo è nel volume senza conversazione. Chiamate di notifica, conferme di consegna, promemoria di appuntamenti, IVR con script — qualsiasi cosa in cui il testo sia noto prima che la chiamata inizi e nessuno abbia intenzione di interrompere. Lì, il prezzo per carattere da 7 a 15 $ per milione è semplicemente più economico del duplex al minuto, e pagare per la gestione dei turni che non usi mai è uno spreco.

Esiste anche un percorso intermedio che l'inquadramento a due modelli nasconde. Se state comunque assemblando una cascata, lo strato vocale non deve per forza provenire da un fornitore dedicato di voce: i modelli TTS di OpenAI stesso e i modelli TTS in anteprima di Gemini di Google sono normali endpoint API, e sono instradati. Dietro 190 modelli di undici fornitori upstream c'è un'unica chiave OrcaRouter, al prezzo di listino del fornitore e senza alcun ricarico: così un modello di sintesi può stare nello stesso catalogo, sulla stessa chiave e sulla stessa fattura del modello di ragionamento che alimenta, con failover automatico se un endpoint si degrada nel corso del deployment. È la fase meno appariscente di uno stack vocale e la più facile da consolidare. Né il Realtime TTS-2 di Inworld né l'endpoint Live Sessions di GPT-Live-1 sono disponibili in questo modo; quei due appartengono ai rispettivi fornitori.

Quale scegliere?

Scegli Inworld Realtime TTS-2 se il volume è ciò che conta e la conversazione è scriptata. Agenti ad alto throughput, notifiche, prodotti multilingue in cui contano 200 locale e un'identità vocale preservata, o qualsiasi deployment che necessiti del container on-premises. Ottieni una voce da arena tra le prime due a circa metà del prezzo del leader, un tier gratuito su cui prototipare, la clonazione che GPT-Live-1 non offre affatto, e una Realtime API che gestisce le interruzioni in modo competente nel pattern a cascata che probabilmente già usi.

Scegli GPT-Live-1 se l'interruzione è il prodotto. Chiamate che escono dal copione, utenti che parlano sopra l'agente, flussi di lavoro in cui l'alternanza dei turni è la differenza tra una conversazione e un menu. Paghi una tariffa al minuto che non scende quando la voce costa poco, rinunci alla clonazione e a 200 lingue, e ricompri le cuciture.

La guerra dei prezzi nella sintesi è reale ed è una buona notizia per chiunque costruisca un agente vocale: una voce tra le prime cinque ora costa un quinto di quanto costava diciotto mesi fa. Ma questo non risolve il confronto, perché ciò per cui GPT-Live-1 fa pagare non è ciò su cui Inworld sta applicando lo sconto.