Una card hero con il titolo 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — la voce che ascolta contro il re delle arene', con una card a sinistra 'Cartesia Sonic 3.6 — Provider #1 · Elo 1.282 · $49 / 1M caratteri' e una card a destra 'Inworld Realtime TTS-2 — Controlled #1 · Elo 1.123 · $25 / 1M caratteri', un chip statistico 'Corone divise — arene Provider vs Controlled', e il logo OrcaRouter in basso a destra.
Guides & Insights

Inworld Realtime TTS-2 vs Cartesia Sonic 3.6: La voce che ascolta contro il re delle arene

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Esistono due teorie contrapposte sul perché una voce sintetica sembri umana, e al momento i due migliori esempi commerciali di ciascuna sono Inworld Realtime TTS-2 e Cartesia Sonic 3.6. La teoria di Cartesia è che l'umanità viva nell'audio: rendi il timbro, la prosodia e il timing indistinguibili da quelli di una persona, e gli ascoltatori ti metteranno al primo posto — che è ciò che Sonic 3.6 ha fatto ad agosto, balzando in cima all'arena Provider Voice di Artificial Analysis con un Elo di 1.282. La teoria di Inworld è che l'umanità viva nell'ascolto: TTS-2 condiziona la sua resa all'audio reale della conversazione che l'ha preceduta, quindi non solo suona come una persona, ma risponde come tale. Questa settimana le due teorie si sono scontrate in classifica: lo stesso ricalcolo che ha portato Inworld Realtime TTS-2 al 2° posto nella classifica dei provider, con un Elo di 1.252, l'ha portato anche al 1° posto nell'arena Controlled Voice — la classifica che Cartesia aveva guidato — con 1.123 contro gli 1.119 di Sonic 3.6. Un modello mantiene la corona dei provider. L'altro ha appena conquistato quella controllata.

Non è un confronto in cui un lato ha chiaramente torto. I due modelli sono stati costruiti per compiti sovrapposti ma non identici, e la differenza di prezzo — Sonic 3.6 a $49.0 per milione di caratteri contro $25 on demand per Inworld Realtime TTS-2 — è abbastanza reale da fare della decisione una questione tanto di budget quanto di qualità.

Due teorie su una voce dal suono umano

Cartesia ha rilasciato Sonic 3.6 in sordina ad agosto 2026, una point release che migliorava Sonic 3.5 senza cambiare il prezzo né il racconto sull'architettura. Il miglioramento si è visto dove serviva a Cartesia: il modello è balzato a Elo 1.282 nell'arena Provider Voice di Artificial Analysis — dove ogni modello usa le proprie voci native — e ha mantenuto la vetta dell'arena Controlled Voice per tutto agosto. Nella classifica controllata ogni modello viene clonato sugli stessi otto speaker di riferimento, quindi quella corona è un verdetto sul motore di sintesi stesso, indipendente dal talento vocale. Dopo la nuova valutazione di Inworld in disponibilità generale questa settimana, Cartesia guida ancora la classifica dei provider, ma Sonic 3.6 ora è al secondo posto in quella controllata con Elo 1.119, quattro punti dietro a Inworld Realtime TTS-2 a 1.123.

Inworld Realtime TTS-2 proviene da una tradizione diversa. La sua linea precedente, TTS 1.5, ha trascorso l'inizio del 2026 vicino alla vetta delle stesse arene, e l'anteprima di ricerca di TTS-2 ha registrato un Elo di 1.209 nella classifica dei provider a giugno. Il modello GA è salito da allora: nelle classifiche attuali si attesta a 1.252 su Provider Voice (#2, dietro a Sonic 3.6 con 1.282) e a 1.123 su Controlled Voice (#1). Il vero elemento distintivo del modello di punta, però, non è il suo Elo; è che il modello prende i turni precedenti di una conversazione come input audio e li usa per modellare il modo in cui pronuncia la battuta successiva. Cartesia calibra l'emozione a partire dal trascritto. Inworld ascolta come è stata detta l'ultima battuta.

Il tabellone, etichettato onestamente

I punteggi Elo provengono dalle arene vocali di Artificial Analysis e sono stati letti dalle classifiche live di settembre 2026. Le cifre relative alla latenza sono dichiarate dal fornitore, salvo diversa indicazione, e non è stato pubblicato alcun audit indipendente sulla latenza per nessuno dei due modelli.

• Qualità indipendente — Cartesia Sonic 3.6: Elo 1.282 (#1, Provider Voice) e 1.119 (#2, Controlled Voice) vs Inworld Realtime TTS-2: Elo 1.252 (#2, Provider Voice) e 1.123 (#1, Controlled Voice)

• Prezzo per 1 milione di caratteri — $49,0 (rilevato da Artificial Analysis) vs $25 on demand, $20,8 medio come rilevato da Artificial Analysis, fino a $12,50 a volume (fornitore)

* Tempo al primo audio — sotto 90 ms (dichiarato dal fornitore) rispetto a una mediana sotto 200 ms, sotto 100 ms al p99 nei test di lancio di Inworld (dichiarato dal fornitore); la risposta a bassa latenza di Inworld a Sonic è il livello separato TTS-2 Flash a circa 25 ms di tempo al primo byte

• Lingue — 42 localizzate contro 100+ lingue per il controllo della consegna, con l'affermazione di Inworld di un'identità vocale unica estesa a 200+ localizzazioni (dichiarato dal fornitore)

• Clonazione vocale istantanea — ~10 secondi di audio contro 5–15 secondi, più una beta di clonazione professionale che richiede ~10 minuti di audio per cloni ad alta fedeltà

• Controllo della resa vocale — tag di trascrizione inline come [laughter], modulazione di volume e velocità, e controllo tramite inglese semplice come "[calm, reassuring]" o [whisper], istruzioni a livello di richiesta e tre modalità di stabilità da Stable a Expressive.

A generated two-column scoreboard titled 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — the scoreboard'. Left column Inworld Realtime TTS-2: AA Provider Elo 1,252 (#2), AA Controlled Elo 1,123 (#1), Price $25/1M on demand ($20.8 AA), First audio sub-200 ms, Languages 100+ with 200+ locales claimed, Listening prior-turn audio input. Right column Cartesia Sonic 3.6: AA Provider Elo 1,282 (#1), AA Controlled Elo 1,119 (#2), Price $49.0/1M chars, First audio sub-90 ms, Languages 42 localized, Listening transcript only. Footer 'Elo per Artificial Analysis, September 2026; latency vendor-reported.' OrcaRouter logo bottom-right.

Perché “ascolta la conversazione” è un asse diverso

Il tabellone qui sopra misura come suona una voce in isolamento. La dimensione in cui i due modelli divergono davvero non compare in nessuna classifica, perché esiste solo attraverso più turni di conversazione.

Inworld Realtime TTS-2 è progettato per il caso in cui una persona gli abbia appena detto qualcosa. Il modello acquisisce l’audio dei turni precedenti — non solo una loro trascrizione — valuta tono, ritmo e stato emotivo, e seleziona uno stato di risposta prima di parlare. Se un chiamante è frustrato, l’emissione cambia; se è rilassato, torna com’era. Ecco perché Inworld commercializza il modello per agenti, compagni e giochi piuttosto che per la narrazione: la funzionalità è priva di significato in una chiamata text-to-audio singola, e ha senso in una conversazione.

Cartesia Sonic 3.6 funziona in modo diverso. È un motore di streaming veloce e di alta qualità, e la stessa Cartesia sostiene che la calibrazione emotiva avviene automaticamente dal trascritto: legge le parole e modula di conseguenza. Ciò che non fa è ascoltare l’audio dei turni precedenti. All’interno di un singolo enunciato i due possono sembrare comparabili; nel corso di una conversazione, Inworld modella qualcosa che Sonic non tenta di fare. Se il tuo prodotto è un voiceover a turno singolo, quella modellazione è un sovraccarico. Se è un agente live, è il prodotto.

A screenshot of Inworld's Realtime TTS-2 product page (captured September 3, 2026) headed 'General Availability — August 31, 2026 — Realtime TTS-2, a new frontier voice model that feels as human as it sounds', with copy explaining it hears the full audio of the exchange, picks up the user's tone, pacing and emotional state, and holds one voice identity across 100+ languages.

Velocità, prezzo e l'avvertenza Flash

Sulla pura latenza, Cartesia mantiene il primato: un tempo al primo audio inferiore a 90 ms è dichiarato dal fornitore, ma è la cifra che l'azienda ha distribuito sin dalla generazione Sonic 3, e nessuno ha pubblicato un audit che lo contraddica. L'ammiraglia di Inworld risponde in una classe conversazionale simile sotto i 200 ms, il che va bene per agenti live. La vera mossa di Inworld sulla latenza è il livello Flash, spedito insieme al modello GA — un modello separato con un tempo al primo byte di circa 25 ms, pensato per carichi di lavoro ad alto volume in cui costo e latenza di classe Sonic contano più dell'espressività. Il limite è che Flash è un componente ridotto della famiglia: clonazione istantanea e non verbali in linea, ma niente clonazione professionale e nessun controllo completo in linguaggio naturale.

I prezzi vanno nell'altra direzione. Sonic 3.6 costa $49,0 per milione di caratteri — circa il doppio della tariffa on-demand di Inworld di $25, e quasi quattro volte il livello massimo di $12,50. Il divario di qualità tra i due, nelle classifiche in cui entrambi compaiono, non giustifica quel multiplo per un acquirente ad alto volume. Per un agente vocale in tempo reale che genera migliaia di caratteri per conversazione, la differenza per carattere è ciò che separa un'economia unitaria sana da una risicata.

Quale scegliere

Scegli Cartesia Sonic 3.6 se il primato nella classifica del provider è ciò che vuoi: la voce con il punteggio più alto che usa le proprie voci native, Elo 1.282, per enunciati brevi e autonomi come risposte dell'assistente, battute di gioco e letture di stato. A 49 dollari per milione di caratteri paghi per la corona, e rimane il modello da battere in quella classifica.

Scegli Inworld Realtime TTS-2 se il prodotto è una conversazione multi-turno in cui la voce generata deve rispondere all’interlocutore — chiamate di supporto, un compagno, un colloquio, una sessione di tutoraggio. Ora è in testa alla classifica controllata, dove ogni modello parla con le stesse otto voci di riferimento, e lo fa a circa metà prezzo mentre ascolta l’audio della conversazione.

Integra la commutazione nel routing se non puoi sapere in anticipo quale tipo di voce richiede una chiamata. Nessuno dei due modelli è presente su OrcaRouter al momento in cui scrivo — Sonic si raggiunge tramite l’API di Cartesia e diverse piattaforme di terze parti, Inworld tramite la propria API — ma un livello di routing è esattamente la struttura che permette a una conversazione di iniziare su una voce e passare all’altra in caso di failover, con il prezzo di listino di ciascun fornitore applicato senza alcun ricarico. Il giorno in cui uno di questi fornitori cambierà di nuovo idea — e questa settimana è successo — la scelta diventa una modifica di configurazione invece di una riscrittura.

La versione breve

Questo è un vero bivio, e la risposta onesta è che il bivio riguarda la gestione dei turni, non la qualità audio. Se hai bisogno della voce standalone con il punteggio più alto che usa le proprie voci native, Cartesia Sonic 3.6 detiene il primato tra i provider con un Elo di 1.282, al costo di 49 dollari per milione di caratteri. Se ti serve una voce che risponda a come le si parla, Inworld Realtime TTS-2 è andata in GA questa settimana a 25 dollari on demand, guida la classifica controllata in cui i due si confrontano a parità di voci e include una funzionalità di consapevolezza conversazionale che nessuna arena misura appieno. Le classifiche ora sono divise tra i due modelli — che è il quadro più onesto possibile di un mercato in cui "il migliore" dipende dal test.

A screenshot of the Artificial Analysis Controlled Voice leaderboard (captured September 3, 2026) showing Inworld Realtime TTS-2 at rank 1 with Elo 1,123, Cartesia Sonic 3.6 at rank 2 with Elo 1,119, Cartesia Sonic 3.5 at rank 3, and Inworld Realtime TTS-2 Flash at rank 4.