
Gemini 3.8 TTS vs Inworld Realtime TTS-2: Quale tabellone di valutazione credi cambi la risposta
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Metti Gemini 3.8 Flash TTS e Inworld Realtime TTS-2 uno accanto all'altro sull'Artificial Analysis Provider Voice Arena e la risposta sembra ovvia: 2° posto contro 4° posto, Elo 1.260 contro 1.245, 8 voci dell'arena ciascuno, e un prezzo normalizzato di $16,50 per milione di caratteri contro $20,80. Il fornitore vince sulla posizione e sul prezzo, e il divario di 15 punti rientra comunque negli intervalli di confidenza di entrambe le righe.
Passa all'altra classifica pubblicata da Artificial Analysis e l'ordine si inverte. Inworld Realtime TTS-2 occupa la prima posizione nella Controlled Voice Arena con un Elo di 1.123, mentre la sua variante Flash è a 1.075. Non è una differenza di arrotondamento — è un modello diverso che vince, e il motivo è che le due classifiche non misurano la stessa cosa. Se stai scegliendo una voce per un prodotto, sapere quale di queste due domande sta effettivamente ponendo il tuo caso d'uso è l'intera decisione.

Due consigli, due domande diverse
Il Provider Voice Arena valuta le voci native di un modello stesso — quelle che il fornitore distribuisce e ospita. Il Controlled Voice Arena mantiene costante la voce e valuta quanto bene si comporta ogni modello quando gli viene chiesto di parlare con una voce che non è la sua. Stessi giudici, stesso tipo di confronto cieco, variabile diversa.
Quella distinzione corrisponde a due diversi lavori:
• La classifica dei provider risponde alla domanda "questo modello suona bene fin da subito?". È la classifica giusta per un prodotto che viene fornito con un set fisso di voci narranti e non clona mai nulla.
• Il ranking controllato risponde alla domanda «questo modello rispetta una specifica di voce?». È la classifica giusta per un prodotto in cui la voce è quella del cliente: una voce di marca clonata, un attore con licenza, un'identità per tenant.
I modelli di Google sono in testa alla prima. Quelli di Inworld sono in testa alla seconda. Entrambe le affermazioni sono vere allo stesso tempo e nessuna delle due è una contraddizione, ed è esattamente per questo che una singola risposta a «quale modello TTS è il migliore» di solito è segno che chi scrive ha scelto una classifica e non ha guardato l'altra.

Che cosa implica in pratica la posizione numero uno di Inworld
Un risultato Controlled al primo posto è un'affermazione sulla fedeltà a un'istruzione, e la fedeltà a un'istruzione è la proprietà che decide se la clonazione è utilizzabile o meno.
Il percorso di clonazione di Inworld si presenta in due forme. La clonazione istantanea funziona da un breve campione — la cifra indicata dal fornitore è da 5 a 15 secondi di audio di riferimento — e un livello di clonazione professionale è in beta e richiede nell'ordine dei dieci minuti. Entrambe sono dichiarate dal fornitore, e nessuna delle due è verificata in modo indipendente dall'arena; ciò che l'arena misura è il comportamento del modello una volta che ha una voce, non la qualità della fase di clonazione che l'ha prodotta.
Le dichiarazioni sulla latenza associate alla famiglia rientrano nella stessa categoria. Il dato sul primo byte della variante Flash — 25 millisecondi, riportato tramite una misurazione di terze parti — e i valori p99 per il modello completo sono di Inworld stessa, e l'arena non ha nulla da dire su nessuno dei due. Sono plausibili per un modello orientato al tempo reale e non sono verificati, che è il modo corretto di considerarli.
Quindi la lettura pratica è: se il tuo prodotto clona le voci, il risultato Controlled di Inworld è il più rilevante dei due punteggi, ed è il motivo per cui un rango Provider più basso non è motivo di squalifica. Se il tuo prodotto non clona, quel vantaggio è invisibile per te e la classifica Provider è quella da leggere.
La scala dei prezzi ha tre gradini, e quello economico è un abbonamento.
Confrontare un prezzo con un prezzo fa sbagliare questo confronto, perché Inworld non ha un prezzo — ha una scala.
• Su richiesta — Realtime TTS-2 a $25,00 per milione di caratteri, Flash a $15,00. Questa è la tariffa che un utente pay-as-you-go vede, ed è la cifra pubblicata dal fornitore stesso.
• Creator plan — $20,00 e $10,00 per gli stessi due modelli, ovvero uno sconto del 20% e del 33% per essersi impegnati con un piano invece del pagamento a consumo. Segnalato dal fornitore, ed è il livello che vale più la pena ricontrollare sulla pagina dei prezzi live prima di impegnarsi, dato che le condizioni dei piani cambiano più rapidamente delle tariffe di listino.
• Normalizzato — la conversione per milione di caratteri dell'arena dà $20,80 per Realtime TTS-2 e $10,40 per Flash, il che è l'aritmetica della classifica anziché il preventivo di uno dei due fornitori.
Rispetto a ciò, le tariffe di Google sono basate sui token e promozionali: 0,50 $ per milione di token di testo in ingresso e 9,00 $ per milione di token audio in uscita fino al 31 dicembre 2026, poi 18,00 $; Flash-Lite TTS costa 0,50 $ e 6,00 $, poi 12,00 $. Normalizzate, equivalgono a 16,50 $ e 11,00 $.

Leggete i due insieme e il quadro è più interessante di «Google costa meno». Sui numeri pubblicati oggi, Flash TTS è il più economico dei tre modelli e la variante Flash di Inworld è la seconda più economica: i due modelli Flash sono abbastanza vicini che un piccolo cambiamento nel vostro rapporto audio-testo può invertire quale dei due fattura di meno. Il 1º gennaio 2027, quando la tariffa di Google raddoppia, l'ordine si stabilizza e Inworld diventa l'opzione più economica a ogni gradino della sua scala. Chi confronta questi due a settembre e si impegna a dicembre sta confrontando i numeri sbagliati.
Dove ciascuno è la risposta migliore
I due modelli sono così vicini in termini di qualità che gli elementi distintivi sono strutturali, perciò la versione onesta è un elenco di condizioni più che un verdetto.
Scegli Gemini 3.8 Flash TTS quando sei tu a scegliere la voce. Progettazione vocale da una descrizione scritta, dialogo a due voci in una singola chiamata, stile a livello di turno e la più ampia copertura linguistica dei due secondo il conteggio di Google stesso — nessuna delle quali Inworld eguaglia in questo confronto. È anche il modello più economico oggi, e il suo gemello Flash-Lite ti offre una seconda fascia di prezzo all'interno della stessa API.
Scegli Inworld Realtime TTS-2 quando la voce è del cliente. Una riga Controlled Voice al top, un percorso di clonazione istantanea misurato in secondi di audio di riferimento, un livello di clonazione professionale per i casi che richiedono di più e un orientamento al realtime supportato dalle dichiarazioni sul first-byte pubblicate dal fornitore — con l'avvertenza che le dichiarazioni sono del fornitore. È solo in inglese secondo la documentazione del fornitore stesso, il che è un vincolo severo se ti serve qualcos'altro.
Nessuno di questi modelli è ospitato da OrcaRouter, e vale la pena dirlo anziché lasciar intendere il contrario: il luogo da cui chiamare Gemini 3.8 Flash TTS è l'API di Google stessa e le superfici che Google ha indicato il 23 settembre, e il luogo da cui chiamare Inworld Realtime TTS-2 è la piattaforma di Inworld stessa. OrcaRouter serve invece per tutto ciò che ruota attorno a quella scelta — oltre 200 modelli dietro un'unica chiave al prezzo di listino del provider senza ricarichi, così una variazione delle tariffe di un fornitore come quella di gennaio è attiva dalla nostra parte lo stesso giorno, failover automatico così un modello valutato non deve necessariamente essere una dipendenza di produzione, e un DSL di routing per comporre modelli in un'unica chiamata quando nessuna singola voce può svolgere l'intero lavoro.
Il motivo per cui tenere entrambe queste possibilità in gioco è che la variazione del tasso di gennaio e la distinzione tra Controlled e Provider sono due motivi separati per cui la risposta può cambiare. Una pipeline che può chiamare solo uno dei due non può seguirne nessuno.
