Una hero card generata per 'Gemini 3.8 TTS vs Inworld Realtime TTS-2' su sfondo bianco con morbidi accenti sfumati blu e ciano. La card di sinistra 'Gemini 3.8 Flash TTS' elenca Elo 1.260 in posizione 2, 8 voci dell'arena, 130 lingue dichiarate e 16,50 $ per 1M di caratteri normalizzati; la card di destra 'Inworld Realtime TTS-2' elenca Elo 1.245 in posizione 4, 8 voci dell'arena, solo inglese, 20,80 $ per 1M di caratteri normalizzati e il primo posto nella Controlled Voice Arena. Una riga a piè di pagina recita 'Elo secondo Artificial Analysis Provider Voice Arena, settembre 2026; prezzi secondo Google e Inworld.' Il logo OrcaRouter è compositato nell'angolo in basso a destra.
Guides & Insights

Gemini 3.8 TTS vs Inworld Realtime TTS-2: Quale tabellone di valutazione credi cambi la risposta

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Metti Gemini 3.8 Flash TTS e Inworld Realtime TTS-2 uno accanto all'altro sull'Artificial Analysis Provider Voice Arena e la risposta sembra ovvia: 2° posto contro 4° posto, Elo 1.260 contro 1.245, 8 voci dell'arena ciascuno, e un prezzo normalizzato di $16,50 per milione di caratteri contro $20,80. Il fornitore vince sulla posizione e sul prezzo, e il divario di 15 punti rientra comunque negli intervalli di confidenza di entrambe le righe.

Passa all'altra classifica pubblicata da Artificial Analysis e l'ordine si inverte. Inworld Realtime TTS-2 occupa la prima posizione nella Controlled Voice Arena con un Elo di 1.123, mentre la sua variante Flash è a 1.075. Non è una differenza di arrotondamento — è un modello diverso che vince, e il motivo è che le due classifiche non misurano la stessa cosa. Se stai scegliendo una voce per un prodotto, sapere quale di queste due domande sta effettivamente ponendo il tuo caso d'uso è l'intera decisione.

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Inworld Realtime TTS-2, showing Provider Arena position (rank 2, Elo 1,260 against rank 4, Elo 1,245), Controlled Arena position (not top ranked against rank 1 at Elo 1,123), price ($16.50 against $20.80 per 1M characters), languages (130 claimed against English only), cloning path (a 30-second sample against 5 to 15 seconds) and dialogue (two speakers against a single voice).

Due consigli, due domande diverse

Il Provider Voice Arena valuta le voci native di un modello stesso — quelle che il fornitore distribuisce e ospita. Il Controlled Voice Arena mantiene costante la voce e valuta quanto bene si comporta ogni modello quando gli viene chiesto di parlare con una voce che non è la sua. Stessi giudici, stesso tipo di confronto cieco, variabile diversa.

Quella distinzione corrisponde a due diversi lavori:

• La classifica dei provider risponde alla domanda "questo modello suona bene fin da subito?". È la classifica giusta per un prodotto che viene fornito con un set fisso di voci narranti e non clona mai nulla.

• Il ranking controllato risponde alla domanda «questo modello rispetta una specifica di voce?». È la classifica giusta per un prodotto in cui la voce è quella del cliente: una voce di marca clonata, un attore con licenza, un'identità per tenant.

I modelli di Google sono in testa alla prima. Quelli di Inworld sono in testa alla seconda. Entrambe le affermazioni sono vere allo stesso tempo e nessuna delle due è una contraddizione, ed è esattamente per questo che una singola risposta a «quale modello TTS è il migliore» di solito è segno che chi scrive ha scelto una classifica e non ha guardato l'altra.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Inworld Realtime TTS-2 at rank 4 with an Elo of 1,245, with Inworld Realtime TTS-2 Flash further down at 1,210 and Gemini 3.8 Flash-Lite TTS at rank 6.

Che cosa implica in pratica la posizione numero uno di Inworld

Un risultato Controlled al primo posto è un'affermazione sulla fedeltà a un'istruzione, e la fedeltà a un'istruzione è la proprietà che decide se la clonazione è utilizzabile o meno.

Il percorso di clonazione di Inworld si presenta in due forme. La clonazione istantanea funziona da un breve campione — la cifra indicata dal fornitore è da 5 a 15 secondi di audio di riferimento — e un livello di clonazione professionale è in beta e richiede nell'ordine dei dieci minuti. Entrambe sono dichiarate dal fornitore, e nessuna delle due è verificata in modo indipendente dall'arena; ciò che l'arena misura è il comportamento del modello una volta che ha una voce, non la qualità della fase di clonazione che l'ha prodotta.

Le dichiarazioni sulla latenza associate alla famiglia rientrano nella stessa categoria. Il dato sul primo byte della variante Flash — 25 millisecondi, riportato tramite una misurazione di terze parti — e i valori p99 per il modello completo sono di Inworld stessa, e l'arena non ha nulla da dire su nessuno dei due. Sono plausibili per un modello orientato al tempo reale e non sono verificati, che è il modo corretto di considerarli.

Quindi la lettura pratica è: se il tuo prodotto clona le voci, il risultato Controlled di Inworld è il più rilevante dei due punteggi, ed è il motivo per cui un rango Provider più basso non è motivo di squalifica. Se il tuo prodotto non clona, quel vantaggio è invisibile per te e la classifica Provider è quella da leggere.

La scala dei prezzi ha tre gradini, e quello economico è un abbonamento.

Confrontare un prezzo con un prezzo fa sbagliare questo confronto, perché Inworld non ha un prezzo — ha una scala.

• Su richiesta — Realtime TTS-2 a $25,00 per milione di caratteri, Flash a $15,00. Questa è la tariffa che un utente pay-as-you-go vede, ed è la cifra pubblicata dal fornitore stesso.

• Creator plan — $20,00 e $10,00 per gli stessi due modelli, ovvero uno sconto del 20% e del 33% per essersi impegnati con un piano invece del pagamento a consumo. Segnalato dal fornitore, ed è il livello che vale più la pena ricontrollare sulla pagina dei prezzi live prima di impegnarsi, dato che le condizioni dei piani cambiano più rapidamente delle tariffe di listino.

• Normalizzato — la conversione per milione di caratteri dell'arena dà $20,80 per Realtime TTS-2 e $10,40 per Flash, il che è l'aritmetica della classifica anziché il preventivo di uno dei due fornitori.

Rispetto a ciò, le tariffe di Google sono basate sui token e promozionali: 0,50 $ per milione di token di testo in ingresso e 9,00 $ per milione di token audio in uscita fino al 31 dicembre 2026, poi 18,00 $; Flash-Lite TTS costa 0,50 $ e 6,00 $, poi 12,00 $. Normalizzate, equivalgono a 16,50 $ e 11,00 $.

A screenshot of Inworld's text-to-speech product page, showing the Realtime TTS-2 and TTS-2 Flash model cards, the instant and professional voice cloning tiers, per-million-character pricing, and usage statistics including 642,022,085 characters used and 223,764 minutes generated.

Leggete i due insieme e il quadro è più interessante di «Google costa meno». Sui numeri pubblicati oggi, Flash TTS è il più economico dei tre modelli e la variante Flash di Inworld è la seconda più economica: i due modelli Flash sono abbastanza vicini che un piccolo cambiamento nel vostro rapporto audio-testo può invertire quale dei due fattura di meno. Il 1º gennaio 2027, quando la tariffa di Google raddoppia, l'ordine si stabilizza e Inworld diventa l'opzione più economica a ogni gradino della sua scala. Chi confronta questi due a settembre e si impegna a dicembre sta confrontando i numeri sbagliati.

Dove ciascuno è la risposta migliore

I due modelli sono così vicini in termini di qualità che gli elementi distintivi sono strutturali, perciò la versione onesta è un elenco di condizioni più che un verdetto.

Scegli Gemini 3.8 Flash TTS quando sei tu a scegliere la voce. Progettazione vocale da una descrizione scritta, dialogo a due voci in una singola chiamata, stile a livello di turno e la più ampia copertura linguistica dei due secondo il conteggio di Google stesso — nessuna delle quali Inworld eguaglia in questo confronto. È anche il modello più economico oggi, e il suo gemello Flash-Lite ti offre una seconda fascia di prezzo all'interno della stessa API.

Scegli Inworld Realtime TTS-2 quando la voce è del cliente. Una riga Controlled Voice al top, un percorso di clonazione istantanea misurato in secondi di audio di riferimento, un livello di clonazione professionale per i casi che richiedono di più e un orientamento al realtime supportato dalle dichiarazioni sul first-byte pubblicate dal fornitore — con l'avvertenza che le dichiarazioni sono del fornitore. È solo in inglese secondo la documentazione del fornitore stesso, il che è un vincolo severo se ti serve qualcos'altro.

Nessuno di questi modelli è ospitato da OrcaRouter, e vale la pena dirlo anziché lasciar intendere il contrario: il luogo da cui chiamare Gemini 3.8 Flash TTS è l'API di Google stessa e le superfici che Google ha indicato il 23 settembre, e il luogo da cui chiamare Inworld Realtime TTS-2 è la piattaforma di Inworld stessa. OrcaRouter serve invece per tutto ciò che ruota attorno a quella scelta — oltre 200 modelli dietro un'unica chiave al prezzo di listino del provider senza ricarichi, così una variazione delle tariffe di un fornitore come quella di gennaio è attiva dalla nostra parte lo stesso giorno, failover automatico così un modello valutato non deve necessariamente essere una dipendenza di produzione, e un DSL di routing per comporre modelli in un'unica chiamata quando nessuna singola voce può svolgere l'intero lavoro.

Il motivo per cui tenere entrambe queste possibilità in gioco è che la variazione del tasso di gennaio e la distinzione tra Controlled e Provider sono due motivi separati per cui la risposta può cambiare. Una pipeline che può chiamare solo uno dei due non può seguirne nessuno.