Una hero card generata per 'Gemini 3.8 TTS vs ElevenLabs' su sfondo bianco con delicati accenti in gradiente blu e ciano. La scheda di sinistra 'ElevenLabs Eleven v3' elenca 100 $ per 1M caratteri, oltre 70 lingue, Elo 1.167 e posizione 17; la scheda di destra 'Gemini 3.8 Flash TTS' elenca 33 $ per 1M caratteri, 130 lingue, Elo 1.260 e posizione 2. Una riga a piè di pagina recita 'Elo secondo Artificial Analysis Provider Voice Arena, set 2026.' Il logo OrcaRouter è sovrapposto nell'angolo in basso a destra.
Guides & Insights

Gemini 3.8 TTS vs ElevenLabs: cosa ottieni pagando il triplo del prezzo

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

A parità di volume, il modello di sintesi di punta di ElevenLabs costa circa tre volte quello nuovo dello stesso fornitore. ElevenLabs Eleven v3 fattura 0,10 $ per mille caratteri — 100 $ per milione — e Gemini 3.8 Flash TTS fattura 9,00 $ per milione di token audio, che Artificial Analysis normalizza a 33,00 $ per milione di caratteri. Si tratta di un divario di 3,0 volte sul contatore, ed è il fatto più importante di questo confronto. La domanda interessante non è se il divario sia reale; è che cosa comprano effettivamente i sessantasette dollari in più per milione di caratteri, perché la risposta non è "una voce migliore".

A generated two-column scoreboard for ElevenLabs Eleven v3 and Gemini 3.8 Flash TTS — Eleven v3 at Arena Elo 1,167, $100.00 per 1M characters, 70-plus languages, a 280 ms latency claim and 4,345 samples; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 130 languages, no latency claim and 1,999 samples — over the footer 'Elo per Artificial Analysis; latency vendor-reported.'

Tre metri, non uno

La prima cosa da mettere in chiaro è che questi due prodotti non misurano la stessa cosa, e i listini prezzi pubblicati lo nascondono.

• ElevenLabs fattura in base ai caratteri. Eleven v3 costa $0,10 per 1.000 caratteri, con un limite massimo di 5.000 caratteri per richiesta. Eleven v3 Conversational costa $0,05 per 1.000, e anche i modelli Flash e Turbo costano $0,05 per 1.000, ma con un limite di 40.000 caratteri per richiesta e una latenza dichiarata di ~75 ms rispetto ai ~280 ms di v3 Conversational.

Google fattura in base ai token, e i token audio non sono token di testo. Gemini 3.8 Flash TTS addebita 0,50 $ per milione di token di testo in input e 9,00 $ per milione di token audio in output, con conteggio di 25 token audio al secondo di parlato generato. Non è pubblicato alcun limite di caratteri per richiesta.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

Artificial Analysis non fattura nessuno dei due; normalizza. I 100,00 $ e i 33,00 $ per milione di caratteri sulla sua classifica Provider Voice Arena sono un denominatore comune derivato, così che la classifica possa quantomeno ordinare in base al prezzo. Utile per un rapporto, non per un preventivo.

Quindi la versione onesta del dato 3.0x è: sull'unica base omogenea disponibile, Google costa circa un terzo del prezzo. Ciò che questo significa nel tuo foglio di calcolo dipende dal fatto che il tuo carico di lavoro sia dominato da stringhe brevi o lunghe — un contatore audio al secondo e un contatore di testo per carattere divergono nettamente man mano che gli enunciati si allungano, perché silenzio, pause e riempimento prosodico costano tutti token audio e nessun carattere.

Un mese lavorato

Prendi un milione di caratteri di testo, all'incirca la lunghezza di un romanzo di medie dimensioni, convertiti in parlato una volta.

• ElevenLabs Eleven v3 — 100,00 $ per la sintesi, più qualunque livello di piano ti serva per eseguirlo alla concorrenza che hai. I piani pubblicati offrono Starter a 6 $, Creator a 22 $, Pro a 99 $, Scale a 299 $ e Business a 990 $, e le quote di caratteri sono incluse in questi anziché fatturate separatamente.

• Gemini 3.8 Flash TTS — equivalente a $33,00, o circa $16,50 se il lavoro è batchabile, perché il livello Batch e Flex dimezza la tariffa audio a $4,50 per milione di token. Il servizio Priority la porta a $16,20 per milione, o circa $59,40 equivalenti, che è comunque ben al di sotto di ElevenLabs.

• Gemini 3.8 Flash-Lite TTS — 6,00 $ per milione di token audio, circa 22,10 $ equivalenti sulla stessa normalizzazione, al costo di 101 lingue invece di 130.

Se si fa passare lo stesso milione di caratteri attraverso il prezzo promozionale di Google, il divario si allarga ulteriormente, perché entrambi i nuovi modelli Gemini TTS sono a tariffa dimezzata fino al 31 dicembre 2026 e poi raddoppiano. Chi costruisce un business case sui numeri di settembre lo sta costruendo su uno sconto che ha una data di scadenza pubblicata.

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v3 card at $0.10 per 1K characters with a 5,000-character limit, v3 Conversational at $0.05 with a 280 ms latency claim, v2 Multilingual at $0.10 with 29 languages, and Flash/Turbo at $0.05 with a 40,000-character limit.

L'unico punto in cui il confronto si ribalta sono gli enunciati molto brevi. Una tariffazione per carattere non addebita quasi nulla per una conferma di tre parole; una tariffazione audio al secondo addebita il secondo che la conferma impiega a essere pronunciata, inclusi i silenzi che la circondano. Se il tuo prodotto è un'interfaccia vocale costruita con risposte di una sola frase, l'aritmetica pende verso ElevenLabs. Se è narrazione, audiolibri, localizzazione long-form o qualsiasi cosa in cui il testo è lungo e l'audio è più lungo, pende decisamente verso Google.

La questione della qualità, sinceramente

Sull'Artificial Analysis Provider Voice Arena — voti pairwise in cieco tra le voci native di ciascun provider — i due modelli non sono affatto vicini, e Google è in vantaggio.

• Gemini 3.8 Flash TTS — posizione 2, Elo 1.260, un intervallo di 17 punti, 1.999 campioni, 8 voci arena, pubblicato a settembre 2026.

• ElevenLabs Eleven v3 — posizione 17, Elo 1.167, un intervallo di 11 punti, 4.345 campioni, 8 voci dell'arena, indicato come febbraio 2026 nella classifica.

Novantatré punti Elo li separano e, a differenza del divario tra i primi tre di quella classifica, questo è reale: l'intervallo di Eleven v3 va da 1.156 a 1.178 e quello di Gemini da 1.243 a 1.277, senza sovrapposizione. Il numero di campioni di Eleven v3 è più del doppio di quello di Gemini, quindi neanche la stima è debole.

Questo è un risultato davvero scomodo per l'argomentazione sul prezzo, e va contro la conclusione ovvia. ElevenLabs costa tre volte tanto e si classifica diciassette posizioni più in basso nelle preferenze alla cieca. Qualunque cosa si compri con i sessantasette dollari in più, non è una voce che suona meglio in un confronto testa a testa.

Cosa vende in realtà ElevenLabs

ElevenLabs non vende principalmente un endpoint di sintesi, e attribuirgli un prezzo come se lo fosse è l'errore in cui incappano quasi tutti i confronti. Ecco cosa si compra con quei soldi:

• Una libreria di voci. La libreria di voci condivisa di ElevenLabs conta centinaia di voci ed è una vera e propria superficie di prodotto — ciò per cui le persone si rivolgono a ElevenLabs è spesso una voce specifica che hanno sentito da qualche parte, non il modello che vi sta dietro. Gemini 3.8 Flash TTS include 30 voci studio predefinite, un percorso di progettazione vocale che ne genera una da una descrizione in linguaggio naturale, e un percorso di replica che clona da un campione di 30 secondi con verifica del consenso, una filigrana SynthID e credenziali C2PA associate. Il catalogo predefinito è più piccolo; la capacità di creare una voce specifica è comparabile.

• Livelli di latenza come prodotti separati. Flash e Turbo a ~75 ms con un limite di 40.000 caratteri sono un prodotto diverso da v3 a ~280 ms e 5.000 caratteri, ed entrambi costano meno di v3. Se la tua applicazione richiede meno di 100 ms, ElevenLabs lo vende esplicitamente e il materiale di lancio di Google non avanza alcuna dichiarazione di latenza comparabile per nessuno dei due nuovi modelli TTS.

• Un ecosistema. Doppiaggio, agenti vocali, endpoint conversazionali, una struttura di piani con concorrenza associata — la stessa ragione per cui Cartesia vende telefonia: è uno stack, non un modello.

Se stai comprando uno stack, il 3.0x è il prezzo per non assemblarlo. Se stai comprando una chiamata di sintesi, la stai pagando per una libreria vocale e un livello di latenza.

Cosa sta davvero vendendo Google

Il contro-caso è più ristretto e più forte di "più economico".

• Copertura linguistica — 130 lingue su Flash TTS e 101 su Flash-Lite TTS, rilevate automaticamente dal testo, rispetto alle oltre 70 lingue documentate da ElevenLabs per Eleven v3. Per un passaggio di localizzazione, quella differenza non è un confronto tra funzionalità: è un divario di copertura.

• Direzione — controllo della resa riga per riga, messa in scena di una scena a due voci all'interno di una singola chiamata, e segnali non verbali scritti nel copione come <laughs>, <sigh>, <gasp>, |mhm| e |yeah|. Google sostiene che la generazione 3.8 abbia migliorato la coerenza sui testi lunghi e il controllo a due voci rispetto a Gemini 3.1 Flash TTS, che è esattamente lo scopo per cui esistono queste funzionalità. Affermazione del fornitore, non riprodotta.

• Modello di stato delle voci: 200 voci personalizzate con stato per progetto con un TTL di un anno, oppure voci senza stato indirizzate tramite un handle voicekey_... che scadono in sette giorni. È una decisione infrastrutturale su cui puoi pianificare.

• Controllo dell'output — PCM con segno a 16 bit, mono, 24 kHz sull'endpoint unario, PCM senza intestazione (audio/l16) sull'endpoint di streaming, e audio/mulaw e audio/alaw con frequenza di campionamento configurabile.

I benchmark di lancio di Google sono dichiarati dal fornitore e vanno letti come tali: primo sull'Hume AI Voice Design Benchmark con 71,4 e primo sulla modellazione degli accenti con 60,8, primo e secondo sull'Hume Overall Quality Index rispettivamente per Flash e Flash-Lite, e le migliori posizioni rivendicate nelle preferenze alla cieca in giapponese, portoghese brasiliano, vietnamita, arabo standard moderno, spagnolo messicano e hindi. Nessuna di queste esecuzioni è pubblica. L'Elo dell'arena sopra è l'unico numero raccolto in modo indipendente in questo articolo, e guarda caso concorda con la direzione delle dichiarazioni del fornitore.

Il calcolo degli switch

Passa se il tuo carico di lavoro è long-form, multilingue o abbastanza ad alto volume da far comparire 3.0x come voce separata, e se puoi accettare un catalogo di voci predefinite più ridotto e nessun tier sub-100 ms pubblicato. Questo copre narrazione, doppiaggio, accessibilità e la maggior parte del parlato integrato nei prodotti.

Resta se stai acquistando lo stack — la libreria vocale, i livelli di latenza, i prodotti di doppiaggio e per agenti — o se il tuo carico di lavoro è dominato da enunciati molto brevi in cui un misuratore audio al secondo ti penalizza. Resta anche se hai già messo a punto un'identità vocale su ElevenLabs che i tuoi utenti riconoscono, perché la continuità vocale è una funzionalità del prodotto e ricrearla su un nuovo modello è un progetto.

In ogni caso, la mossa sensata è eseguirli entrambi per un mese su traffico reale prima di impegnarsi, ed è questo l'argomento per non collegare direttamente nessuno dei due al tuo codebase. OrcaRouter mette oltre 200 modelli dietro un'unica chiave al prezzo di listino del provider, senza ricarichi, così una variazione di prezzo da parte di uno dei due laboratori arriva sulla tua fattura lo stesso giorno invece che al rinnovo, e il failover automatico mantiene attivo un percorso vocale di produzione quando un endpoint nuovissimo si comporta male. Non ospitiamo ElevenLabs — i suoi livelli di sintesi e agente sono un prodotto a sé stante — e non ospitiamo gli endpoint TTS Gemini 3.8, che provengono dall'API di Google. Ciò che forniamo è il livello di testo sottostante e il routing al di sopra.

Il numero da tenere d'occhio è l'Elo di Eleven v3 nella prossima revisione della classifica. Novantatré punti sono un grosso svantaggio per un modello che costa tre volte tanto, e se l'intervallo si restringe senza che il divario si colmi, l'argomentazione sul prezzo smette di essere un compromesso e diventa un verdetto.