Una hero card generata per l'articolo 'Gemini 3.8 Live vs ElevenLabs', che mostra due card arrotondate ai due lati del titolo. La card sinistra riporta 'Gemini 3.8 Live' sopra un'icona a nuvola e forma d'onda e la riga 'da voce a voce, una sola passata, al minuto'; la card destra riporta 'ElevenLabs Agents' sopra un'icona a pipeline a tre blocchi etichettata 'STT - LLM - TTS' e la riga 'assemblato, per minuto agente'. Un sottotitolo recita 'Un componente che noleggi vs un sistema che noleggia componenti'. Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Gemini 3.8 Live vs ElevenLabs: un modello contro una pipeline

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Apri la documentazione di ElevenLabs per la sua piattaforma di agenti e ci trovi un modello Gemini proprio nel mezzo. ElevenLabs Agents è una cascata — un front-end di riconoscimento vocale, un modello linguistico e un back-end di sintesi vocale — e il modello linguistico nello stack pubblicato è un Gemini. È il punto giusto da cui iniziare un confronto tra Gemini 3.8 Live ed ElevenLabs, perché le due cose messe a confronto non sono lo stesso tipo di oggetto. Gemini 3.8 Live è il modello speech-to-speech, rilasciato sulla Live API il 15 settembre 2026, con un prezzo per minuto di audio. ElevenLabs Eleven v3 è il modello di sintesi di punta di una piattaforma vocale che vende anche ElevenLabs Agents, ed è prezzato per carattere, non per conversazione. Uno è un componente che puoi noleggiare. L'altro è un sistema che noleggia componenti — compresi, in almeno una configurazione pubblicata, quelli di un modello Gemini.

Quell'asimmetria risolve la maggior parte delle domande che le persone portano effettivamente a questo confronto. Se ti stai chiedendo quale dei due chiamare, la risposta onesta è che non sono sostituti: uno è un modello con un listino prezzi e senza telefonia, l'altro è un prodotto con telefonia, limiti di concorrenza e tre contatori in funzione contemporaneamente. Quale dei due sia più economico, migliore o più veloce dipende interamente da quale di quelle due forme la tua applicazione già possiede.

Un modello, o tre modelli in sequenza

Gemini 3.8 Live è un sistema nativo speech-to-speech. L'audio entra, l'audio esce, e il ragionamento avviene nello stesso forward pass che produce il parlato — un solo modello, un solo budget di latenza, una sola fattura. Google l'ha rilasciato in due varianti il 15 settembre 2026: gemini-3.8-live per il lavoro conversazionale su larga scala, e gemini-3.8-live-extended-thinking per la stessa interfaccia con alle spalle il ragionamento multi-step. Entrambi gestiscono 97 lingue con cambio di lingua a conversazione in corso, entrambi elaborano input visivi quasi in tempo reale, entrambi eseguono chiamate a strumenti e API in background mentre la conversazione continua, ed entrambi applicano il watermark SynthID a ogni secondo di audio generato. La tariffa pubblicata è di $0,005 al minuto per l'audio in input e $0,018 al minuto per l'audio in output.

ElevenLabs Agents non è questo. È una pipeline, e la pipeline è il prodotto. Un modello di riconoscimento vocale in tempo reale trascrive il chiamante, un modello linguistico decide cosa dire e un modello di sintesi — Eleven Flash v2 nella configurazione documentata da ElevenLabs — pronuncia la risposta. Ogni fase è misurata separatamente, ogni fase può essere sostituita, e il tutto si trova dietro uno strato gestito che si occupa di telefonia, rilevamento dei turni e concorrenza. ElevenLabs Eleven v3, il modello di sintesi di punta dell'azienda, è ancora un prodotto diverso: un modello text-to-speech al prezzo di $100 per milione di caratteri, venduto per narrazione, doppiaggio e voice design piuttosto che per sostenere una conversazione.

Quindi la prima cosa da mettere a fuoco è che "Gemini 3.8 Live vs ElevenLabs Eleven v3" non è un confronto diretto tra due modelli vocali. Eleven v3 non accetta input audio e non sostiene una conversazione. Il confronto che ha senso è Gemini 3.8 Live contro ElevenLabs Agents, con Eleven v3 presente solo come il tetto di qualità di sintesi attorno al quale è costruita la piattaforma.

Dove ciascuno si trova effettivamente su una scheda

Non esiste una classifica che metta questi due a confronto diretto, e il motivo è istruttivo: continuano a comparire in classifiche diverse che misurano cose diverse.

Screenshot of the Artificial Analysis Speech to Speech AI Model & Provider Leaderboard page, captured September 2026, showing the page header and title, the methodology blurb describing comparison across reasoning quality, conversational dynamics, generation time and price, Highlights cards for the AA-Speech to Speech Index, Arena and Time to first audio, a Related Links panel listing the Text to Speech, Speech to Text and Speech Agent Arena leaderboards, and the Cost per Hour of Input Audio chart with its cheapest bar at $0.78 beneath the Speech to Speech Index / Index by Component panel.

Nell'Indice Speech to Speech di Artificial Analysis — che combina ragionamento vocale, completamento di attività agentiche, preferenza dell'arena e successo nei compiti in un unico numero — Gemini 3.8 Live ottiene 76,0, con la variante Extended Thinking a 82,6 al primo posto. Si tratta di misurazioni che Artificial Analysis esegue con il proprio harness, non di cifre pubblicate da Google, sebbene l'annuncio di Google citi numeri provenienti dagli stessi componenti.

ElevenLabs non compare affatto su quella classifica, perché non distribuisce un modello speech-to-speech da misurare. Dove compare è nella Speech Agent Arena, che valuta agenti assemblati anziché modelli, e il quadro che ne emerge è davvero misto: ElevenLabs Agents è stato misurato a 937 Elo con un tasso di successo del 90,5% nelle attività, contro 1.046 Elo e un tasso di successo del 74,6% nelle attività per un agente costruito sulla precedente generazione di Gemini Live, con l'agente Gemini che raggiunge il primo audio in 0,96 secondi. Leggi con attenzione quella coppia. L'agente basato su Gemini vince in preferenza e velocità; l'agente ElevenLabs vince nel portare a termine il compito. Si tratta di una cascata che batte un modello nativo in affidabilità, il che non è il risultato che i diagrammi di architettura prevedrebbero.

Due avvertenze su quei dati, entrambe importanti. Il lato Gemini di quel confronto usava la generazione Gemini Live di inizio 2026, non 3.8 Live, quindi non è una lettura del modello di cui parla questo articolo. E la terza classifica in gioco — la Provider Voices speech arena di Artificial Analysis, che classifica i modelli di sintesi — colloca ElevenLabs Eleven v3 a 1,177 Elo e la variante conversazionale, ElevenLabs v3 Conversational, a 1,219 Elo, contro 1,283 del leader, Cartesia Sonic 3.6. Quella classifica misura quanto bene suona la voce, non quanto bene si comporta l'agente, e mescolare le due cose è il modo in cui la gente finisce per citare un punteggio di sintesi come prova riguardo a un sistema conversazionale.

Confronto specifiche

A generated two-column scoreboard titled 'Gemini 3.8 Live vs ElevenLabs - the scoreboard'. The Gemini 3.8 Live column reads: Architecture 'native speech to speech', Audio in 'yes, one pass', Audio out 'yes, one pass', Languages '97, mid-conversation switching', Audio price '$0.005 in / $0.018 out per minute', Telephony 'none first-party', Agent tooling 'bring your own', Task success '93.2% (AA component)'. The ElevenLabs column reads: Architecture 'cascaded STT - LLM - TTS', Audio in 'yes, via Scribe v2 Realtime', Audio out 'yes, via Eleven Flash v2', Languages '74 on Eleven v3', Audio price 'per agent minute, plus LLM tokens', Telephony 'managed, first-party', Agent tooling 'built in', Task success '90.5% (Speech Agent Arena)'. Footer: 'Gemini 3.8 Live figures per Artificial Analysis and vendor materials; ElevenLabs figures vendor-reported. Not a like-for-like head-to-head.'

• Architettura — Gemini 3.8 Live è un unico modello nativo speech-to-speech, mentre ElevenLabs Agents è una cascata di riconoscimento vocale, un modello linguistico e sintesi

• Input e output — Gemini 3.8 Live riceve l'audio e lo restituisce in un unico passaggio, mentre ElevenLabs riceve l'audio tramite Scribe v2 Realtime e lo restituisce tramite Eleven Flash v2, con in mezzo una trascrizione testuale

• Cosa puoi sostituire — con Gemini 3.8 Live: nulla, il modello è il modello; con ElevenLabs: ogni fase indipendentemente, incluso il modello linguistico, che nello stack documentato è un modello di Google

• Lingue — Gemini 3.8 Live 97 con cambio a metà conversazione vs ElevenLabs Eleven v3 74

• Prezzi audio — Gemini 3.8 Live 0,005 $ al minuto in ingresso e 0,018 $ al minuto in uscita, rispetto a ElevenLabs con tariffazione sui minuti agente e i token del modello linguistico conteggiati separatamente in aggiunta

• Telefonia — Gemini 3.8 Live: nessuna soluzione first-party, porti il tuo operatore e la gestione delle sessioni vs ElevenLabs: gestito, first-party

• Concorrenza — Gemini 3.8 Live, per quanto lo consenta la quota della tua Live API, contro ElevenLabs venduto a livelli di concorrenza

• Strumenti per agenti — strumento in background Gemini 3.8 Live ed esecuzione API all'interno del modello vs ElevenLabs, un livello di agenti gestito con rilevamento dei turni, flussi di lavoro e una libreria vocale

• Artefatto aperto — nessuno dei due. Entrambi sono chiusi, esclusivamente cloud e proprietari

• Latenza — Gemini 3.8 Live 1,18 secondi al primo audio per il modello standard e 1,35 per Extended Thinking, secondo Artificial Analysis, mentre per ElevenLabs non è pubblicato un numero unico, perché la latenza di una cascata è la somma di tre fasi

L'ultima riga è quella che spiega la scelta architetturale meglio di tutte le altre. Un modello nativo ha un solo budget di latenza. Una cascata ne ha tre, e il motivo per cui i team scelgono ancora la cascata è tutto ciò che sta sopra: la trascrizione che puoi registrare, la fase che puoi sostituire e il numero di telefono che funziona e basta.

Quanto costa un minuto, in entrambe le direzioni

L'aritmetica di Gemini 3.8 Live è insolitamente semplice perché c'è un solo contatore. Un minuto di conversazione è all'incirca un minuto di audio del chiamante più un minuto di audio del modello: $0,005 più $0,018, quindi circa 2,3 centesimi al minuto alla tariffa pubblicata. La colonna del costo orario di Artificial Analysis, che normalizza il costo per completare un set fisso di ragionamento audio su base oraria, colloca il modello standard a $0,84 per ora di audio in input — la tariffa a pagamento più economica su quella tabella — e la variante Extended Thinking a $3,50.

Screenshot of the ElevenLabs pricing page captured September 2026, showing the ElevenCreative, ElevenAgents and ElevenAPI product tabs, a Monthly billing toggle, and the Free, Starter, Creator and Pro plan cards with their monthly prices of $0, $6, $11 and $99, the 'First month 50% off' promotion on Pro, and each tier's included credit allowance and feature list.

L'aritmetica di ElevenLabs è più complessa, e questo è il punto più che una critica. Un minuto di agente non ha un prezzo unico: c'è l'addebito della piattaforma per il minuto di agente in sé, i token del modello linguistico consumati nella tratta intermedia e i minuti dell'operatore telefonico sottostanti — tre contatori, tre fornitori nel caso peggiore, e una bolletta che si muove quando si muove uno qualsiasi di essi. Il lato della sintesi è più leggibile: ElevenLabs Eleven v3 a 100 $ per milione di caratteri corrisponde a circa 8 $ l'ora di narrazione continua a velocità di parlato normali, contro circa 2,70 $ per il concorrente open-weights più economico nella stessa arena. ElevenLabs applica un sovrapprezzo per la voce, e su quella classifica il sovrapprezzo è reale — si posiziona quarto in assoluto.

Ciò che le due strutture di costo significano in pratica è che Gemini 3.8 Live costa meno per minuto di conversazione e molto meno per ora di audio, mentre ElevenLabs è più costoso e molto più prevedibile da gestire. Un team senza ingegneri ML e con un numero di telefono da attivare spenderà meno con ElevenLabs nel primo mese, perché l'alternativa è costruire ciò che ElevenLabs ha già costruito. Un team che ha già in funzione la propria gestione delle sessioni e il proprio carrier spenderà meno sul modello grezzo, perché non paga per una pipeline che possiede già.

In cosa ElevenLabs è davvero migliore

Sarebbe facile interpretare il divario di prezzo come un verdetto. Non lo è, e le ragioni sono quelle che un listino prezzi non mostra mai.

• Telefonia. ElevenLabs vende numeri di telefono, trunking SIP e la capacità di gestire più chiamate contemporaneamente. Google vende un modello che parla. Se il tuo prodotto è una linea telefonica, il divario tra quelle due frasi equivale a mesi di ingegneria.

• Identità vocale. La Libreria vocale, la pipeline di clonazione e lo studio di doppiaggio sono una superficie di prodotto matura. Gemini 3.8 Live ti fornisce un modello; non ti fornisce un catalogo di voci con licenza né un flusso di lavoro per localizzare una registrazione esistente in nove lingue.

• Una trascrizione per impostazione predefinita. Poiché una cascata trascrive prima di ragionare, si ottengono gratuitamente log testuali di ogni chiamata — utili per la conformità, per la valutazione e per il lavoro poco glamour di scoprire perché l'agente ha sbagliato qualcosa. Un modello nativo da parlato a parlato non ha alcun artefatto del genere, a meno che non lo si costruisca.

• Parti intercambiabili. Quando esce un modello linguistico migliore, una cascata ElevenLabs può adottarlo senza riaddestrare nulla. È esattamente per questo che lo stack documentato ha un modello Google nel mezzo — ed è l'argomento più forte in assoluto a favore dell'architettura a cascata.

Cosa ti offre il modello grezzo

La controargomentazione non riguarda il prezzo. Riguarda ciò che un singolo passaggio in avanti può fare e che tre fasi non possono.

Gemini 3.8 Live percepisce prosodia, tono ed esitazione direttamente, anziché attraverso una trascrizione che li ha già gettati via, ed è per questo che può cambiare lingua a metà frase e che il suo punteggio di dinamica conversazionale — 96,1% per il modello standard, secondo Artificial Analysis — è l'unico componente in cui batte il proprio gemello orientato al ragionamento. Esegue inoltre chiamate a strumenti e API in background mentre continua a parlare, così una ricerca non produce silenzio. E la variante Extended Thinking è una capacità genuinamente diversa, non una versione più grande della stessa: risolve il 68,6% degli scenari di servizio clienti τ-Voice contro il 30,1% del modello standard, un divario di 38 punti che è il singolo numero più alto del rilascio e il motivo per cui Google ha diviso la linea in due.

Se il compito del tuo agente è portare a termine un'attività in più passaggi anziché sostenere una piacevole conversazione, quel divario di 38 punti è l'intera decisione, e costa 3,50 $ l'ora invece di 0,84 $ — comunque al di sotto di ogni modello che batte su quella classifica.

La gamba centrale è quella che puoi effettivamente muovere

Ecco la giuntura che vale la pena nominare, perché è qui che la questione architetturale diventa una questione di approvvigionamento. In una cascata, il tratto intermedio — la parte che decide cosa dire, chiama gli strumenti e svolge il ragionamento — è una normale inferenza testuale. È anche il tratto con la maggiore variabilità dei costi, il maggiore lock-in e la minore ragione di essere legato a un singolo fornitore. Lo stack documentato da ElevenLabs usa, in quel punto, un modello Gemini. Non deve per forza essere così.

OrcaRouter copre quella tratta e non le due esterne. Non ospitiamo gli endpoint vocali di Gemini 3.8 Live — quelli provengono dalla Live API di Google stessa — e non ospitiamo ElevenLabs, i cui livelli di sintesi e di agenti sono un suo prodotto. Quello che forniamo è il livello testuale sottostante: oltre 200 modelli dietro un'unica chiave al prezzo di listino del fornitore, senza ricarico, così un taglio di prezzo da un laboratorio a monte arriva sulla tua fattura lo stesso giorno, invece che al rinnovo successivo. Per uno stack vocale in particolare, tre di queste proprietà si ripagano da sole. Il failover automatico mantiene viva una chiamata quando un backend genera un errore o va in timeout a metà frase, un guasto che chi chiama nota immediatamente. Il DSL di routing compone più modelli in un'unica chiamata, così un modello economico può gestire i turni di conferma e uno più potente può occuparsi della transazione. E la fusione di modelli consente a un panel di rispondere insieme nei turni in cui il giudizio di un singolo modello non è abbastanza affidabile da essere considerato da solo. Cambiare quale modello sta al centro di una cascata è una modifica di configurazione, non una ricostruzione — ed è esattamente il motivo per cui l'architettura a cascata esiste.

Quale scegliere?

Scegli ElevenLabs se stai lanciando una linea telefonica e non vuoi costruire uno stack vocale. Stai acquistando telefonia, un catalogo vocale, trascrizioni, concorrenza e un contratto di supporto, e il sovrapprezzo al minuto è ciò che costano. Stai anche acquistando la capacità di cambiare modello nel mezzo senza cambiare nient'altro, il che vale più di quanto sembri.

Scegli Gemini 3.8 Live se la voce è una funzionalità di qualcosa che già gestisci. Ottieni la tariffa speech-to-speech competente più economica attualmente pubblicata da chiunque, 97 lingue con cambio in mezzo alla conversazione, esecuzione di strumenti che avviene mentre il modello continua a parlare e — se il tuo agente deve completare attività anziché limitarsi a conversare — il divario agentico di 38 punti che la variante Extended Thinking acquista per circa quattro volte il costo orario dell'audio. Fornisci tu il carrier, il ciclo di vita della sessione e i log.

Cosa tenere d'occhio: se ElevenLabs pubblica un singolo valore di latenza per un minuto di agente gestito, perché quello è il numero che renderebbe questo confronto quantitativo anziché strutturale; e se il risultato di Speech Agent Arena regge quando su di essa viene misurato un agente costruito su 3.8 Live, perché una cascata che attualmente batte un modello nativo sul successo del compito è la cosa più interessante di questa sfida e la meno spiegata.