
GPT-Live-1 vs ElevenLabs: un modello che ascolta, un'azienda che vende tutto il resto
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Il numero più utile in questo confronto è 90,5%. Si tratta del tasso di successo nelle attività che Artificial Analysis ha misurato per ElevenLabs Agents nella sua Speech Agent Arena — il più alto tra i primi sei di quella classifica, ottenuto da un sistema che non è affatto un singolo modello, ma una cascata di riconoscimento vocale, un modello linguistico e un sintetizzatore, tenuti insieme dalla logica di turn-taking di ElevenLabs. GPT-Live-1, il modello full-duplex end-to-end di OpenAI, non compare in quella classifica, perché gareggia in una diversa: lo Speech to Speech Index, dove si trova al sesto posto a pari merito su quattordici con il 70,3%. Nel frattempo, ElevenLabs Eleven v3 rimane la voce di produzione più ampiamente diffusa nel settore, con più di 10.000 voci nella sua libreria e oltre 70 lingue.
La formula sintetica è che una parte ti vende una conversazione e l'altra ti vende un'azienda. Quella formula è in gran parte corretta, e nasconde il risultato più interessante che sta sotto: una cascata ben progettata batte ancora un modello full-duplex nativo nel portare a termine il compito.
Due architetture, e la differenza sta in dove sono le cuciture
GPT-Live-1 è un singolo modello che riceve in ingresso audio e testo e produce in uscita audio e testo. Gestisce l'interruzione in modo nativo — i test interni di OpenAI, pubblicati con il rilascio dell'API di settembre e non riprodotti al di fuori dell'azienda, riportano l'80,1% di interattività su Full Duplex Bench v1.5 contro il 45,4% di GPT-Realtime-2.1, e una latenza nel cambio di turno di 0,798 secondi contro 1,41. Non ci sono cuciture, perché non c'è nulla da cucire insieme.
ElevenLabs Agents è la scommessa opposta, deliberatamente. La documentazione di ElevenLabs descrive una pipeline: riconoscimento vocale ottimizzato, un modello linguistico che scegli o porti tu stesso, un sintetizzatore a bassa latenza — tipicamente qualcosa della linea Flash — e un modello proprietario di turn-taking in cima. Il barge-in è una configurazione per agente che espone l'impazienza di turno e i timeout piuttosto che una proprietà del modello. Nella configurazione predefinita benchmarkata di Artificial Analysis, lo stack prevede Scribe v2 Realtime per il riconoscimento vocale, un modello Gemini per il ragionamento e Eleven Flash v2 per la sintesi.
Quel progetto ha un enorme vantaggio e un costo strutturale. Il vantaggio è che ogni fase è sostituibile: un modello economico per i turni semplici, un modello di frontiera per quelli difficili, un sintetizzatore diverso per un'altra localizzazione. Il costo è che la latenza si accumula a ogni giunzione, e la decisione sull'alternanza dei turni deve essere presa dall'esterno.
Dimensione per dimensione
• Architettura — GPT-Live-1: un modello end-to-end, audio in e audio out vs ElevenLabs Agents: riconoscimento vocale, modello linguistico e sintesi in cascata con un livello proprietario di gestione dei turni
• Prove indipendenti — GPT-Live-1: 70,3% sull'Artificial Analysis Speech to Speech Index, sesto a pari merito su quattordici rispetto a ElevenLabs Agents: Elo 937 nella Speech Agent Arena con un tasso di successo nei task del 90,5% su 676 campioni, il miglior tasso di successo tra i primi sei di quella classifica
• Classifiche di qualità — GPT-Live-1: non è classificato nelle arene text-to-speech, essendo un tipo diverso di modello rispetto a ElevenLabs: Eleven v3 Conversational a 1.194 Elo ed Eleven v3 a 1.166 nella classifica Provider Voice, al prezzo rispettivamente di 50 $ e 100 $ per milione di caratteri
• Prezzo — GPT-Live-1: 0,05 $ al minuto vocale, fatturato al secondo, il ragionamento backend viene conteggiato separatamente rispetto a ElevenLabs: circa 50 $ per milione di caratteri per Eleven v3 Conversational e circa 100 $ per Eleven v3, con agenti indicati a circa 0,08 $ al minuto, che aumentano una volta superato il tetto di concorrenza, mentre i costi del modello linguistico e della telefonia vengono fatturati separatamente
• Latenza — GPT-Live-1: nessun tempo al primo audio a livello di modello pubblicato; 0,798 secondi di latenza di alternanza dei turni nei test del fornitore rispetto a ElevenLabs: circa 75 millisecondi per Flash v2.5 e circa 280 millisecondi per Eleven v3 Conversational, con indicazioni del fornitore di meno di 800 millisecondi al primo audio a livello di agente
• Voci e clonazione — GPT-Live-1: dodici preset API, nessuna clonazione per design vs ElevenLabs: più di 10.000 voci nella libreria, clonazione istantanea da un breve campione, clonazione professionale da 30 a 180 minuti di audio con autoverifica
• Lingue — GPT-Live-1: le lingue principali sono ben servite, fluenza disomogenea al di fuori di esse nella copertura di lancio rispetto a ElevenLabs Eleven v3: oltre 70 lingue, contro 32 per la linea Flash e oltre 90 per il suo riconoscimento vocale
• Ampiezza — GPT-Live-1: un endpoint, un ID modello, livelli di concorrenza da 25 a 500 sessioni e nessun piano gratuito, contro ElevenLabs: sintesi, riconoscimento vocale, doppiaggio, effetti sonori, musica, un marketplace vocale e una piattaforma di agenti con un unico contratto, con un piano gratuito che non prevede licenza commerciale


Dove ElevenLabs non è solo avanti, ma senza rivali
Tre dei divari in quell'elenco non sono affatto ravvicinati, e qualsiasi confronto che dedichi loro una frase è ingiusto verso il titolare in carica.
Il clonaggio è il primo punto. GPT-Live-1 include dodici preset e, per scelta progettuale, nessuna funzione di clonaggio — una precisa impostazione di sicurezza, non una funzionalità mancante. ElevenLabs offre la clonazione istantanea a partire da un breve campione di riferimento e la clonazione professionale addestrata su 30-180 minuti di audio, subordinata a fasce di piano e a un passaggio di auto-verifica. Se la voce del vostro prodotto fa parte della sua identità, questa non è una dimensione in cui GPT-Live-1 compete.
La libreria vocale è la seconda. Più di 10.000 voci, oltre a un marketplace con licenza di voci iconiche di patrimoni e artisti, è un asset che nessun lancio di modello riesce a replicare. È anche la cosa che gli acquirenti sottovalutano più spesso: scegliere una voce è l'ultimo miglio di un prodotto vocale, e averne diecimila tra cui scegliere comprime un esercizio di branding in un pomeriggio.
Il terzo è l'ampiezza. Riconoscimento vocale, doppiaggio, effetti sonori, musica, una piattaforma per agenti — un team che ha bisogno di quattro di questi acquista un solo contratto invece di quattro. È un vantaggio strategico, non di qualità, e sopravvive al fatto che l'altra parte vinca un benchmark.
Entrambe le aziende presentano questioni di governance che appartengono a una revisione degli acquisti piuttosto che a una nota a piè di pagina. Il clonaggio professionale di ElevenLabs richiede l'autoverifica e i suoi termini proibiscono di clonare la voce di un'altra persona anche con il consenso; la società deve anche affrontare una serie di azioni collettive depositate nel maggio 2026 riguardanti il consenso ai dati di addestramento, in cui le accuse non sono provate. La posizione di OpenAI è più semplice perché ha rimosso la funzionalità che genera il rischio.

La tassa a cascata, e dove vale la pena pagarla
I costi di una cascata si manifestano come latenza e come orchestrazione. Le linee guida del fornitore per ElevenLabs collocano il tempo al primo audio di un agente sotto gli 800 millisecondi alla mediana e sotto 1,5 secondi al 95° percentile — cifre che descrivono l'intera pipeline, non i 75 millisecondi del sintetizzatore. A questi si aggiungono il tempo di generazione del modello linguistico e il transito di rete. Parte di ciò è recuperabile scegliendo attentamente le fasi; nulla è gratuito.
Il conto dell'orchestrazione è più contenuto ma reale. Ogni fase extra è un altro punto in cui una chiamata può fallire, un altro timeout da regolare, un altro fornitore con cui riconciliare le fatture. Questa è la parte che un modello end-to-end nativo elimina del tutto: c'è una sola cosa che può rompersi, e o risponde o non risponde.
Il punto in cui la cascata si ripaga da sola è lo stadio intermedio. Il modello linguistico dietro un agente vocale è il componente la cui qualità migliora più rapidamente e il cui costo varia di più, e poterlo sostituire senza toccare il livello vocale vale soldi veri nell'arco della vita di un prodotto. Circa 190 modelli provenienti da undici fornitori upstream stanno dietro a un'unica chiave OrcaRouter al prezzo di listino del fornitore, senza alcun ricarico, così una variazione di prezzo di un fornitore raggiunge quello strato lo stesso giorno, e il failover automatico impedisce che un timeout del backend ponga fine a una chiamata in corso. Né lo stack di agenti di ElevenLabs né l'endpoint Live Sessions di GPT-Live-1 sono raggiungibili in quel modo — i livelli vocali appartengono ai rispettivi fornitori, e questo è il livello sottostante.
Quale scegliere?
Scegli GPT-Live-1 se le meccaniche della conversazione sono il prodotto e vuoi un unico contratto con un unico modo di fallire. Linee telefoniche in cui chi chiama parla sopra all'agente, in cui un passaggio di consegne naturale conta più di una voce perfetta e in cui dodici buone voci bastano. Accetti un modello hosted chiuso, nessun cloning, una qualità indipendente nella media e nessun piano gratuito su cui prototipare.
Scegli ElevenLabs se il vincolo è la qualità della voce, la clonazione o l'ampiezza. Narrazione, doppiaggio, prodotti multilingue, qualsiasi cosa in cui la voce sia il brand, qualsiasi cosa che richieda il riconoscimento vocale nello stesso contratto. Accetti una cascata da gestire, prezzi all'incirca da dieci a venti volte quelli di GPT-Live-1 per unità di parlato, e il fatto che la logica di interruzione sia tua da configurare e tua da sbagliare.
Il 90,5% è la parte che vale la pena portare a casa. Dice che un'azienda che ha assemblato tre modelli e un livello di alternanza dei turni ha battuto un'azienda che ha addestrato un solo modello a fare tutto quanto, sulla metrica che più si avvicina a indicare se la chiamata ha funzionato. Il full duplex è un vero progresso architetturale e, sulla base delle prove attuali, non è ciò che decide se il chiamante ottiene quello che voleva.
