Una hero card per "Eleven v4 in testa alla Voice Arena": una classifica con ElevenLabs Eleven v4 al 1° posto con Elo 1.319, Cartesia Sonic 3.6 al 2° posto con Elo 1.276, Google Gemini 3.8 Flash TTS al 3° posto con Elo 1.267, ElevenLabs Eleven v3 al 18° posto con Elo 1.169, e un nastro con la scritta "72% di sconto fino al 12 ottobre". Piè di pagina: "Provider Voice Arena, secondo Artificial Analysis, settembre 2026." Il logo OrcaRouter si trova nell'angolo in basso a destra.
Guides & Insights

Eleven v4 domina la Voice Arena: cosa ha vinto davvero il nuovo modello di punta di ElevenLabs

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

ElevenLabs Eleven v4 è arrivato il 28 settembre e si è piazzato direttamente in cima alla Provider Voice Arena di Artificial Analysis con un Elo di 1.319 — 43 punti di vantaggio su Cartesia Sonic 3.6, fermo a 1.276, e 52 punti di vantaggio su Google Gemini 3.8 Flash TTS, a 1.267. È anche, a 80,00 $ per milione di caratteri su quella stessa classifica, il modello più costoso della top ten. E nella seconda arena — quella costruita con voci clonate anziché con il set di voci proprietario di ciascun fornitore — non vince affatto: arriva secondo, dietro a un modello che costa un quarto. Entrambe le cose sono vere, e la parte utile di questo lancio è capire sotto quale delle due ricade il vostro caso d'uso.

Cosa è stato effettivamente rilasciato il 28 settembre

ElevenLabs ha reso disponibili in generale due modelli, non uno. ElevenLabs Eleven v4 è il modello di sintesi di punta — l'azienda lo definisce il suo più emotivo, e la sua documentazione fissa il limite di input a 10.000 caratteri per richiesta e la copertura linguistica a oltre 90. ElevenLabs Eleven v4 Turbo è il fratello a bassa latenza: stesse oltre 90 lingue, un limite di 10.000 caratteri e il supporto per i tag audio inline che consentono di scrivere un'indicazione di resa direttamente nel copione — una risata, un sussurro, un ronzio sulla linea. Entrambi sono attivi nelle superfici agent, creative e API dell'azienda dal primo giorno, un rollout più rapido di quello della generazione v3.

La pagina dell'annuncio è dove risiede l'elenco delle funzionalità e, cosa degna di nota, non i prezzi. ElevenLabs descrive una nuova architettura, una migliore gestione di tono, ritmo e carattere, un dialogo multi-parlante più affidabile con identità stabile del parlante, un input di fonemi IPA migliorato e cloni vocali istantanei creati a partire da dieci secondi di audio, accanto al livello professionale di clonazione esistente. L'unico numero che vi compare è un'affermazione sugli ascoltatori: il fornitore dice che nei confronti alla cieca v4 è stato preferito in circa tre quarti dei casi. È un dato del fornitore, non riprodotto, e va letto accanto ai numeri della board riportati di seguito, non al posto loro.

Dove si trovano effettivamente i prezzi — la pagina dei prezzi delle API — è il documento più significativo, ed è trattato più avanti. In breve: questo lancio non è un aumento dei prezzi.

Due schede, due risposte diverse

Artificial Analysis gestisce due arene vocali e non sono varianti l'una dell'altra. Provider Voice fa confrontare agli ascoltatori le voci di ciascun fornitore. Controlled Voice clona le stesse otto voci — quattro statunitensi, quattro britanniche — per ogni concorrente, così il parlante resta costante e varia solo il modello. Un modello con un ottimo set di voci predefinite può vincere la prima e perdere la seconda. Eleven v4 fa esattamente questo.

• Voce del provider, Eleven v4 — posizione 1, Elo 1.319, 80,00 $ per milione di caratteri, 1.674 campioni, otto voci dell'arena, settembre 2026

• Voce provider, Cartesia Sonic 3.6 — posizione 2, Elo 1.276, 49,00 $

• Voce provider, Google Gemini 3.8 Flash TTS — posizione 3, Elo 1.267, $16,50

• Provider Voice, il precedente modello di punta ElevenLabs Eleven v3 — posizione 18, Elo 1.169, $100,00

• Voce controllata, Alibaba Qwen-Audio-3.1-TTS-Plus — posizione 1, Elo 1.178

• Controlled Voice, Eleven v4 — posizione 2, Elo 1.157, $80,00

• Voce controllata, Cartesia Sonic 3.6 — posizione 4, Elo 1.138

• Voce controllata, ElevenLabs Eleven v3 — posizione 7, Elo 1.073

• Voce controllata, Google Gemini 3.8 Flash TTS — 13° posto, Elo 1.048

• Migliore voce open-weights su Provider Voice — Breeze TTS 2, Elo 1.206, $34.00

A single-column scoreboard card for ElevenLabs Eleven v4 with six rows: 'Provider Voice rank: 1 (Elo 1,319)', 'Controlled Voice rank: 2 (Elo 1,157)', 'Board price: $80.00 per 1M characters', 'Rate card: $0.022 per 1K characters until Oct 12', 'Languages and cap: 90-plus, 10,000 characters', 'Latency: not stated for v4 itself'. Footer: 'Elo and board prices per Artificial Analysis; rate card and specs vendor-documented.'

Il salto di generazione è la notizia principale per chiunque usi già ElevenLabs: rispetto al proprio predecessore sulla stessa classifica, Eleven v4 guadagna 150 punti Elo con Provider Voice e 84 con Controlled Voice. Questo è un salto generazionale, non una semplice messa a punto, e il miglioramento è maggiore sulla classifica in cui il fornitore può scegliere le voci — che è il modo onesto di dire che il suo nuovo cast predefinito è una parte reale del guadagno.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing ElevenLabs Eleven v4 first at Elo 1,319 with $80.0 per 1M chars, 1,674 samples and a -19/19 confidence interval, Cartesia Sonic 3.6 second at Elo 1,276 and $49.0, Google Gemini 3.8 Flash TTS third at Elo 1,267 and $16.5, and ElevenLabs Eleven v3 eighteenth at Elo 1,169 and $100.0, under columns for samples, arena voices, release month and API pricing.

Il tabellone di pronuncia a cui non possiamo dare un numero

Artificial Analysis ha davvero una sezione Pronunciation Robustness, e vale la pena descriverla adeguatamente perché il riepilogo della classifica che circola descrive Eleven v4 come in cima. La board misura la quota di porzioni evidenziate che i revisori hanno giudicato pronunciate correttamente, con un massimo di tre revisori per clip, e i prompt vengono inviati esattamente come scritti — nessuna espansione dei numeri, nessuna normalizzazione del testo. È suddivisa in sottocategorie, e il punto del design è che un modello che riscrive silenziosamente "Dr." o "$4.50" prima di parlare ottiene di proposito un punteggio basso.

Ciò che la classifica non pubblica, nella visualizzazione che siamo riusciti a leggere, è un punteggio numerico citabile per modello. Quindi non c'è alcuna cifra da citare per Eleven v4 lì, e l'Elo di 1.319 appartiene alla preferenza dell'arena — quanto la voce sia piaciuta agli ascoltatori — non all'accuratezza della pronuncia. Se vedi le due cose messe sullo stesso piano, quella è la sovrapposizione. L'affermazione difendibile di questo lancio è quella con i numeri attaccati: primo su Provider Voice a 1.319, secondo su Controlled Voice a 1.157.

Lo sconto di lancio è la vera novità per la tua bolletta

ElevenLabs ha riprezzato i nuovi modelli contemporaneamente al loro rilascio, e lo sconto è abbastanza ampio da poter cambiare da solo una decisione d’acquisto. Nella pagina dei prezzi delle API, Eleven v4 è indicato a $0,022 per mille caratteri rispetto a un listino dichiarato di $0,08 — una riduzione del 72% — e Eleven v4 Turbo è indicato a $0,011 rispetto a $0,04. Entrambi hanno la stessa finestra temporale: la promozione dura fino al 12 ottobre. Dopodiché, i prezzi tornano ai valori originali, e il prezzo ripristinato di v4 è il doppio di quanto costa oggi il v3 di ElevenLabs, a $0,08. Pianifica partendo dal prezzo successivo alla promozione, non da quello promozionale.

La revisione dei prezzi sposta anche la posizione di v4 rispetto alla concorrenza, calcolata per carattere: la normalizzazione dell'arena la mostra già a 80,00 $ per milione. In quella normalizzazione, Sonic 3.6 è a 49,00 $, Breeze TTS 2 a 34,00 $, Qwen-Audio-3.0-TTS-Plus a 19,30 $ e Gemini 3.8 Flash TTS a 16,50 $. Con la tariffa promozionale, Eleven v4 a 22 $ per milione è nettamente più economico di Sonic 3.6. Con la tariffa di listino è di gran lunga la voce più costosa del listino. Chiunque stia preparando un budget per il Q1 dovrebbe guardare il secondo numero.

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v4 row at $0.022 per 1K characters with a struck-through $0.08 and a '72% off until Oct 12' badge, and the Eleven v4 Turbo row at $0.011 with a struck-through $0.04, alongside the v3 row at $0.08 and the Eleven v3 Conversational row at $0.04.

Un mese preso ad esempio rende concreto il divario. A cinque milioni di caratteri — un prodotto di medie dimensioni che elabora circa cento ore di parlato — Eleven v4 durante la finestra costa $110. Al prezzo ripristinato di $0,08 costa $400. Sonic 3.6 costa $245. Gemini 3.8 Flash TTS costa $82,50. Lo stesso mese su v3 di ElevenLabs costa anch'esso $400, che è il fatto curioso alla base di questo lancio: per le prossime due settimane il nuovo modello di punta costa meno del modello che sostituisce, e il giorno in cui la finestra si chiude smette di essere più economico e diventa semplicemente migliore.

La dichiarazione sulla latenza è fornita dal fornitore e dipende dal livello.

ElevenLabs pubblica cifre di latenza per livello, non per famiglia di modelli, e sono misurazioni effettuate dall'azienda, non dati indipendenti. Eleven v4 Turbo è indicato a circa 100 ms di inferenza mediana e circa 150 ms di tempo mediano al primo parlato, misurati a settembre 2026. Eleven v3 Conversational è indicato a circa 280 ms, e i precedenti livelli Flash e Turbo a circa 75 ms. La documentazione non pubblica una cifra equivalente per Eleven v4 stesso, che è il livello che vorresti se stessi costruendo un agente in tempo reale e leggessi una scheda tecnica invece di fare test.

Cartesia dichiara una latenza inferiore a 90 ms per Sonic e lo descrive come primo per naturalezza, con clonazione vocale da dieci secondi di audio, dizionari di pronuncia personalizzati e un set di conformità che copre HIPAA, SOC 2 Type 2, GDPR e PCI. Queste sono le dichiarazioni del fornitore stesso sulla propria pagina di prodotto — la stessa categoria di prove dei numeri delle fasce di latenza di ElevenLabs, e non intercambiabili con l'Elo dell'arena. L'unico ambito in cui i due fornitori sono direttamente confrontabili è quello delle classifiche.

Dove ti lascia questo, e come provarlo

Se stai scegliendo una voce per un prodotto in cui il cast predefinito è quello che i tuoi utenti sentono, il risultato di Provider Voice è quello che conta, ed Eleven v4 l'ha appena conquistato, con uno sconto valido per due settimane. Se stai clonando la voce di una persona specifica e a ogni modello candidato viene chiesto di riprodurre gli stessi otto speaker, la classifica Controlled Voice è quella che conta ed Eleven v4 è seconda — 21 Elo dietro la leader e, a prezzo di listino, più di quattro volte il costo per carattere. Nessuno dei due risultati è sbagliato; sono risposte a domande diverse, e la seconda è la domanda che la maggior parte del lavoro di clonazione vocale in produzione si sta effettivamente ponendo.

OrcaRouter non ospita ElevenLabs, Cartesia né nessuno degli altri fornitori presenti su queste board, quindi non c'è nulla qui che si possa chiamare tramite noi e non lasceremo intendere il contrario. Quello che offriamo è l'infrastruttura di contorno, nel caso in cui il vostro stack vocale finisca per abbracciare più fornitori: una sola chiave API per oltre 200 modelli, con i prezzi di listino dei fornitori trasferiti a un ricarico dello 0%, così un taglio di prezzo di un fornitore — inclusa una finestra promozionale come questa — è attivo dalla nostra parte lo stesso giorno, anziché al ciclo di fatturazione successivo. Dove un percorso vocale è critico per la produzione, il failover automatico passa a un upstream sano quando uno si degrada, che è il modo pratico per testare un endpoint nuovissimo senza scommetterci una release.

La data da annotare è il 12 ottobre. È il giorno in cui Eleven v4 smette di essere la voce buona più economica sul mercato e diventa quella più costosa, e qualsiasi confronto scritto questa settimana che citi $22 per milione senza dirlo è un confronto che dovresti rifare tra tre settimane.