![Una hero card generata per ElevenLabs Eleven v4 con due pannelli: a sinistra, un blocco di script che mostra tag audio inline come [laughs], [whispers] e [said angrily in French accent]; a destra, un pannello che riporta rank 1, Elo 1.319, 80,00 $ per 1M di caratteri e 1.674 presenze su Provider Voice Arena di Artificial Analysis, con un footer che recita «Rank Provider Voice, Elo e prezzo secondo Artificial Analysis, settembre 2026; sintassi dei tag e latenza documentate dal fornitore». Il logo OrcaRouter si trova nell'angolo in basso a destra.](https://cms.orcarouter.ai/api/media/file/1-1462.png)
Gli Audio Tags di Eleven v4 e i Cloni da Dieci Secondi: Cosa Cambia nella Tua Pipeline
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 982 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 197 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
La cosa più importante di ElevenLabs Eleven v4 non è il suo Elo. È che il modello legge le indicazioni di regia scritte nel copione — [ride], [sussurra], [sospira], [detto con rabbia con accento francese], persino [pioggia leggera] — e che ElevenLabs Eleven v4 Turbo, il fratello a bassa latenza rilasciato lo stesso giorno, segue gli stessi tag a un tempo mediano prima del primo parlato che il fornitore stima intorno ai 150 ms. Entrambi sono diventati disponibili a livello generale il 28 settembre 2026. Il Provider Voice Arena di Artificial Analysis ha già Eleven v4 al primo posto con un Elo di 1.319 su 1.674 presenze, a un prezzo di listino di 80,00 $ per milione di caratteri. La classifica è la notizia principale. La sintassi di regia e il clone da dieci secondi sono la parte che cambia ciò che devi costruire.
![A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.](https://cms.orcarouter.ai/api/media/file/2-1397.png)
Due modelli, un lancio, ruoli diversi
ElevenLabs ha rilasciato due endpoint il 28 settembre 2026, e non sono lo stesso prodotto con un interruttore della velocità. ElevenLabs Eleven v4 è il modello espressivo: oltre 90 lingue, un limite di 10.000 caratteri per richiesta, un supporto migliorato dell'Alfabeto Fonetico Internazionale per le pronunce personalizzate e dialoghi multi-relatore che, secondo l'azienda, preservano l'identità del parlante nell'arco di una scena. ElevenLabs Eleven v4 Turbo mantiene le oltre 90 lingue e il limite di 10.000 caratteri, ma è ottimizzato per gli agenti: l'annuncio cita una latenza mediana di inferenza di circa 100 ms e un tempo mediano alla prima emissione vocale di circa 150 ms, misurati da ElevenLabs a settembre 2026.

La domanda reattiva — il modello di punta è abbastanza veloce per un agente telefonico — non ha una risposta pubblicata. ElevenLabs fornisce cifre di latenza per Turbo, non per Eleven v4 stesso, e i due sono endpoint distinti anziché un unico modello con due nomi. Se il budget del tuo agente è di 200 ms per il primo audio, Turbo è l'endpoint nella documentazione e il modello di punta no.
I tag sono un'interfaccia reale e una dipendenza reale
I tag audio inline non sono una novità per la sintesi vocale, ma il cambiamento utile qui è l'accuratezza dell'aderenza. L'annuncio afferma che Eleven v4 segue i tag audio e i prompt di direzione in linguaggio naturale con maggiore precisione rispetto ai modelli precedenti, e che è così che si dirige una risata, un sussurro o un'interpretazione in un accento specifico senza modificare l'audio in seguito.
Ne derivano tre conseguenze pratiche, e contano più dei video dimostrativi:
• Il tuo copione diventa un artefatto templatizzato, non una stringa. Un tag è un token nella tua pipeline di contenuti: necessita di escaping se del testo non attendibile vi viene mai fatto passare attraverso, e deve sopravvivere al tuo CMS, al tuo livello di traduzione e alla tua revisione dei diff. Un traduttore che omette [sussurra] ha cambiato uno spettacolo, silenziosamente.
• L'aderenza ai tag è un'affermazione del fornitore con una versione allegata. L'affermazione che questa generazione segua i tag meglio della precedente è di ElevenLabs stessa, testata da ElevenLabs, e non varrà in modo identico tra le lingue. Verificate sui vostri script e sulle vostre locale prima di costruirci sopra una guida di stile.
• Tag di effetti sonori come [pioggia leggera] o [telefono che vibra] spostano un po' del lavoro della post-produzione audio nel prompt testuale. Si tratta di uno spostamento di costi che vale la pena misurare: se un tag sostituisce una passata di foley, è economico; se non sostituisce nulla e aggiunge solo variabilità, è una nuova modalità di errore nel tuo QA.
Dieci secondi è il numero che cambia l'onboarding
Instant Voice Cloning in questa versione cattura una voce con alta fedeltà da dieci secondi di audio, con il livello di clonazione professionale ancora disponibile al di sopra. Dieci secondi sono un intervallo abbastanza breve da eliminare un passaggio del flusso di lavoro: acquisizione del consenso, caricamento del campione e prima sintesi possono avvenire in un'unica sessione, su un telefono, senza uno studio.
Il problema del consenso non si riduce con il campione. Cresce, perché l'asticella per produrre un clone convincente è scesa a una clip che chiunque può registrare. Se stai clonando voci che non possiedi, la questione della conformità ora spetta interamente a te, da risolvere a monte della chiamata API — il modello farà ciò che gli chiedi. Considera la cifra di dieci secondi una soglia operativa, non un permesso.
Quanto costa mentre la finestra è aperta
ElevenLabs ha riprezzato al lancio, e la tariffa promozionale è quella che si vede oggi sulla pagina. Nella tabella dei prezzi dell'API, Eleven v4 è indicato a 0,022 $ per 1.000 caratteri contro un listino dichiarato di 0,08 $, ed Eleven v4 Turbo a 0,011 $ contro 0,04 $. Entrambi riportano la stessa etichetta: sconto del 72% fino al 12 ottobre. Sulla stessa pagina il precedente modello di punta, Eleven v3, è prezzato a 0,08 $ per 1.000 caratteri.
• Prezzo della classifica sull'arena, per milione di caratteri — Eleven v4 $80,00, il più alto nella top ten di quella classifica.
• Tariffario del fornitore, per mille caratteri — 0,022 $ fino al 12 ottobre, poi 0,08 $.
• Che cosa significa in pratica — un mese intenso di script da cinque milioni di caratteri costa $110 durante la finestra e $400 dopo, sullo stesso endpoint con lo stesso codice.

Chiunque stia pianificando il budget per il Q1 basandosi sul numero riportato oggi nella pagina sta pianificando il budget su un numero che scade tra due settimane. Usa 0,08 $.
Dove un router si guadagna il suo posto in un lancio come questo
OrcaRouter non ospita ElevenLabs, quindi in questo lancio non c'è nulla da chiamare tramite noi, e non lasceremo intendere il contrario — il posto da cui chiamare Eleven v4 è l'API di ElevenLabs stessa. Ciò per cui una singola chiave è davvero utile nelle due settimane successive a un lancio è il confronto. Se stai decidendo se il nuovo flagship batte ciò che già esegui, vuoi fare un A/B tra i due sui tuoi script anziché su una classifica, e farlo con due fornitori significa due account, due rapporti di fatturazione e due percorsi di integrazione prima di avere una risposta.
Questo è il caso che gestiamo: una sola chiave API su oltre 200 modelli con i prezzi di listino dei provider trasferiti a 0% di markup, così una variazione di prezzo di un fornitore — inclusa una finestra promozionale con data di scadenza — è attiva dalla nostra parte lo stesso giorno anziché al successivo ciclo di fatturazione. Quando un percorso vocale è rivolto al cliente, il failover automatico sposta il traffico su un upstream sano quando un endpoint si degrada, ed è così che puoi provare un modello nuovissimo senza scommettere una release su di esso.
Cosa testare per primo e cosa ignorare
Tre controlli ti diranno di più di qualsiasi classifica. Primo, fai passare il tuo script realistico più lungo attraverso il limite di 10.000 caratteri e guarda dove cadono le giunture: il limite è per richiesta, e il dialogo con più parlanti è la funzionalità che più probabilmente viene spezzata da esso. Secondo, inserisci cinque tue frasi con tag sia in v4 sia in v4 Turbo e ascolta le derive di aderenza tra l'endpoint espressivo e quello a bassa latenza; sono modelli separati, e un tag che funziona su uno potrebbe non funzionare in modo identico sull'altro. Terzo, valuta il tuo volume mensile effettivo di caratteri a $0,08 invece che a $0,022, perché è il numero su cui si baserà il tuo prossimo trimestre.
Il dato del ~75% di preferenza in cieco nell'annuncio è una misurazione del fornitore e non abbiamo intenzione di trasformarlo in qualcos'altro. Il numero indipendente in questo lancio è quello in classifica: primo posto a 1.319 Elo su 1.674 presenze, e un intervallo di circa ±19 punti attorno a esso. È un risultato forte su una classifica reale. Non è una specifica e non ti dirà se la tua sintassi dei tag sopravvive a un passaggio di traduzione.
