Una hero card generata per ElevenLabs Eleven v4 vs OpenAI TTS-1 HD con due card di punteggio: Eleven v4 a Elo 1.319, posizione 1 e 80,00 $ per 1 milione di caratteri; OpenAI TTS-1 HD a Elo 1.104, posizione 35 e 30,00 $ per 1 milione di caratteri; con la didascalia '216 punti Elo, ed entrambi gli endpoint ricevono ancora traffico'. Piè di pagina: 'Provider Voice Arena, secondo Artificial Analysis, settembre 2026.' Il logo di OrcaRouter si trova nell'angolo in basso a destra.
Guides & Insights

Eleven v4 vs OpenAI TTS-1 HD: due anni di divergenza in un'unica board

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

OpenAI TTS-1 HD ha una data di rilascio del 6 novembre 2023. ElevenLabs Eleven v4 ha una data di rilascio del 28 settembre 2026. Su Provider Voice Arena di Artificial Analysis quelle due date distano 216 punti Elo — TTS-1 HD si trova al 35° posto con 1.104 punti su 3.500 apparizioni a 30,00 $ per milione di caratteri, mentre Eleven v4 si trova al 1° posto con 1.319 punti su 1.674 apparizioni a 80,00 $. Entrambi i valori presentano intervalli ristretti, ±12 e ±19, quindi l'ordine non è in dubbio. La domanda interessante non è quale modello sia migliore, perché era già stato stabilito prima che questo articolo esistesse. È perché un endpoint del 2023 abbia ancora 3.500 apparizioni su una classifica in cui un modello vecchio di cinque giorni ne ha 1.674, e cosa questo ti dice sulla migrazione che ti viene chiesto di considerare.

Il tabellone, e l'unica riga in cui OpenAI vince

Cinque dimensioni decidono questo confronto, e vale la pena leggere l'una accanto all'altra entrambe le posizioni su ciascuna.

• Preferenza alla cieca, voci dei fornitori — Eleven v4 al 1° posto, Elo 1.319 (±19, 1.674 apparizioni) contro TTS-1 HD al 35° posto, Elo 1.104 (±12, 3.500 apparizioni). Un divario di 216 punti che resiste alle barre di errore.

• Prezzo di listino, per milione di caratteri — Eleven v4 $80,00 vs TTS-1 HD $30,00. OpenAI costa il 62% in meno a listino, e ancora meno durante la promozione ElevenLabs.

• Voci — Eleven v4 documenta la clonazione istantanea da dieci secondi di audio più un livello professionale di clonazione; TTS-1 HD fornisce un set vocale fisso, nove per la famiglia tts-1 nella documentazione di OpenAI stessa (alloy, ash, coral, echo, fable, onyx, nova, sage, shimmer) e nessuna clonazione.

• Indicazioni di performance — Eleven v4 documenta tag audio inline e prompt di direzione in linguaggio naturale; TTS-1 HD accetta semplice testo, e il parametro steerable-instructions di OpenAI appartiene al suo modello TTS più recente, non a questo.

• Data di uscita — Eleven v4 28 settembre 2026 vs TTS-1 6 novembre 2023.

A generated scoreboard comparing ElevenLabs Eleven v4 and OpenAI TTS-1 HD across six dimensions: Provider Voice rank and Elo (1 / 1,319 against 35 / 1,104), samples (1,674 with an interval of plus or minus 19 against 3,500 with plus or minus 12), board price ($80.00 against $30.00 per 1M characters), rate card ($0.022 per 1K characters until October 12 against $30.00 per 1M at list), voices (cloning from 10 s of audio plus a professional tier against nine fixed presets) and direction (inline audio tags against plain text only). Footer: 'Ranks, Elo and board prices per Artificial Analysis; voice set, list price and capabilities vendor-documented.' The OrcaRouter logo sits in the bottom-right corner.

Il prezzo è la riga in cui OpenAI vince ed è una vittoria più grande di quanto sembri, perché la promozione di ElevenLabs è temporanea. A 0,022 $ per 1.000 caratteri, Eleven v4 costa 22 $ per milione fino al 12 ottobre — addirittura meno caro di TTS-1 HD. Dopo il 12 ottobre costa 80 $ per milione contro i 30 $ di OpenAI, e rimane tale.

Perché un modello del 2023 ha il doppio del numero di campioni

Quel numero è la cosa più utile su questa board ed è facile leggerlo male. Le apparizioni in Arena si accumulano con il traffico, e il traffico si accumula con integrazioni costruite una volta e mai più riviste. TTS-1 HD ha 3.500 apparizioni alle spalle perché è stato l'endpoint vocale predefinito per ogni team che già chiamava OpenAI per le chat completions: stessa chiave, stesso SDK, stessa riga di fatturazione, una chiamata in più. Niente in quella frase riguarda la qualità della voce, e il deficit di 216 punti non l'ha fermato.

A screenshot of Artificial Analysis' TTS-1 HD model page, titled TTS-1 HD Quality Elo, Speed & Price Analysis, credited to OpenAI and the OpenAI TTS family with an Elo of 1,103.83. The Provider Voice Arena Preference Elo bar chart runs from Eleven v4 at 1,319 at the left through Gemini 3.8 Flash TTS, Simba 3.2, Eleven v3 and Gemini 3.8 Flash-Lite TTS to TTS-1 HD at 1,104 at the right, with the model selector reading '28 of 96 models'.

Ecco come si presenta il debito di migrazione su una classifica. Non è un segnale che il modello più vecchio sia competitivo; è un segnale che cambiare costa qualcosa, e che un gran numero di team ha deciso che quel qualcosa vale più di 216 punti Elo. Questa è una conclusione legittima per una lettura delle notifiche e una scarsa per un prodotto in cui la voce è ciò che il cliente sente.

Le ragioni per restare su TTS-1 HD

Tre cose lo mantengono difendibile, e nessuna di esse è la qualità.

Il determinismo è la prima cosa. Un insieme fisso di nove voci produce un output coerente tra le versioni in un modo che una pipeline di clonazione non fa, e un output coerente è ciò che vuoi in un percorso di utilità dove nessuno è in ascolto per l'arte. Non c'è nessun clone che possa andare alla deriva, nessun campione di riferimento da registrare di nuovo e nessun artefatto di consenso da mantenere.

Il costo di integrazione è il secondo, ed è quello che l'arena non è in grado di quantificare. Aggiungere un secondo fornitore di sintesi vocale significa un nuovo account, un nuovo listino prezzi, una nuova modalità di errore e una nuova cosa da monitorare. Per un team già all'interno dello stack OpenAI, si tratta di tempo di ingegneria reale, e 216 punti Elo non lo ripagano.

Il volume di fascia bassa è il terzo. A 30 dollari per milione di caratteri, l'intera bolletta vocale mensile di un piccolo prodotto è un errore di arrotondamento, e non c'è nulla da ottimizzare. Questo è il regime in cui la risposta economica e la risposta pigra sono la stessa risposta, e va bene così.

Le ragioni a favore del trasferimento e la controargomentazione ad esse

Passa quando la voce è rivolta al cliente. La clonazione in dieci secondi, la direzione della performance inline, oltre 90 lingue e un limite di input di 10.000 caratteri per richiesta non sono differenze cosmetiche rispetto a un set fisso di nove voci del 2023, e il divario di 216 punti dell'arena è la versione compressa di un divario di capacità molto più ampio. Se stai costruendo un agente, un assistente brandizzato o qualsiasi contesto in cui un ascoltatore si forma un'opinione del tuo prodotto nella prima frase, l'endpoint più vecchio è il default sbagliato.

La controargomentazione è che "passare a Eleven v4" non è l'unica mossa. OpenAI ha da allora rilasciato un modello TTS più recente con un parametro di istruzioni orientabile, e il Gemini 3.8 Flash TTS di Google si trova al terzo posto sulla stessa classifica con 1.267 e un prezzo normalizzato di 16,49 $ per milione — un guadagno di 163 punti rispetto a TTS-1 HD a circa metà del prezzo di classifica. Se il tuo vincolo è rimanere all'interno del tuo fornitore attuale, quello è l'upgrade più economico. Se è rimanere all'interno del tuo cloud attuale, è l'unico.

Dove si colloca effettivamente OrcaRouter in questo confronto

This is the rare article in this series where we host one of the two models, so let us be precise about which. openai/tts-1-hd is live in the OrcaRouter catalogue at OpenAI's list rate passed through at 0% markup: $30 per million, model ID openai/tts-1-hd, served on the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1 with a POST /v1/audio/speech route and the voice, speed and response_format parameters. Our own page reports a median latency of 2,461 ms and a 95th percentile of 4,769 ms, which is the honest reason not to put it in front of a live conversation — that is a batch-shaped number, not an agent-shaped one.

A screenshot of the OrcaRouter model page for openai/tts-1-hd. The header shows the model ID openai/tts-1-hd with Audio and JSON tags, the description 'OpenAI's high-definition text-to-speech model, accessed via OrcaRouter's API at $30 per 1M tokens (zero markup)', and the endpoint /v1/audio/speech. Stat tiles read $30.00 per 1M characters, p50 TTFT 2.46 s, p95 TTFT 4.77 s and traffic of 1.5K characters over 7 days. Supported parameters are response_format, speed and voice, the OpenAI-compatible base URL is https://api.orcarouter.ai/v1, and the pricing panel states 'This model is not billed per token. The rate above is the unit it actually meters, and it is what settlement charges.'

ElevenLabs Eleven v4 non è nel nostro catalogo, e non c'è nulla da chiamare tramite noi: vi si accede attraverso l'API di ElevenLabs con il listino prezzi di ElevenLabs. Ciò che cambia una singola chiave è la forma della migrazione. Se il motivo per cui non hai testato il nuovo leader è che comporta una seconda integrazione con un fornitore, il costo per scoprirlo è una singola chiamata API con una chiave che già possiedi, anziché un ciclo di approvvigionamento. I prezzi di listino dei fornitori passano con 0% di ricarico, quindi una rimodulazione dei prezzi da parte di un fornitore — inclusa la reversione del 12 ottobre di ElevenLabs — è attiva dalla nostra parte il giorno stesso in cui avviene, e failover automatico significa che un percorso vocale in fase di valutazione non deve diventare una dipendenza di produzione mentre decidi.

L'aritmetica che dovrebbe risolverlo

Cinque milioni di caratteri al mese, che corrispondono a un prodotto di medie dimensioni e a circa 100 ore di parlato. TTS-1 HD costa 150 $. Eleven v4 costa 110 $ durante la finestra promozionale e 400 $ dopo il 12 ottobre. Gemini 3.8 Flash TTS, alla normalizzazione del consiglio, costa circa 82,50 $.

Rileggi quei quattro numeri e la decisione si divide nettamente. Durante la finestra, il modello più recente e con il miglior ranking sulla classifica è anche il secondo meno caro — più economico dell'endpoint 2023 che supera di 216 punti Elo. Dopo il 12 ottobre è l'opzione più costosa della lista, per un fattore di quasi cinque. Nulla nei modelli cambia in quella data; cambia solo la fattura.

Quindi: se stai valutando questo mese, valuta con la tariffa promozionale e scrivi la tariffa di listino nel business case. Se rilasci il prossimo trimestre, pianifica a partire da $0,08 per 1.000 caratteri e considera qualsiasi confronto che citi $0,022 come un documento con una data di scadenza stampata sopra. E se sei su TTS-1 HD e la ragione onesta è l'inerzia dell'integrazione, il primo passo utile non è un piano di migrazione — è un singolo A/B sui tuoi script, prezzato alla tariffa che pagherai effettivamente a novembre.