Una tarjeta destacada generada para ElevenLabs Eleven v4 vs. OpenAI TTS-1 HD con dos tarjetas de puntuación: Eleven v4 con Elo 1.319, puesto 1 y $80,00 por 1 millón de caracteres; OpenAI TTS-1 HD con Elo 1.104, puesto 35 y $30,00 por 1 millón de caracteres; con el texto «216 puntos Elo, y ambos endpoints siguen recibiendo tráfico». Pie de página: «Provider Voice Arena, según Artificial Analysis, septiembre de 2026». El logotipo de OrcaRouter se encuentra en la esquina inferior derecha.
Guides & Insights

Eleven v4 vs OpenAI TTS-1 HD: Dos años de deriva en un solo tablero

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

OpenAI TTS-1 HD tiene una fecha de lanzamiento del 6 de noviembre de 2023. ElevenLabs Eleven v4 tiene una del 28 de septiembre de 2026. En la Provider Voice Arena de Artificial Analysis, esas dos fechas están separadas por 216 puntos Elo — TTS-1 HD ocupa el puesto 35 con 1,104 en 3,500 apariciones a $30.00 por millón de caracteres, mientras que Eleven v4 ocupa el puesto 1 con 1,319 en 1,674 apariciones a $80.00. Ambas cifras presentan intervalos estrechos, ±12 y ±19, así que el orden no está en duda. La pregunta interesante no es qué modelo es mejor, porque eso quedó resuelto antes de que este artículo existiera. Es por qué un endpoint de 2023 todavía tiene 3,500 apariciones en una clasificación donde un modelo de cinco días tiene 1,674, y qué te dice eso sobre la migración que se te pide considerar.

El marcador, y la única fila donde gana OpenAI

Cinco dimensiones deciden este enfrentamiento, y vale la pena leer ambos lados de cada una una al lado de la otra.

• Preferencia a ciegas, voces de proveedores — Eleven v4 puesto 1, Elo 1.319 (±19, 1.674 apariciones) vs. TTS-1 HD puesto 35, Elo 1.104 (±12, 3.500 apariciones). Una diferencia de 216 puntos que se mantiene incluso con los márgenes de error.

• Precio de tabla, por millón de caracteres — Eleven v4 $80.00 vs TTS-1 HD $30.00. OpenAI es 62% más barato a precio de lista, y aún más barato durante la promoción de ElevenLabs.

• Voces — Eleven v4 documenta la clonación instantánea a partir de diez segundos de audio más un nivel de clonación profesional; TTS-1 HD incluye un conjunto fijo de voces, nueve para la familia tts-1 en la documentación propia de OpenAI (alloy, ash, coral, echo, fable, onyx, nova, sage, shimmer) y no admite clonación.

• Dirección de interpretación — Eleven v4 documenta etiquetas de audio en línea y prompts de dirección en lenguaje natural; TTS-1 HD acepta texto sin formato, y el parámetro steerable-instructions de OpenAI pertenece a su modelo TTS más reciente, no a este.

• Fecha de lanzamiento — Eleven v4 el 28 de septiembre de 2026 vs TTS-1 HD el 6 de noviembre de 2023.

A generated scoreboard comparing ElevenLabs Eleven v4 and OpenAI TTS-1 HD across six dimensions: Provider Voice rank and Elo (1 / 1,319 against 35 / 1,104), samples (1,674 with an interval of plus or minus 19 against 3,500 with plus or minus 12), board price ($80.00 against $30.00 per 1M characters), rate card ($0.022 per 1K characters until October 12 against $30.00 per 1M at list), voices (cloning from 10 s of audio plus a professional tier against nine fixed presets) and direction (inline audio tags against plain text only). Footer: 'Ranks, Elo and board prices per Artificial Analysis; voice set, list price and capabilities vendor-documented.' The OrcaRouter logo sits in the bottom-right corner.

El precio es la fila que gana OpenAI, y es una victoria más grande de lo que parece, porque la promoción de ElevenLabs es temporal. A $0,022 por cada 1.000 caracteres, Eleven v4 cuesta $22 por millón hasta el 12 de octubre, más barato que TTS-1 HD directamente. Después del 12 de octubre cuesta $80 por millón frente a los $30 de OpenAI, y se queda ahí.

Por qué un modelo de 2023 tiene el doble de muestras

Ese número es lo más útil de este tablero y es fácil malinterpretarlo. Las apariciones en Arena se acumulan con el tráfico, y el tráfico se acumula con integraciones que se construyeron una vez y nunca se volvieron a revisar. TTS-1 HD tiene 3.500 apariciones a sus espaldas porque ha sido el endpoint de voz predeterminado para todos los equipos que ya llaman a OpenAI para chat completions: la misma clave, el mismo SDK, la misma línea de facturación, una llamada más. Nada en esa frase tiene que ver con la calidad de voz, y el déficit de 216 puntos no lo detuvo.

A screenshot of Artificial Analysis' TTS-1 HD model page, titled TTS-1 HD Quality Elo, Speed & Price Analysis, credited to OpenAI and the OpenAI TTS family with an Elo of 1,103.83. The Provider Voice Arena Preference Elo bar chart runs from Eleven v4 at 1,319 at the left through Gemini 3.8 Flash TTS, Simba 3.2, Eleven v3 and Gemini 3.8 Flash-Lite TTS to TTS-1 HD at 1,104 at the right, with the model selector reading '28 of 96 models'.

Esto es lo que parece la deuda de migración en una tabla de clasificación. No es una señal de que el modelo más antiguo sea competitivo; es una señal de que cambiar cuesta algo, y de que un gran número de equipos ha decidido que ese algo vale más que 216 puntos Elo. Es una conclusión legítima para un informe de notificaciones y una mala conclusión para un producto en el que la voz es lo que oye el cliente.

El argumento a favor de permanecer en TTS-1 HD

Tres cosas lo mantienen defendible, y ninguna de ellas es la calidad.

El determinismo es lo primero. Un conjunto fijo de nueve voces produce una salida consistente entre versiones de una manera que un pipeline de clonación no, y una salida consistente es lo que quieres en una vía utilitaria donde nadie está escuchando en busca de arte. No hay ningún clon que pueda desviarse, ni una muestra de referencia que regrabar, ni un artefacto de consentimiento que mantener.

El costo de integración es el segundo, y es el que la arena no puede ponerle precio. Añadir un segundo proveedor de voz significa una nueva cuenta, una nueva lista de precios, un nuevo modo de fallo y una nueva cosa que monitorear. Para un equipo que ya está dentro del stack de OpenAI, eso es tiempo real de ingeniería, y 216 puntos Elo no lo pagan.

El volumen de gama baja es el tercero. A $30 por millón de caracteres, la factura mensual completa de voz de un producto pequeño es un error de redondeo, y no hay nada que optimizar. Este es el régimen donde la respuesta barata y la respuesta perezosa son la misma respuesta, y eso está bien.

Los argumentos a favor de mudarse y el contraargumento correspondiente

Cambia cuando la voz esté orientada al cliente. La clonación en diez segundos, la dirección de interpretación en línea, más de 90 idiomas y un límite de entrada de 10.000 caracteres por solicitud no son diferencias cosméticas frente a un conjunto fijo de nueve voces de 2023, y la brecha de 216 puntos de la arena es la versión comprimida de una brecha de capacidad mucho mayor. Si estás construyendo un agente, un asistente de marca o cualquier cosa en la que un oyente se forme una opinión de tu producto en la primera frase, el endpoint más antiguo es la opción predeterminada incorrecta.

El contraargumento es que «cambiar a Eleven v4» no es la única opción. OpenAI ha lanzado desde entonces un modelo TTS más nuevo con un parámetro de instrucciones dirigibles, y Gemini 3.8 Flash TTS de Google ocupa el tercer puesto en la misma tabla con 1.267 y un precio normalizado de 16,49 $ por millón — una ganancia de 163 puntos sobre TTS-1 HD a aproximadamente la mitad del precio de la tabla. Si tu limitación es permanecer dentro de tu proveedor actual, esa es la actualización más barata. Si es permanecer dentro de tu nube actual, es la única.

Dónde se sitúa realmente OrcaRouter en esta comparación

This is the rare article in this series where we host one of the two models, so let us be precise about which. openai/tts-1-hd is live in the OrcaRouter catalogue at OpenAI's list rate passed through at 0% markup: $30 per million, model ID openai/tts-1-hd, served on the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1 with a POST /v1/audio/speech route and the voice, speed and response_format parameters. Our own page reports a median latency of 2,461 ms and a 95th percentile of 4,769 ms, which is the honest reason not to put it in front of a live conversation — that is a batch-shaped number, not an agent-shaped one.

A screenshot of the OrcaRouter model page for openai/tts-1-hd. The header shows the model ID openai/tts-1-hd with Audio and JSON tags, the description 'OpenAI's high-definition text-to-speech model, accessed via OrcaRouter's API at $30 per 1M tokens (zero markup)', and the endpoint /v1/audio/speech. Stat tiles read $30.00 per 1M characters, p50 TTFT 2.46 s, p95 TTFT 4.77 s and traffic of 1.5K characters over 7 days. Supported parameters are response_format, speed and voice, the OpenAI-compatible base URL is https://api.orcarouter.ai/v1, and the pricing panel states 'This model is not billed per token. The rate above is the unit it actually meters, and it is what settlement charges.'

ElevenLabs Eleven v4 no está en nuestro catálogo y no hay nada que llamar a través de nosotros: se accede a él mediante la propia API de ElevenLabs, con la propia tarifa de ElevenLabs. Lo que cambia una sola clave es la forma de la migración. Si la razón por la que no has probado al nuevo líder es que implica una segunda integración de proveedor, el coste de averiguarlo es una sola llamada a la API con una clave que ya tienes, en lugar de un ciclo de adquisición. Los precios de lista de los proveedores se repercuten con un 0 % de margen, por lo que un cambio de precio de un proveedor —incluida la reversión del 12 de octubre de ElevenLabs— está activo en nuestro lado el mismo día en que ocurre, y conmutación por error automáticasignifica que una vía de voz en evaluación no tiene que convertirse en una dependencia de producción mientras decides.

La aritmética que debería zanjarlo

Cinco millones de caracteres al mes, lo que constituye un producto de tamaño medio y aproximadamente 100 horas de voz. TTS-1 HD cuesta $150. Eleven v4 cuesta $110 durante la ventana promocional y $400 después del 12 de octubre. Gemini 3.8 Flash TTS, con la normalización del consejo, cuesta alrededor de $82.50.

Lee de nuevo esos cuatro números y la decisión se divide con claridad. Durante la ventana, el modelo más nuevo y mejor clasificado de la tabla es también el segundo más barato — más barato que el endpoint de 2023 al que supera por 216 puntos Elo. Después del 12 de octubre es la opción más cara de la lista por un factor de casi cinco. Nada de los modelos cambia en esa fecha; solo lo hace la factura.

Así que: si estás evaluando este mes, evalúa con la tarifa promocional y escribe la tarifa de lista en el caso de negocio. Si vas a lanzar el próximo trimestre, planifica a partir de $0.08 por 1000 caracteres y trata cualquier comparación que cite $0.022 como un documento con fecha de caducidad impresa. Y si usas TTS-1 HD y la razón honesta es la inercia de integración, el primer paso útil no es un plan de migración: es una única prueba A/B con tus propios scripts, a la tarifa que realmente estarás pagando en noviembre.